跳到正文

全部动态

今日 9 条
9月30日周三
9月29日周二
  1. Simon Willison · AI Weblog88

    OpenAI DevDay 2026 实录:发布 Dots 智能体、GPT-6.1 Sol 与 Ultrafast 推理

    OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。

    推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。

  2. TensorRT-LLM Releases62

    TensorRT-LLM 发布 v1.3.0rc29,新增 Qwen3.5 FP8 与 Kimi K3 NVFP4 MoE 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。

    推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。

  3. OpenAI News82

    OpenAI DevDay 2026 回顾:发布 GPT-6 Astra 及 20 余项更新

    OpenAI 在 DevDay 2026 上公布超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。官方回顾页面汇总了这些更新,涉及模型、编程工具与 API 等多个方向。开发者可通过 OpenAI 官方页面查看完整发布清单与详情。

    推荐理由:OpenAI DevDay 2026 集中发布 GPT-6 Astra 及 ChatGPT、Codex、API 等 20 余项更新,可了解其开发者生态与工具链走向。

  4. Latent Space82

    AINews 汇总:Claude Opus 5.5 领跑 SimpleBench,GPT-6 与 Gemini 3.8 Flash 同期发布

    Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。

    推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。

  5. Simon Willison · AI Weblog82

    Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上

    Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。

    推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。

  6. Simon Willison · AI Weblog22

    OpenAI 智能体安全负责人谈 AI 能力突跳带来的安全挑战

    OpenAI 智能体安全(Agent Security)负责人 @joedaroo 表示,模型在“cyber”“swarming”“message boards”等相关能力上出现的能力突跳令其团队感到意外,且这种跳变速度极快,构成了极难应对的问题。他强调安全态势需要时间积累,不只是加固系统,还要把安全文化植入公司,让人员、流程与事件响应机制本身具备应对意外的韧性。

9月26日周六
9月25日周五
  1. Ollama Releases67

    Ollama v0.40.0-rc0 发布,Apple Silicon 默认启用 MLX 运行时

    Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。

    推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。

  2. GitHub Blog · AI & ML38

    GitHub 博文:当聊天是错误 UI 时,用 GitHub Copilot canvas 替代对话框

    GitHub 博文提出,聊天框并非与 LLM 交互的最佳界面,多数任务更适合可定制 UI。GitHub Copilot app 中的 canvas 是运行在应用内的全栈小程序,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免把 agent 本身当工具而浪费 token。

  3. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试流程

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。

    推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。

9月24日周四
  1. NVIDIA Technical Blog62

    NVIDIA 联合 Google DeepMind 开源 2800 余种病毒蛋白复合物预测结构

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。

    推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。

9月23日周三
  1. TensorRT-LLM Releases62

    TensorRT-LLM 发布 v1.3.0rc28,默认启用 KV-cache manager V2

    NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。

    推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。

9月22日周二
  1. vLLM Releases88

    vLLM v0.30.0 发布,新增 Fast Start 权重缓存与 HiSparse 主机分层

    vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。

    推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。

9月19日周六
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub 播客拆解五大 AI 热门观点:代码审查、RAG、Skills 与 MCP

    GitHub 播客最新一期拆解了五个 AI 热门观点:AI 生成代码仍需审查、Skills 并未取代 MCP、RAG 也未消亡、企业招聘更看重 AI 使用判断力、微调需求未必说明代码质量差。节目指出 MCP 提供工具与数据的标准接入方式,Skills 则以 Markdown 封装团队流程与最佳实践,二者可组合使用;RAG 通过检索外部信息减少 token 消耗并降低答案不完整的概率。

  2. TensorRT-LLM Releases62

    TensorRT-LLM v1.3.0rc27 发布,新增 MiniMax-H3 与 Nemotron 3.5 Super VL 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。

    推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。

9月17日周四
9月12日周六
9月9日周三
  1. TensorRT-LLM Releases62

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 与 NVFP4 KV cache 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。

    推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。

9月5日周六
  1. SGLang Releases82

    SGLang v0.5.19 发布,新增 beam search 与 DeepEP v2 后端

    SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。

    推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。

8月31日周一
8月25日周二
8月11日周二
7月29日周三
  1. Berkeley AI Research (BAIR)71

    K-Search 扩展 MLX 后端:将 CUDA 内核经验迁移至 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。

    推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。

7月26日周日
  1. Berkeley AI Research (BAIR)62

    BAIR 提出 ABBEL:用自然语言信念状态实现高效长程交互

    BAIR 提出 ABBEL 框架,将递归摘要的内容隔离为自然语言信念状态并周期性更新,使智能体仅以当前信念作为工作上下文。在 CollabBench 协作编码任务中,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也低于全上下文设置。

    推荐理由:该框架将摘要内容隔离为自然语言信念状态并加以监督,在协作编码任务中把与全上下文模型的差距缩小约一半。

7月25日周六
  1. SGLang Releases78

    SGLang v0.5.16 发布,新增 DSpark 投机解码与 Inkling 模型支持

    SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。

    推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。

7月14日周二
7月11日周六
7月7日周二