SGLang v0.5.21 发布,前缀缓存默认切换 Rust 核心并支持 PD 运行时角色切换
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
OpenAI 发布 GPT-6 系列模型使用指南,面向初创团队讲解模型选型、推理强度调节、提示词与技能优化以及工具协同。该指南围绕将工作流部署到生产环境给出实践建议,但官方摘要未披露具体性能指标或版本参数。开发者可通过 OpenAI 官方页面获取完整指南内容。
NVIDIA 宣布本月起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出搭载 64GB 统一内存的 DGX Spark,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈。
推荐理由:64GB 统一内存版本把本地智能体推理门槛降到 4999 美元,双机集群可扩展至 200B 参数模型。
Black Forest Labs 发布 Flux 3 模型家族的图像部分 Flux 3 Image,支持多步编辑且不改变画面其他区域,覆盖文生图、图生图、文字渲染与照片级写实。
推荐理由:Flux 3 Image 支持多步局部编辑与最多十张参考图输入,为图像编辑与生成工作流提供了更细粒度的控制能力。
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
Google DeepMind 发布 Gemini 4 Argon,面向编程、企业知识工作与网络防御场景,目前仅通过 Fairwind Program 向政府用户和可信网络安全人员开放预览。
推荐理由:Gemini 4 Argon 在 19 项基准中拿下 13 项第一,并以 Long Decode Continuation 将输出上限推至 1M token,可观察长输出与智能体任务的成本结构变化。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
OpenAI 披露其阻断了一起针对受保护模型推理能力的协同蒸馏攻击活动。该活动试图提取模型推理内容,OpenAI 表示正在加强针对对抗性蒸馏的防御措施。官方未在摘要中说明具体技术细节、受影响模型或防御机制,相关信息需查阅原文链接 https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign。
OpenAI 在 DevDay 2026 上发布由 GPT-6 Astra 驱动的常驻智能体 Dots、GPT-6.1 Sol 模型以及 Ultrafast 加速模式,并推出 Decisions API、Codex 云环境与 B2B Marketplace。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 常驻智能体、GPT-6.1 Sol 与 Ultrafast 模式,并调整 API 定价与套餐倍率,可观察其平台化与成本策略。
Ollama 发布 v0.35.0,新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 接口返回选项、概率与分数而非文本。
推荐理由:Ollama 新增决策模型接口,以概率与置信度输出替代文本生成,可用于工单分流与模型路由等分类任务。
OpenAI 在 DevDay 2026 主题演讲中发布个人智能体 Dots、ChatGPT Space 协作空间,以及 GPT-6.1 Sol 模型和 Ultrafast 高速推理档位。
推荐理由:OpenAI DevDay 2026 集中发布 Dots 个人智能体、GPT-6.1 Sol 与 Ultrafast 推理档位,并开放 Sign in with ChatGPT 与插件生态,勾勒出智能体平台化的产品路径。
NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。
推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。
OpenAI 在 DevDay 2026 上公布超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。官方回顾页面汇总了这些更新,涉及模型、编程工具与 API 等多个方向。开发者可通过 OpenAI 官方页面查看完整发布清单与详情。
推荐理由:OpenAI DevDay 2026 集中发布 GPT-6 Astra 及 ChatGPT、Codex、API 等 20 余项更新,可了解其开发者生态与工具链走向。
Latent Space 的 AINews 汇总了本周前沿模型动态,包括 Anthropic 的 Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 以及小米 MiMo-V2.6-Pro。
推荐理由:汇总 Claude Opus 5.5、GPT-6 与 Gemini 3.8 Flash 等前沿模型的基准表现与定价,并梳理 Jev 决策模型与 Perplexity Photon 检索引擎的工程收益。
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,定价与 Sonnet 5 相同但在各项基准上均优于前代。官方称其运行速度提升 30% 以上,多数任务成本最多降低 30%,在部分编码任务上接近 Opus 5.5 的水平。该模型已用于 claude.ai 免费层,作者实测其免费额度可生成 WebGL 三维页面,Haiku 5.5 将在未来几周内推出。
推荐理由:Anthropic 新 Sonnet 在保持同价的同时实现速度与成本双降,并成为 claude.ai 免费层默认模型,影响开发者选型与免费额度能力对比。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
SGLang 发布 v0.5.20,合并 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next 等模型支持,并引入统一基数树分支点缓存、采样掩码与 CPU 模拟器。
推荐理由:该版本通过统一基数树分支点缓存与采样掩码重叠调度,在长上下文与RL rollout场景下显著降低TTFT并提升解码吞吐。