SGLang v0.5.21 发布,前缀缓存默认切换 Rust 核心并支持 PD 运行时角色切换
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
OpenAI 发布 GPT-6 系列模型使用指南,面向初创团队讲解模型选型、推理强度调节、提示词与技能优化以及工具协同。该指南围绕将工作流部署到生产环境给出实践建议,但官方摘要未披露具体性能指标或版本参数。开发者可通过 OpenAI 官方页面获取完整指南内容。
NVIDIA 宣布本月起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出搭载 64GB 统一内存的 DGX Spark,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈。
推荐理由:64GB 统一内存版本把本地智能体推理门槛降到 4999 美元,双机集群可扩展至 200B 参数模型。
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
OpenAI 披露其阻断了一起针对受保护模型推理能力的协同蒸馏攻击活动。该活动试图提取模型推理内容,OpenAI 表示正在加强针对对抗性蒸馏的防御措施。官方未在摘要中说明具体技术细节、受影响模型或防御机制,相关信息需查阅原文链接 https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign。
Ollama 发布 v0.35.0,新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 接口返回选项、概率与分数而非文本。
推荐理由:Ollama 新增决策模型接口,以概率与置信度输出替代文本生成,可用于工单分流与模型路由等分类任务。
NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。
推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。
OpenAI 在 DevDay 2026 上公布超过 20 项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。官方回顾页面汇总了这些更新,涉及模型、编程工具与 API 等多个方向。开发者可通过 OpenAI 官方页面查看完整发布清单与详情。
推荐理由:OpenAI DevDay 2026 集中发布 GPT-6 Astra 及 ChatGPT、Codex、API 等 20 余项更新,可了解其开发者生态与工具链走向。
Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放 2800 余种病毒的蛋白复合物预测 3D 结构,其中约 30% 的蛋白相互作用此前未在 Protein Data Bank 中记录。
推荐理由:NVIDIA 联合 Google DeepMind 等机构开源 2800 余种病毒的蛋白复合物预测结构,并公开 GPU 加速的 BioNeMo 结构预测流程,为病毒研究与疫苗靶点设计提供可直接复用的结构数据与推理工具链。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。
推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。
SGLang 发布 v0.5.20,合并 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next 等模型支持,并引入统一基数树分支点缓存、采样掩码与 CPU 模拟器。
推荐理由:该版本通过统一基数树分支点缓存与采样掩码重叠调度,在长上下文与RL rollout场景下显著降低TTFT并提升解码吞吐。
NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。
推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。
GitHub 官方披露将 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,横跨 128 个 PR 并增量上线。
推荐理由:GitHub 官方复盘将 Copilot agent runtime 从 TypeScript 迁移到 80 万行 Rust 的工程路径,含跨语言 FFI 与多智能体协作细节。
NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。
推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。
SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。
推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。