SGLang v0.5.21 发布,前缀缓存默认切换 Rust 核心并支持 PD 运行时角色切换
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
vLLM 发布 v0.31.0rc4,针对 HiSparse 场景修复了 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版(rc),主要聚焦上述 Bugfix,未披露其他功能改动或性能数据。
MIT 的 Alex Zhang 在 Latent Space 播客中讲述其从 GPU kernel、KernelBench 到递归语言模型(RLM)的研究路径,RLM 驱动的 harness 曾率先接近解决 ARC-AGI-3。
OpenAI 发布 GPT-6 Astra Ultrafast,运行于 NVIDIA Blackwell GPU,现已上线 OpenAI API 并向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 新模型在 NVIDIA Blackwell 上通过推理优化实现最高 8 倍 token 生成加速,面向编码智能体等时延敏感场景。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件有效使用寿命与 token 需求广度。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量超 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 与 Nick Hill 共同参与,从 commit e5e38ba cherry-pick 而来。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
vLLM 发布 v0.31.0rc2,针对 Mamba 模型修复了稀疏注意力场景下 prompt 末尾 prefill checkpoint 的保留问题。该版本为候选发布版,具体性能指标与获取方式需参见 vLLM 官方仓库。
NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。
推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。
Ollama 发布 v0.34.4,思考模型的结构化输出改为单次处理,速度更快、更可靠。该版本修复了本地模型库较大时偶发的“model not found”错误。
vLLM 发布 v0.30.1rc0,在 ROCm 平台新增 MI355 密集 NVFP4 支持及 MoRI kernel 镜像。该版本由 Andreas Karatzas 提交,OpenAI Codex 参与共同署名,相关改动已合入 CI 流程。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。
推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。
SGLang 发布 v0.5.20,合并 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next 等模型支持,并引入统一基数树分支点缓存、采样掩码与 CPU 模拟器。
推荐理由:该版本通过统一基数树分支点缓存与采样掩码重叠调度,在长上下文与RL rollout场景下显著降低TTFT并提升解码吞吐。
NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。
推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。
NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。
推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。
SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。
推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。
NVIDIA TensorRT-LLM 发布 v1.3.0rc25,将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite。
推荐理由:KV cache manager V2 默认启用并扩展 DSA、零拷贝 token 传递与分布式池重平衡,同时新增多款模型与视觉生成支持。
SGLang 发布 v0.5.18,包含 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3 等模型支持。
推荐理由:该版本通过启动阶段权重加载与 CUDA graph 捕获重叠、TP LMHead all-to-all 等改动,缩短了服务冷启动与解码延迟。
SGLang 发布 v0.5.17,包含 194 位贡献者的 582 个 PR,新增 Kimi K3 与 MiniMax-H3 的 day-0 支持,并引入 Rust 前端与 DCP 通信后端。
推荐理由:该版本为 Kimi K3 与 MiniMax-H3 提供 day-0 推理支持,并新增 DWDP MoE 预填充并行与权重加载优化,可显著降低大模型部署的显存与加载开销。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化式内核搜索框架,新增 MLX 后端与结构化 CUDA-to-MLX 翻译层,可将现有 CUDA 内核知识自动适配为 Apple Silicon 内核。
推荐理由:通过结构化 CUDA 到 MLX 翻译层,让演化式内核搜索在 Apple Silicon 上逼近专家级性能,为跨硬件内核迁移提供可复用路径。
SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。
推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。
SGLang 发布 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 进行修复。此次更新解决了非 CUDA/HIP 设备上的 DSA 模型启动、CUDA 12 镜像的 flashinfer 依赖、长输入下 flashinfer trtllm FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 IndexShare 在 PD 分离和上下文并行设置下的问题。
SGLang 发布 v0.5.15,针对 Blackwell 平台调优 GLM-5.2 NVFP4 生产推理,并默认启用 Spec V2 零开销调度与 Breakable CUDA Graph 捕获路径。
推荐理由:该版本针对 GLM-5.2 NVFP4 与 DeepSeek-V4 优化生产推理,并默认启用 Spec V2 与 Breakable CUDA Graph,降低调度与内核启动开销。
SGLang 发布 v0.5.14,新增 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、Poolside Laguna-M.1、DiffusionGemma、Zyphra ZAYA1、MiMo-V2-ASR 等模型支持,并加入 Waterfill 与 LPLB 两种 MoE 专家并行负载均衡方法。
推荐理由:该版本新增多种模型支持与 MoE 负载均衡、线性注意力前缀缓存优化,并针对 DeepSeek-V4 在 Blackwell 上给出多项吞吐与显存改进。
BAIR 发布综述文章,系统梳理自适应并行推理(APR)这一范式,即让模型在推理时自行决定何时并行、开启多少线程以及如何协调。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法,指出 APR 相比 BoN 可避免冗余计算、相比 Tree-of-Thoughts 无需领域特定分解启发式,并给出以关键路径占比为核心的并行化奖励设计。
推荐理由:系统梳理自适应并行推理的推理系统设计与训练奖励方案,对比 Multiverse 与 ThreadWeaver 在 KV cache 聚合上的取舍。