SGLang v0.5.18 发布,新增 Muse Glimmer 等模型支持并优化启动与解码性能
SGLang 发布 v0.5.18,包含 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3 等模型支持。
推荐理由:该版本通过启动阶段权重加载与 CUDA graph 捕获重叠、TP LMHead all-to-all 等改动,缩短了服务冷启动与解码延迟。
SGLang 发布 v0.5.18,包含 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3 等模型支持。
推荐理由:该版本通过启动阶段权重加载与 CUDA graph 捕获重叠、TP LMHead all-to-all 等改动,缩短了服务冷启动与解码延迟。
SGLang 发布 v0.5.17,包含 194 位贡献者的 582 个 PR,新增 Kimi K3 与 MiniMax-H3 的 day-0 支持,并引入 Rust 前端与 DCP 通信后端。
推荐理由:该版本为 Kimi K3 与 MiniMax-H3 提供 day-0 推理支持,并新增 DWDP MoE 预填充并行与权重加载优化,可显著降低大模型部署的显存与加载开销。
SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。
推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。
SGLang 发布 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 进行修复。此次更新解决了非 CUDA/HIP 设备上的 DSA 模型启动、CUDA 12 镜像的 flashinfer 依赖、长输入下 flashinfer trtllm FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 IndexShare 在 PD 分离和上下文并行设置下的问题。
SGLang 发布 v0.5.15,针对 Blackwell 平台调优 GLM-5.2 NVFP4 生产推理,并默认启用 Spec V2 零开销调度与 Breakable CUDA Graph 捕获路径。
推荐理由:该版本针对 GLM-5.2 NVFP4 与 DeepSeek-V4 优化生产推理,并默认启用 Spec V2 与 Breakable CUDA Graph,降低调度与内核启动开销。
SGLang 发布 v0.5.14,新增 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、Poolside Laguna-M.1、DiffusionGemma、Zyphra ZAYA1、MiMo-V2-ASR 等模型支持,并加入 Waterfill 与 LPLB 两种 MoE 专家并行负载均衡方法。
推荐理由:该版本新增多种模型支持与 MoE 负载均衡、线性注意力前缀缓存优化,并针对 DeepSeek-V4 在 Blackwell 上给出多项吞吐与显存改进。