跳到正文

#SGLang

今日 1 条
今天10月3日周六
9月19日周六
9月5日周六
  1. SGLang Releases82

    SGLang v0.5.19 发布,新增 beam search 与 DeepEP v2 后端

    SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。

    推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。

8月25日周二
8月11日周二
7月25日周六
  1. SGLang Releases78

    SGLang v0.5.16 发布,新增 DSpark 投机解码与 Inkling 模型支持

    SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。

    推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。

7月14日周二
7月11日周六
6月27日周六
  1. SGLang Releases78

    SGLang v0.5.14 发布,新增 GLM-5.2 等模型支持与 MoE 负载均衡

    SGLang 发布 v0.5.14,新增 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、Poolside Laguna-M.1、DiffusionGemma、Zyphra ZAYA1、MiMo-V2-ASR 等模型支持,并加入 Waterfill 与 LPLB 两种 MoE 专家并行负载均衡方法。

    推荐理由:该版本新增多种模型支持与 MoE 负载均衡、线性注意力前缀缓存优化,并针对 DeepSeek-V4 在 Blackwell 上给出多项吞吐与显存改进。

5月8日周五
  1. Berkeley AI Research (BAIR)62

    BAIR 综述自适应并行推理:从固定并行到模型自主控制流

    BAIR 发布综述文章,系统梳理自适应并行推理(APR)这一范式,即让模型在推理时自行决定何时并行、开启多少线程以及如何协调。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法,指出 APR 相比 BoN 可避免冗余计算、相比 Tree-of-Thoughts 无需领域特定分解启发式,并给出以关键路径占比为核心的并行化奖励设计。

    推荐理由:系统梳理自适应并行推理的推理系统设计与训练奖励方案,对比 Multiverse 与 ThreadWeaver 在 KV cache 聚合上的取舍。