跳到正文

#量化/微调

今日 1 条
今天10月3日周六
9月30日周三
9月29日周二
  1. TensorRT-LLM Releases62

    TensorRT-LLM 发布 v1.3.0rc29,新增 Qwen3.5 FP8 与 Kimi K3 NVFP4 MoE 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。

    推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。

9月24日周四
9月23日周三
9月22日周二
  1. vLLM Releases88

    vLLM v0.30.0 发布,新增 Fast Start 权重缓存与 HiSparse 主机分层

    vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。

    推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。

9月19日周六
9月18日周五
  1. TensorRT-LLM Releases62

    TensorRT-LLM v1.3.0rc27 发布,新增 MiniMax-H3 与 Nemotron 3.5 Super VL 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。

    推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。

9月14日周一
9月9日周三
  1. TensorRT-LLM Releases62

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 与 NVFP4 KV cache 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。

    推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。

9月5日周六
  1. SGLang Releases82

    SGLang v0.5.19 发布,新增 beam search 与 DeepEP v2 后端

    SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。

    推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。

8月31日周一
8月25日周二
8月11日周二
7月25日周六
  1. SGLang Releases78

    SGLang v0.5.16 发布,新增 DSpark 投机解码与 Inkling 模型支持

    SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。

    推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。

7月11日周六
6月27日周六
  1. SGLang Releases78

    SGLang v0.5.14 发布,新增 GLM-5.2 等模型支持与 MoE 负载均衡

    SGLang 发布 v0.5.14,新增 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、Poolside Laguna-M.1、DiffusionGemma、Zyphra ZAYA1、MiMo-V2-ASR 等模型支持,并加入 Waterfill 与 LPLB 两种 MoE 专家并行负载均衡方法。

    推荐理由:该版本新增多种模型支持与 MoE 负载均衡、线性注意力前缀缓存优化,并针对 DeepSeek-V4 在 Blackwell 上给出多项吞吐与显存改进。