vLLM v0.31.0 在依赖中为 Transformers 版本添加上限
vLLM 发布 v0.31.0,在 requirements 中为 Transformers 添加版本上限,由 Isotr0py 提交、Harry Mellor 共同署名,并从 commit 58b3298 cherry-pick。该改动通过限制依赖版本范围,避免因 Transformers 版本过新导致的兼容性问题。
vLLM 发布 v0.31.0,在 requirements 中为 Transformers 添加版本上限,由 Isotr0py 提交、Harry Mellor 共同署名,并从 commit 58b3298 cherry-pick。该改动通过限制依赖版本范围,避免因 Transformers 版本过新导致的兼容性问题。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 添加版本上限。该改动由 Isotr0py 提交、Harry Mellor 共同署名,属杂项修复,用于约束依赖版本范围。
NVIDIA 宣布本月起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出搭载 64GB 统一内存的 DGX Spark,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈。
推荐理由:64GB 统一内存版本把本地智能体推理门槛降到 4999 美元,双机集群可扩展至 200B 参数模型。
vLLM 发布 v0.31.0rc4,针对 HiSparse 场景修复了 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版(rc),主要聚焦上述 Bugfix,未披露其他功能改动或性能数据。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 与 Nick Hill 共同参与,从 commit e5e38ba cherry-pick 而来。
vLLM 发布 vllm-proto 0.4.0,对应标签 proto-v0.4.0(提交 f28a508),该标签已通过提交者签名验证。发布页面提供 2 个资源文件供下载。
vLLM 发布 v0.31.0rc2,针对 Mamba 模型修复了稀疏注意力场景下 prompt 末尾 prefill checkpoint 的保留问题。该版本为候选发布版,具体性能指标与获取方式需参见 vLLM 官方仓库。
vLLM 发布 v0.30.1rc0,在 ROCm 平台新增 MI355 密集 NVFP4 支持及 MoRI kernel 镜像。该版本由 Andreas Karatzas 提交,OpenAI Codex 参与共同署名,相关改动已合入 CI 流程。
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。
推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。
vLLM 发布 v0.30.0rc2,主要修复 NIXL 后端中仅用于通知的请求仍会生成接收报告的问题。该改动避免通知类请求触发多余的接收报告,属于 Bugfix 性质的补丁版本。
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,覆盖 DeepSeek-R1 与 Qwen3-VL 两项基准。
推荐理由:Vera Rubin NVL72 首次 MLPerf Inference 提交在 Qwen3-VL 上吞吐达 GB300 NVL72 的 3.7 倍,并展示 288 GPU 近线性扩展效率。