vLLM v0.31.0rc5 在依赖中为 Transformers 版本添加上限
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 添加版本上限。该改动由 Isotr0py 提交、Harry Mellor 共同署名,属杂项修复,用于约束依赖版本范围。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 添加版本上限。该改动由 Isotr0py 提交、Harry Mellor 共同署名,属杂项修复,用于约束依赖版本范围。
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
GitHub 博客指出,AI 正在改变开发者的工作方式,写代码仍属基本功,但定义问题、提供上下文、评估 AI 生成代码与做技术决策的能力愈发关键。
NVIDIA 宣布本月起由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出搭载 64GB 统一内存的 DGX Spark,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈。
推荐理由:64GB 统一内存版本把本地智能体推理门槛降到 4999 美元,双机集群可扩展至 200B 参数模型。
vLLM 发布 v0.31.0rc4,针对 HiSparse 场景修复了 FULL graphs 下 MTP 接受率崩溃的问题。该版本为候选发布版(rc),主要聚焦上述 Bugfix,未披露其他功能改动或性能数据。
Ollama 发布 v0.35.1-rc2 候选版本,该提交在 GitHub 上创建并通过签名验证。此版本主要修复了 CI 中缺失构建上下文的问题(#18742)。
Ollama 发布 v0.35.1-rc1,该版本在 models 模块新增 clef 支持(#18741)。提交 e4c0d18 已通过 GitHub 签名验证,具体性能指标与获取方式原文未披露。
vLLM 发布 v0.31.0rc3,为 Model Runner V2 加入随机化 dummy inputs 支持(#58411)。该改动由 Robert Shaw 提交,并经 Claude Opus 5.5 与 Nick Hill 共同参与,从 commit e5e38ba cherry-pick 而来。
CoreWeave 宣布在 CoreWeave Cloud 上提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网,并将面向 AI 智能体的 NVIDIA Vera CPU 引入其云平台,同时推出统一模型与智能体训练评估环境的 CoreWeave Forge。
推荐理由:CoreWeave 上线 Vera Rubin NVL72 与 Vera CPU,并给出 Devin 推理吞吐与智能体沙箱启动的实测数据,可供评估智能体生产部署的算力选型。
vLLM 发布 vllm-proto 0.4.0,对应标签 proto-v0.4.0(提交 f28a508),该标签已通过提交者签名验证。发布页面提供 2 个资源文件供下载。
vLLM 发布 v0.31.0rc2,针对 Mamba 模型修复了稀疏注意力场景下 prompt 末尾 prefill checkpoint 的保留问题。该版本为候选发布版,具体性能指标与获取方式需参见 vLLM 官方仓库。
Ollama 发布 v0.35.0,新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 接口返回选项、概率与分数而非文本。
推荐理由:Ollama 新增决策模型接口,以概率与置信度输出替代文本生成,可用于工单分流与模型路由等分类任务。
Ollama 发布 v0.35.1-rc0,为 Modelfile 新增 CAPABILITY 声明,并在 create 请求中加入可叠加的 capabilities 字段,该声明可在 GGUF 与 safetensors 的创建、继承及 Modelfile 导出过程中保留。
NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。
推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。
Ollama 发布 v0.35.0-rc1。该版本为 mlx 的拉取停滞重试设置上限,并允许看门狗中断这些重试(#1…)。版本已在 GitHub 打标签,提交 cc40693 通过签名验证。
Ollama 发布 v0.35.0-rc0,新增 System One 评分 API(#18606)。该版本为候选发布版,提交 ffb6f22 已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。
GitHub 博文提出,聊天框并非与 LLM 交互的最佳界面,多数任务更适合可定制 UI。GitHub Copilot app 中的 canvas 是运行在应用内的全栈小程序,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免把 agent 本身当工具而浪费 token。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。
Ollama 发布 v0.34.4,思考模型的结构化输出改为单次处理,速度更快、更可靠。该版本修复了本地模型库较大时偶发的“model not found”错误。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论对话带来的渲染压力。其测试的最大开源 PR 包含 2,200 个文件、超 100 万行改动和 400 多条行内评论,方案将文档高度拆分为确定性的代码几何与按需测量的动态块几何,避免滚动跳变。
vLLM 发布 v0.30.1rc0,在 ROCm 平台新增 MI355 密集 NVFP4 支持及 MoRI kernel 镜像。该版本由 Andreas Karatzas 提交,OpenAI Codex 参与共同署名,相关改动已合入 CI 流程。
NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。
推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。
推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。
SGLang 发布 v0.5.20,合并 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next 等模型支持,并引入统一基数树分支点缓存、采样掩码与 CPU 模拟器。
推荐理由:该版本通过统一基数树分支点缓存与采样掩码重叠调度,在长上下文与RL rollout场景下显著降低TTFT并提升解码吞吐。
vLLM 发布 v0.30.0rc2,主要修复 NIXL 后端中仅用于通知的请求仍会生成接收报告的问题。该改动避免通知类请求触发多余的接收报告,属于 Bugfix 性质的补丁版本。
GitHub 播客最新一期拆解了五个 AI 热门观点:AI 生成代码仍需审查、Skills 并未取代 MCP、RAG 也未消亡、企业招聘更看重 AI 使用判断力、微调需求未必说明代码质量差。节目指出 MCP 提供工具与数据的标准接入方式,Skills 则以 Markdown 封装团队流程与最佳实践,二者可组合使用;RAG 通过检索外部信息减少 token 消耗并降低答案不完整的概率。
NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。
推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。
GitHub 官方披露将 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,横跨 128 个 PR 并增量上线。
推荐理由:GitHub 官方复盘将 Copilot agent runtime 从 TypeScript 迁移到 80 万行 Rust 的工程路径,含跨语言 FFI 与多智能体协作细节。
GitHub 日本和韩国区营销负责人把活动运营流程写成 runbook 交给 GitHub Copilot,用对话方式生成自动化,让活动从单个 GitHub Issue 自动完成搭建、每日筛选报名者并在结束后清理。
NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。
推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。
SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。
推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。
NVIDIA TensorRT-LLM 发布 v1.3.0rc25,将 KV cache manager V2 设为 DeepSeek V3/R1/V3 Lite。
推荐理由:KV cache manager V2 默认启用并扩展 DSA、零拷贝 token 传递与分布式池重平衡,同时新增多款模型与视觉生成支持。
SGLang 发布 v0.5.18,包含 212 位贡献者的 710 个 PR,新增 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LTX-2.5、Cosmos3 等模型支持。
推荐理由:该版本通过启动阶段权重加载与 CUDA graph 捕获重叠、TP LMHead all-to-all 等改动,缩短了服务冷启动与解码延迟。
SGLang 发布 v0.5.17,包含 194 位贡献者的 582 个 PR,新增 Kimi K3 与 MiniMax-H3 的 day-0 支持,并引入 Rust 前端与 DCP 通信后端。
推荐理由:该版本为 Kimi K3 与 MiniMax-H3 提供 day-0 推理支持,并新增 DWDP MoE 预填充并行与权重加载优化,可显著降低大模型部署的显存与加载开销。
SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。
推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。
SGLang 发布 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 进行修复。此次更新解决了非 CUDA/HIP 设备上的 DSA 模型启动、CUDA 12 镜像的 flashinfer 依赖、长输入下 flashinfer trtllm FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 IndexShare 在 PD 分离和上下文并行设置下的问题。
SGLang 发布 v0.5.15,针对 Blackwell 平台调优 GLM-5.2 NVFP4 生产推理,并默认启用 Spec V2 零开销调度与 Breakable CUDA Graph 捕获路径。
推荐理由:该版本针对 GLM-5.2 NVFP4 与 DeepSeek-V4 优化生产推理,并默认启用 Spec V2 与 Breakable CUDA Graph,降低调度与内核启动开销。
SGLang 发布 v0.5.14,新增 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、Poolside Laguna-M.1、DiffusionGemma、Zyphra ZAYA1、MiMo-V2-ASR 等模型支持,并加入 Waterfill 与 LPLB 两种 MoE 专家并行负载均衡方法。
推荐理由:该版本新增多种模型支持与 MoE 负载均衡、线性注意力前缀缓存优化,并针对 DeepSeek-V4 在 Blackwell 上给出多项吞吐与显存改进。