vLLM v0.31.0rc5 在依赖中为 Transformers 版本添加上限
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 添加版本上限。该改动由 Isotr0py 提交、Harry Mellor 共同署名,属杂项修复,用于约束依赖版本范围。
vLLM 发布 v0.31.0rc5,在 requirements 中为 Transformers 添加版本上限。该改动由 Isotr0py 提交、Harry Mellor 共同署名,属杂项修复,用于约束依赖版本范围。
SGLang 发布 v0.5.21,合并 779 个 PR,新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6 等模型支持,并引入 /v1/decisions 与 /v1/score 接口。
推荐理由:该版本将前缀缓存切换为 Rust 核心并支持 PD 实例运行时角色切换,为高吞吐推理部署提供多项可量化性能收益。
Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。
推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。
Ollama 发布 v0.35.1-rc2 候选版本,该提交在 GitHub 上创建并通过签名验证。此版本主要修复了 CI 中缺失构建上下文的问题(#18742)。
Ollama 发布 v0.35.1-rc1,该版本在 models 模块新增 clef 支持(#18741)。提交 e4c0d18 已通过 GitHub 签名验证,具体性能指标与获取方式原文未披露。
Ollama 发布 v0.35.0,新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 接口返回选项、概率与分数而非文本。
推荐理由:Ollama 新增决策模型接口,以概率与置信度输出替代文本生成,可用于工单分流与模型路由等分类任务。
Ollama 发布 v0.35.1-rc0,为 Modelfile 新增 CAPABILITY 声明,并在 create 请求中加入可叠加的 capabilities 字段,该声明可在 GGUF 与 safetensors 的创建、继承及 Modelfile 导出过程中保留。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别并模糊照片中的人脸。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部处理在本地完成。
Ollama 发布 v0.35.0-rc1。该版本为 mlx 的拉取停滞重试设置上限,并允许看门狗中断这些重试(#1…)。版本已在 GitHub 打标签,提交 cc40693 通过签名验证。
Ollama 发布 v0.35.0-rc0,新增 System One 评分 API(#18606)。该版本为候选发布版,提交 ffb6f22 已通过 GitHub 签名验证。
Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。
推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。
Ollama 发布 v0.34.4,思考模型的结构化输出改为单次处理,速度更快、更可靠。该版本修复了本地模型库较大时偶发的“model not found”错误。
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。
推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。
SGLang 发布 v0.5.20,合并 713 个 PR,新增 GLM-5.3-Flash、Qwen3.8-Flash-Next 等模型支持,并引入统一基数树分支点缓存、采样掩码与 CPU 模拟器。
推荐理由:该版本通过统一基数树分支点缓存与采样掩码重叠调度,在长上下文与RL rollout场景下显著降低TTFT并提升解码吞吐。
SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。
推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。
SGLang 发布 v0.5.15,针对 Blackwell 平台调优 GLM-5.2 NVFP4 生产推理,并默认启用 Spec V2 零开销调度与 Breakable CUDA Graph 捕获路径。
推荐理由:该版本针对 GLM-5.2 NVFP4 与 DeepSeek-V4 优化生产推理,并默认启用 Spec V2 与 Breakable CUDA Graph,降低调度与内核启动开销。