跳到正文

#本地部署

今日 3 条
今天10月3日周六
  1. Ollama Releases62

    Ollama v0.35.1 发布,支持 Cloudflare Clef 决策模型与多模态输入

    Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。

    推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。

10月2日周五
9月30日周三
9月29日周二
9月25日周五
  1. Ollama Releases67

    Ollama v0.40.0-rc0 发布,Apple Silicon 默认启用 MLX 运行时

    Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。

    推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。

9月24日周四
9月22日周二
  1. vLLM Releases88

    vLLM v0.30.0 发布,新增 Fast Start 权重缓存与 HiSparse 主机分层

    vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。

    推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。

9月19日周六
9月5日周六
  1. SGLang Releases82

    SGLang v0.5.19 发布,新增 beam search 与 DeepEP v2 后端

    SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。

    推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。

7月11日周六