跳到正文

#工程工具

今日 3 条
今天10月3日周六
  1. Ollama Releases62

    Ollama v0.35.1 发布,支持 Cloudflare Clef 决策模型与多模态输入

    Ollama 发布 v0.35.1,通过 /v1/systemone 接口支持 Cloudflare 新开源决策模型 Clef(27B)与 Clef Flash(9B),两者均为多模态,可在请求中同时传入图像与文本状态并联合评分。

    推荐理由:Ollama 新增 Cloudflare 开源决策模型支持与多模态图像输入,并扩展联网搜索次数与 Modelfile 能力声明。

10月2日周五
10月1日周四
9月30日周三
9月29日周二
  1. TensorRT-LLM Releases62

    TensorRT-LLM 发布 v1.3.0rc29,新增 Qwen3.5 FP8 与 Kimi K3 NVFP4 MoE 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc29,为 Qwen3.5 全局 FP8 检查点、Kimi K3 NVFP4 SiTU 的 CuTeDSL MoE 后端以及 DeepSeek V4 的 NVFP4 MLA 残差开关提供支持。

    推荐理由:该版本为 Qwen3.5、Kimi K3、DeepSeek V4 等模型补齐 FP8/NVFP4 量化与 MLA 推理路径,并移除 AutoDeploy 等破坏性接口。

9月25日周五
  1. Ollama Releases67

    Ollama v0.40.0-rc0 发布,Apple Silicon 默认启用 MLX 运行时

    Ollama 发布 v0.40.0-rc0 预发布版本,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 执行。该版本通过 ollama pull qwen3.8 与 ollama run qwen3.8 即可拉取并运行对应模型,预发布期间还将测试并启用更多模型。

    推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,为本地模型推理提供新的执行后端路径。

  2. GitHub Blog · AI & ML38

    GitHub 博文:当聊天是错误 UI 时,用 GitHub Copilot canvas 替代对话框

    GitHub 博文提出,聊天框并非与 LLM 交互的最佳界面,多数任务更适合可定制 UI。GitHub Copilot app 中的 canvas 是运行在应用内的全栈小程序,可与 agent 双向通信、调用第三方 API 并在本地执行代码,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免把 agent 本身当工具而浪费 token。

  3. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试流程

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++ 并分诊崩溃。

    推荐理由:该流水线把 harness 编写、覆盖率分析与崩溃分诊交给 LLM 智能体,并保留工具执行与决策的职责分离。

9月24日周四
9月23日周三
  1. TensorRT-LLM Releases62

    TensorRT-LLM 发布 v1.3.0rc28,默认启用 KV-cache manager V2

    NVIDIA TensorRT-LLM 发布 v1.3.0rc28,为 Llama、Llama4 及 Nemotron 多模态模型默认启用 KV-cache manager V2,并移除 TensorRT serve、evaluation、benchmark 等废弃路径。

    推荐理由:该版本为 Llama、Llama4 与 Nemotron 多模态模型默认启用 KV-cache manager V2,并新增 FP8 KV-cache 与 NCCL-EP 0.2 低延迟专家并行支持。

9月22日周二
  1. vLLM Releases88

    vLLM v0.30.0 发布,新增 Fast Start 权重缓存与 HiSparse 主机分层

    vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交,新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存守护进程与 HiSparse 主机分层解码。

    推荐理由:该版本新增 Fast Start 权重缓存与 HiSparse 主机分层,并针对 DeepSeek-V4.1、Kimi K3 等模型优化稀疏注意力与量化内核,可降低重启与显存开销。

9月19日周六
9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub 播客拆解五大 AI 热门观点:代码审查、RAG、Skills 与 MCP

    GitHub 播客最新一期拆解了五个 AI 热门观点:AI 生成代码仍需审查、Skills 并未取代 MCP、RAG 也未消亡、企业招聘更看重 AI 使用判断力、微调需求未必说明代码质量差。节目指出 MCP 提供工具与数据的标准接入方式,Skills 则以 Markdown 封装团队流程与最佳实践,二者可组合使用;RAG 通过检索外部信息减少 token 消耗并降低答案不完整的概率。

  2. TensorRT-LLM Releases62

    TensorRT-LLM v1.3.0rc27 发布,新增 MiniMax-H3 与 Nemotron 3.5 Super VL 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc27,新增 MiniMax-H3 文生视频与首尾帧生视频支持、Nemotron 3.5 Super VL 多模态服务路径以及 Cosmos3 Edge Policy DROID 机器人策略支持。

    推荐理由:该版本新增 MiniMax-H3、Nemotron 3.5 Super VL 等多模态模型支持与 cuDNN 注意力后端,并修复多项多 GPU 推理精度与挂起问题。

9月17日周四
9月12日周六
9月9日周三
  1. TensorRT-LLM Releases62

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 与 NVFP4 KV cache 支持

    NVIDIA TensorRT-LLM 发布 v1.3.0rc26,新增 Rubin SM107 的 GEMM、MoE 与 CuTe DSL 支持,并加入 DeepSeek-V4 Hopper、Qwen3.8-Flash-Next、Kimi K3 on B200 等模型支持。

    推荐理由:该版本为 Rubin SM107 与 Blackwell 平台补齐 GEMM、MoE 与 CuTe DSL 支持,并新增 NVFP4 KV cache 与流水线化 KV 传输,适合关注新硬件适配与推理吞吐的部署方评估。

9月5日周六
  1. SGLang Releases82

    SGLang v0.5.19 发布,新增 beam search 与 DeepEP v2 后端

    SGLang 发布 v0.5.19,合并 786 个 PR、来自 214 位贡献者,新增 Qwen3.8、Ling-3.0、Spark2.5、Granite 4.2 等模型支持,并引入 beam search 与 DeepEP v2 ElasticBuffer MoE 后端。

    推荐理由:该版本新增 beam search 与 DeepEP v2 弹性缓冲后端,并在 AMD、Hopper 与 Blackwell 上给出多项可量化的推理吞吐与延迟收益。

8月31日周一
8月25日周二
8月11日周二
7月25日周六
  1. SGLang Releases78

    SGLang v0.5.16 发布,新增 DSpark 投机解码与 Inkling 模型支持

    SGLang 发布 v0.5.16,合并 574 个 PR,新增置信度驱动的 DSpark 投机解码算法、975B 参数多模态 MoE 模型 Inkling 支持,以及 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型。

    推荐理由:该版本引入置信度驱动的投机解码算法与多款新模型支持,并显著压缩 KV 缓存与投机显存占用,适合高吞吐推理部署参考。

7月14日周二
7月11日周六
6月27日周六
  1. SGLang Releases78

    SGLang v0.5.14 发布,新增 GLM-5.2 等模型支持与 MoE 负载均衡

    SGLang 发布 v0.5.14,新增 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、Poolside Laguna-M.1、DiffusionGemma、Zyphra ZAYA1、MiMo-V2-ASR 等模型支持,并加入 Waterfill 与 LPLB 两种 MoE 专家并行负载均衡方法。

    推荐理由:该版本新增多种模型支持与 MoE 负载均衡、线性注意力前缀缓存优化,并针对 DeepSeek-V4 在 Blackwell 上给出多项吞吐与显存改进。