跳到正文
原文
TensorRT-LLM Releases· mikeiovine·· 2026-08-01精选AI 评分62

TensorRT-LLM 发布 v1.3.0rc23,新增 MiniMax-M3 稀疏注意力后端与 KV cache 压缩集成

v1.3.0rc23

AI 导读

NVIDIA TensorRT-LLM 发布 v1.3.0rc23,新增 MiniMax-M3 MSA 稀疏注意力后端、KV cache 压缩运行时集成以及 DeepSeek V4 混合精度 NVFP4 检查点加载支持。

推荐理由

该版本新增 MiniMax-M3 稀疏注意力后端与 KV cache 压缩运行时集成,并扩展 DeepSeek-V4 混合精度 NVFP4 检查点加载支持。

来源:TensorRT-LLM Releases · github.com