TensorRT-LLM Releases· mikeiovine·· 2026-08-01精选AI 评分62
TensorRT-LLM 发布 v1.3.0rc23,新增 MiniMax-M3 稀疏注意力后端与 KV cache 压缩集成
v1.3.0rc23
AI 导读
NVIDIA TensorRT-LLM 发布 v1.3.0rc23,新增 MiniMax-M3 MSA 稀疏注意力后端、KV cache 压缩运行时集成以及 DeepSeek V4 混合精度 NVFP4 检查点加载支持。
推荐理由
该版本新增 MiniMax-M3 稀疏注意力后端与 KV cache 压缩运行时集成,并扩展 DeepSeek-V4 混合精度 NVFP4 检查点加载支持。
来源:TensorRT-LLM Releases · github.com