TensorRT-LLM 发布 v1.3.0rc23,新增 MiniMax-M3 稀疏注意力后端与 KV cache 压缩集成
NVIDIA TensorRT-LLM 发布 v1.3.0rc23,新增 MiniMax-M3 MSA 稀疏注意力后端、KV cache 压缩运行时集成以及 DeepSeek V4 混合精度 NVFP4 检查点加载支持。
推荐理由:该版本新增 MiniMax-M3 稀疏注意力后端与 KV cache 压缩运行时集成,并扩展 DeepSeek-V4 混合精度 NVFP4 检查点加载支持。