TensorRT-LLM
NVIDIA TensorRT-LLM进阶英伟达开源的大语言模型推理加速库,让 LLM 在英伟达 GPU 上跑得更快
TensorRT-LLM 是英伟达 2023 年开源的大语言模型推理库,基于 TensorRT 构建,提供 Python 接口。它把 LLM 推理里常用的优化打包好:KV 缓存(存下已算过的注意力键值,避免重复计算)分页管理、动态批处理、FP8/INT4 等量化、投机解码、多卡张量并行,以及为注意力等操作手写的高性能算子。用户只需加载 Hugging Face 等格式的模型权重,就能得到比原生 PyTorch 快得多的推理服务。在具身智能里,它常用于加速 VLA 的语言模型骨干或云端大脑服务。
例子在 H100 上用 TensorRT-LLM 以 FP8 精度部署 Llama 模型,作为机器人任务规划的云端服务。
- 也叫
- TRT-LLM
- 相关
- TensorRT、vLLM、KV 缓存、投机解码、训练后量化、推理部署
- 来源
- NVIDIA/TensorRT-LLM (GitHub)
- 信息截至
- 2025