具身智能新手名词表English

TensorRT-LLM

NVIDIA TensorRT-LLM进阶

英伟达开源的大语言模型推理加速库,让 LLM 在英伟达 GPU 上跑得更快

TensorRT-LLM 是英伟达 2023 年开源的大语言模型推理库,基于 TensorRT 构建,提供 Python 接口。它把 LLM 推理里常用的优化打包好:KV 缓存(存下已算过的注意力键值,避免重复计算)分页管理、动态批处理、FP8/INT4 等量化、投机解码、多卡张量并行,以及为注意力等操作手写的高性能算子。用户只需加载 Hugging Face 等格式的模型权重,就能得到比原生 PyTorch 快得多的推理服务。在具身智能里,它常用于加速 VLA 的语言模型骨干或云端大脑服务。

例子在 H100 上用 TensorRT-LLM 以 FP8 精度部署 Llama 模型,作为机器人任务规划的云端服务。

也叫
TRT-LLM
相关
TensorRT、vLLM、KV 缓存、投机解码、训练后量化、推理部署
来源
NVIDIA/TensorRT-LLM (GitHub)
信息截至
2025

在完整名词表里查看 →