TensorRT
NVIDIA TensorRTTRT常用英伟达的推理加速库,把训练好的模型编译成在 GPU 上跑得更快的引擎
TensorRT 是英伟达的深度学习推理优化器和运行时。它读入 ONNX 等格式的模型,做层融合、选择最快的 GPU 算子、降低数值精度(FP16、INT8、FP8 等),生成针对某块 GPU 的推理「引擎」文件。机器人策略要在几十毫秒内出动作,直接用 PyTorch 往往太慢,用 TensorRT 编译后延迟通常能明显下降,所以它是 Jetson 和服务器端部署的常用环节。注意引擎和 GPU 型号、TensorRT 版本绑定,换设备要重新编译;大语言模型另有专门的 TensorRT-LLM。
例子把训练好的扩散策略导出成 ONNX,再用 trtexec 编译成 FP16 引擎,在 Jetson Orin 上降低单步推理延迟。
- 也叫
- TRT
- 相关
- ONNX、TensorRT-LLM、推理延迟、训练后量化、JetPack、推理部署
- 来源
- NVIDIA TensorRT
- 信息截至
- 2025-09