具身智能新手名词表English

TensorRT

NVIDIA TensorRTTRT常用

英伟达的推理加速库,把训练好的模型编译成在 GPU 上跑得更快的引擎

TensorRT 是英伟达的深度学习推理优化器和运行时。它读入 ONNX 等格式的模型,做层融合、选择最快的 GPU 算子、降低数值精度(FP16、INT8、FP8 等),生成针对某块 GPU 的推理「引擎」文件。机器人策略要在几十毫秒内出动作,直接用 PyTorch 往往太慢,用 TensorRT 编译后延迟通常能明显下降,所以它是 Jetson 和服务器端部署的常用环节。注意引擎和 GPU 型号、TensorRT 版本绑定,换设备要重新编译;大语言模型另有专门的 TensorRT-LLM。

例子把训练好的扩散策略导出成 ONNX,再用 trtexec 编译成 FP16 引擎,在 Jetson Orin 上降低单步推理延迟。

也叫
TRT
相关
ONNX、TensorRT-LLM、推理延迟、训练后量化、JetPack、推理部署
来源
NVIDIA TensorRT
信息截至
2025-09

在完整名词表里查看 →