具身智能新手名词表English

推理延迟

Inference Latency入门必知

模型从拿到输入到算出输出所花的时间,决定机器人反应快慢。

推理延迟指模型收到一帧观测(图像、关节状态、指令)后,跑完前向计算、给出动作所需的时间,常以毫秒计。大模型计算量大,延迟常跟不上机器人几十到几百赫兹的控制频率:70 亿参数的 OpenVLA 在 RTX 4090 上约 6Hz 出一次动作;π0 论文在同款显卡上测得,3 路图像时一次完整推理约 73 毫秒,改在机器人外的电脑上算、经 Wi-Fi 传输则约 86 毫秒。延迟过大会让机器人在两段动作之间停顿,或跟不上移动的物体。常见对策有动作分块(一次输出几十步动作)、异步推理(执行当前动作的同时计算下一段)、量化与推理加速,以及让大小模型分层、各按自己的频率运行。

例子π0 控制 50Hz 的机器人时,一次推理输出 50 步动作,执行 25 步(0.5 秒)后再推理下一段,而不是每一步都跑一次大模型。

也叫
推理时延、模型延迟
相关
推理(前向计算)、动作分块、异步推理、实时动作分块、控制频率、训练后量化
来源
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)
Real-Time Execution of Action Chunking Flow Policies (arXiv:2506.07339)
信息截至
2025-06

在完整名词表里查看 →