Hi Robot
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models进阶PI 2025 年的分层系统:高层 VLM 拆解复杂指令,低层 π0 执行。
Hi Robot 由 Physical Intelligence 联合斯坦福大学、UC 伯克利的研究者 2025 年 2 月发布,发表于 ICML 2025。单个 VLA 擅长执行「拿起杯子」这类简单指令,但难以处理带限制条件的复杂要求,也难以应对执行途中用户的插话纠正。Hi Robot 分两层:高层是基于 PaliGemma-3B 的视觉语言模型,看当前画面和用户的话,推理出下一步该执行的简单指令,还能口头回应用户;低层是 π0,把简单指令变成连续动作。训练高层时,团队把遥操作示范切成短技能片段,再让一个大 VLM 反推「用户当时可能说了什么、机器人该怎么回答」,合成对话式训练数据,省去人工标注。系统在单臂 UR5e、双臂 ARX 和移动双臂 ARX 上做了测试。
例子用户说「给我做个素食三明治」,高层会把它拆成逐步取配料的子指令并跳过肉类;收拾桌子时用户说「那不是垃圾」,机器人会停下并调整做法。
- 也叫
- Hierarchical Interactive Robot
- 相关
- 分层架构、快慢双系统、π0、指令跟随、语言纠正(实时语言反馈)、Physical Intelligence
- 来源
- Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models (arXiv 2502.19417)
Hi Robot 论文 HTML 全文 - 信息截至
- 2025-07