具身智能新手名词表English

RT-H

RT-H: Action Hierarchies Using Language进阶

谷歌让机器人先说出「手臂前移」这类语言动作、再输出动作的分层 VLA 策略

Google DeepMind 和斯坦福大学 2024 年 3 月发布,作者包括 Suneel Belkhale、Dorsa Sadigh 等。RT-2 这类视觉-语言-动作模型直接从「把可乐罐放进抽屉」这样的任务指令映射到电机动作,不同任务之间共有的动作结构很难被学到。RT-H 在中间插了一层「语言动作」(language motion),即「手臂前移」「合上夹爪」这类细粒度短语:同一个与互联网数据协同训练的视觉语言模型先根据任务和画面预测语言动作,再根据语言动作和画面输出具体动作。这样语义不同的任务可以共享底层动作;人还能在执行中直接用语言纠正它,这些纠正数据又能拿来继续训练。论文报告它在多任务数据上比 RT-2 高约 15%,从语言干预中学习的效果也好于从遥操作干预中学习。

例子机器人去开抽屉时手伸偏了,人只要说一句「手臂往左移」,RT-H 就把这句当作新的语言动作接着执行,这段纠正也会被记录下来用于再训练。

也叫
RT-Hierarchy
相关
RT-2、分层架构、语言纠正(实时语言反馈)、人在回路、中间表示、视觉-语言-动作模型
来源
RT-H: Action Hierarchies Using Language (arXiv 2403.01823)
RT-H project page
信息截至
2024-06

在完整名词表里查看 →