具身智能新手名词表English

语言条件策略

Language-conditioned Policy常用

输入里带一句语言指令、按指令不同输出不同动作的机器人策略。

策略(policy)是从观测到动作的映射;语言条件策略在输入里额外加一条自然语言指令,同一个网络根据指令不同去做不同任务,而不是每个任务单独训练一个模型。Google 的 Lynch 与 Sermanet 2020 年提出的语言条件模仿学习(发表于 RSS 2021)用一个端到端网络同时学习像素感知、语言理解和连续控制,并利用大量无标注的「玩耍数据」,需要语言标注的数据不到总量的 1%。CALVIN(2021)是专门评测这类策略的基准,要求机器人按顺序完成多条语言指令组成的长程任务。今天的视觉-语言-动作模型(VLA,如 RT-2、π0)本质上也是语言条件策略,只是换成了预训练视觉语言模型做骨干。与之对应的是目标条件策略,它用目标图像而不是语言来指定任务。

例子同一个机械臂策略,输入「打开抽屉」就去拉抽屉,输入「按下绿色按钮」就去按按钮(CALVIN 基准里的任务)。

也叫
语言引导策略、语言条件模仿学习
相关
策略、目标条件策略、视觉-语言-动作模型、指令跟随、CALVIN、玩耍数据
来源
Language Conditioned Imitation Learning over Unstructured Data (Lynch & Sermanet)
CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks

在完整名词表里查看 →