玩耍数据
Play Data进阶操作员不按具体任务、随意摆弄场景时录下的机器人数据。
玩耍数据是 Corey Lynch 等人在 2019 年论文《Learning Latent Plans from Play》(CoRL 2019)里提出的采集方式:操作员遥操作机器人,在摆满物体的场景里凭好奇心随意开抽屉、推滑块、抓积木,事先不规定任务。它的好处是便宜:不用按任务切分、不用打标签,也不用每次把场景复位;论文统计,同样的采集时间下,它覆盖的交互范围约为按任务演示的 4 倍。代价是没有任务标签,所以常配合「事后重标注」(把一段轨迹的终点当作目标)训练目标条件策略,或事后再补语言描述。CALVIN 基准和 MimicPlay 都沿用了这个思路。
例子在 Play-LMP 论文里,操作员用 VR 遥操作仿真机器人,在带抽屉、滑门和积木的桌面场景中随意摆弄,录下不分段、不标任务的连续数据,再训练出能按目标图像完成多种任务的策略。
- 也叫
- 自由玩耍数据、play 数据、遥操作玩耍数据
- 相关
- 目标条件策略、事后重标注、遥操作、演示数据、CALVIN、MimicPlay
- 来源
- Learning Latent Plans from Play (arXiv:1903.01973)