视觉运动策略
Visuomotor Policy常用直接把相机图像映射成机器人动作的控制策略,通常是一个神经网络。
「策略」指从观测到动作的映射;视觉运动策略特指输入以图像为主(常加上关节角等本体状态)、输出电机指令、关节位置或末端位姿的策略。2015 年 Levine、Finn 等人的论文《End-to-End Training of Deep Visuomotor Policies》让这个词流行起来:用一个约 9.2 万参数的卷积网络,从原始图像直接输出关节力矩,完成拧瓶盖等任务,说明感知和控制联合训练更有效。今天的 ACT、扩散策略以及加了语言输入的 VLA 模型,都属于视觉运动策略,多用模仿学习或强化学习训练。
例子扩散策略(Diffusion Policy)的论文标题就是「通过动作扩散学习视觉运动策略」:输入相机图像,输出一段机械臂动作序列,完成推 T 形块等操作任务。
- 也叫
- 视觉-运动策略、视觉运动控制策略
- 相关
- 策略、端到端、扩散策略、模仿学习、视觉-语言-动作模型、端到端视觉运动策略(引导策略搜索)
- 来源
- End-to-End Training of Deep Visuomotor Policies (arXiv 1504.00702)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)