闭环
Closed-loop入门必知边做边看:每一步都根据最新观测结果调整下一步动作。
闭环原是控制理论概念:控制器持续测量系统的实际输出,与目标比较,用偏差修正动作,比如定速巡航遇到上坡会自动加大动力。相对的开环是按预定指令执行、不看结果。在机器人学习里,闭环执行指策略在执行中不断读取新的相机图像和关节状态再决定下一步,因此能应对物体被碰歪、抓取打滑等意外;开环则是一次算好整段轨迹照着走。很多扩散策略和 VLA 一次输出一段动作块,只执行一部分就重新观测、重新预测(滚动时域控制),在动作连贯和及时反馈之间折中。「闭环评测」也指让策略真的在环境里跑,而不是只和数据集里的动作比对。
例子机械臂去抓杯子时有人把杯子挪开 5 厘米:闭环策略从下一帧图像看到变化会改轨迹,开环执行则会照原计划抓空。
- 也叫
- 闭环执行、闭环控制、反馈控制、Closed-loop Control
- 相关
- 开环、感知-行动闭环、闭环评测、动作分块、视觉伺服、模型预测控制
- 来源
- Wikipedia: Closed-loop controller
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion