动作视界
Action Horizon常用策略每次看几步历史、预测几步动作、实际执行几步。
动作视界描述策略在时间上「看多远、做多远」。扩散策略(Diffusion Policy,2023)论文把它拆成三个量:观测视界 To 是输入最近几步的观测,预测视界 Tp 是一次生成多少步动作,执行视界 Ta 是其中真正发给机器人、中途不重新规划的步数。执行完 Ta 步再用新观测重新预测,这种做法叫滚动时域控制。Ta 越长,动作越连贯、推理次数越少,但对突发变化反应越慢;越短则越灵敏,却容易抖动。该论文发现多数任务执行 8 步最好,开源代码默认 To=2、Tp=16、Ta=8。VLA 里说的动作块长度(chunk size)大致对应预测视界。
例子π0 一次预测 50 步动作:在 50Hz 的机器人上只执行前 25 步(0.5 秒)就用新画面重新推理,在 20Hz 的 UR5e 上每执行 16 步重推一次。
- 也叫
- 预测视界、执行视界、观测视界、Prediction Horizon、Execution Horizon、Observation Horizon
- 相关
- 动作分块、时序集成、扩散策略、异步推理、闭环、实时动作分块
- 来源
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv:2303.04137)
diffusion_policy 训练配置 train_diffusion_unet_image_workspace.yaml (GitHub)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)