动作多峰性
Action Multimodality常用同一情境下有多种都正确的做法,动作分布出现多个「峰」。
动作多峰性指在同一个观测下合理的动作不止一种,比如绕开障碍物可以从左走也可以从右走,人类演示里两种都有,动作的概率分布就有两个峰。如果用均方误差直接回归一个动作,模型会学到两个峰的平均值,也就是「模式平均」,结果可能径直撞向障碍物。解决办法是用能表达多峰分布的策略:高斯混合模型、把动作离散成 token 再分类(如 BeT),以及扩散策略和流匹配。扩散策略论文把「处理多峰动作分布」列为主要优势之一,这也是如今很多 VLA 采用扩散或流匹配动作头的原因之一。
例子Push-T 任务里,演示者有时从左侧、有时从右侧推 T 形块;直接回归的策略容易学成两者的平均,扩散策略则在每次执行中只选定一侧推到底。
- 也叫
- 多峰动作分布、动作多峰分布、动作多模态、动作多模态性、多模态动作分布、多峰分布、Multimodal Action Distribution、模式平均、Mode Averaging
- 相关
- 扩散策略、流匹配、高斯混合模型、BeT / VQ-BeT、行为克隆、扩散动作头
- 来源
- Diffusion Policy 项目页(Columbia)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
Behavior Transformers: Cloning k Modes with One Stone