对称性增强(镜像损失)
Symmetry Augmentation (Mirror Loss)进阶利用机器人左右对称,把数据镜像一份或加一项损失,让策略动作左右一致。
足式和人形机器人大多左右对称,理想策略也应满足:状态左右镜像后,输出恰好是原动作的镜像。强化学习从零训练却常学出不对称步态,比如一条腿拖着走。常见两种办法:镜像损失由 Yu、Turk、Liu 在 SIGGRAPH 2018 提出,在损失函数里加一项,惩罚「镜像状态下的策略输出」与「原输出的镜像」之差;对称性数据增强则把采到的每条样本镜像一份一起训练。ETH 的 Mittal 等人在 ICRA 2024 对比两者,发现在 PPO 里数据增强收敛更快、回报更高。rsl_rl 已内置这两个选项。
例子Mittal 等人用对称性数据增强训练 ANYmal 四足爬箱子,回报高于不加对称处理的 PPO 基线、不同随机种子间波动更小,并部署到了真机上。
- 也叫
- 镜像对称增强、对称性数据增强、镜像损失、Mirror Loss、Symmetry Loss
- 相关
- 数据增强、强化学习运控、近端策略优化、rsl_rl、腿足运动、损失函数
- 来源
- Yu, Turk, Liu 2018: Learning Symmetric and Low-energy Locomotion (SIGGRAPH 2018)
Mittal et al. 2024: Symmetry Considerations for Learning Task Symmetric Robot Policies (ICRA 2024)
GitHub: leggedrobotics/rsl_rl ppo.py(symmetry_cfg / use_mirror_loss)