大规模并行强化学习
Massively Parallel Reinforcement Learning常用在一张 GPU 上同时跑成千上万个仿真环境采数据,几分钟就能训出运控策略。
大规模并行强化学习指把物理仿真和神经网络训练都放在 GPU 上,同时运行数千个独立的仿真环境,一次采集海量交互数据来训练策略。强化学习需要大量试错,过去多用 CPU 仿真、环境数量少,训练腿足运动策略往往要十几到上百小时。2021 年英伟达的 Isaac Gym 让仿真数据以 PyTorch 张量形式直接留在 GPU 上,报告比 CPU 仿真方案快 2–3 个数量级;同年 Rudin 等人在单张 GPU 上并行 4096 个 ANYmal 环境、用 PPO 训练,平地行走不到 4 分钟、复杂地形约 20 分钟即可训完。这套范式让强化学习成为四足和人形机器人运动控制的主流方案,常用工具有 Isaac Lab、legged_gym 等。
例子Rudin 等人开源的 legged_gym 在单张 RTX A6000 上同时仿真 4096 台 ANYmal,用游戏式的地形课程自动调整难度,约 20 分钟训出能走复杂地形的策略,并迁移到真实的 ANYmal C 上。
- 也叫
- 并行环境训练、GPU 并行强化学习
- 相关
- GPU 并行仿真、并行环境、近端策略优化、Isaac Lab、legged_gym、仿真到现实迁移
- 来源
- Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)
Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning (arXiv 2108.10470)