ANYmal 强化学习运控系列(执行器网络 / 教师-学生盲走 / 感知行走)
ANYmal RL Locomotion Series (Hwangbo 2019; Lee 2020; Miki 2022, Science Robotics)进阶ETH 用 ANYmal 四足在 2019–2022 年发的三篇论文,把仿真 RL 运控带进野外。
指苏黎世联邦理工机器人系统实验室(Marco Hutter 组)以四足机器人 ANYmal 为平台、发表在 Science Robotics 上的三篇论文。2019 年 Hwangbo 等提出执行器网络:用真机数据训练神经网络模拟电机响应,接入仿真缩小虚实差距,仿真训练的策略直接上真机,跑得比原纪录快 25%,还会摔倒后翻身。2020 年 Lee 等用教师-学生蒸馏:先训练能看到地形真值等特权信息的教师,再让只用本体感知的学生模仿,配合地形课程,机器人不看地形也能走泥地、雪地和碎石(盲走),该控制器被用于 DARPA 地下挑战赛。2022 年 Miki 等用带注意力的循环编码器融合高度图与本体感知,视觉不可靠时自动更多依赖本体感知。
例子2022 年的感知行走控制器让 ANYmal 在瑞士 Etzel 山走完一条 2.2 公里、爬升 120 米、评级为「困难」的徒步路线,用时 78 分钟,与徒步规划工具给人的建议时间(76 分钟)几乎相同,途中只停下来修了一次脱落的脚套、换了电池。
- 也叫
- Learning agile and dynamic motor skills for legged robots、Learning quadrupedal locomotion over challenging terrain、Learning robust perceptive locomotion for quadrupedal robots in the wild
- 相关
- 强化学习运控、执行器建模、教师-学生蒸馏、特权信息、地形课程、ANYmal 四足
- 来源
- Learning agile and dynamic motor skills for legged robots (Hwangbo et al., Science Robotics 2019, arXiv 1901.08652)
Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020, arXiv 2010.11251)
Learning robust perceptive locomotion for quadrupedal robots in the wild (Miki et al., Science Robotics 2022, arXiv 2201.08117) - 信息截至
- 2022-01