教师-学生蒸馏
Teacher-Student Distillation常用先训练能看到特权信息的教师策略,再让只用真实传感器的学生去模仿它。
教师-学生蒸馏源自知识蒸馏(Hinton 等人 2015 年提出,用大模型的输出当软标签训练小模型)。在机器人里通常分两步:先在仿真中训练教师策略,教师可以直接读取真机拿不到的特权信息,如精确地形高度、摩擦系数、物体位姿,所以用强化学习比较容易学好;再训练学生策略,它只接收真机上能获得的观测(关节状态、IMU、相机图像等),通过模仿教师的动作或中间表示来学习,常用 DAgger 式在线纠正。这样把「难学的决策」和「难学的感知」拆开处理,是仿真到现实迁移的主流做法之一。代表工作有 2019 年自动驾驶领域的 Learning by Cheating,以及 ETH 2020 年的四足盲走控制器。
例子ETH 的 Lee 等人(Science Robotics 2020)让教师在仿真中读取地形等特权信息,学生只靠本体感知信号模仿教师;ANYmal 四足零样本部署到泥地、雪地、碎石、茂密植被和湍急水流等训练中没见过的野外环境。
- 也叫
- 教师-学生训练、师生框架、Teacher-Student Training、特权教师蒸馏
- 相关
- 知识蒸馏、特权信息、策略蒸馏、非对称演员-评论家、仿真到现实迁移、DAgger(数据集聚合)
- 来源
- Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020, arXiv 2010.11251)
Learning by Cheating (Chen et al., CoRL 2019, arXiv 1912.12294)
Distilling the Knowledge in a Neural Network (Hinton et al., arXiv 1503.02531)