协同训练
Co-training常用把目标机器人数据和其他来源的数据按比例混在一起,训练同一个模型。
协同训练在具身智能里指:把少量目标机器人数据和其他来源的数据按比例混进同一批次,一起训练同一个模型。其他来源可以是网上图文问答、别的机器人数据或仿真数据。2023 年谷歌 RT-2 把机器人轨迹和视觉问答等网页任务一起微调,称为 co-fine-tuning;2025 年的 π0.5 把多机器人数据、高层语义预测和网页数据一起训练。它要解决真机数据太少的问题:借其他数据保住视觉和语言常识、提升泛化,关键是调好数据配比。传统机器学习里 Blum 和 Mitchell 1998 年提出的 co-training 是半监督方法,意思不同。
例子Mobile ALOHA 每个任务只有 50 条移动操作演示,与已有的静态 ALOHA 双臂数据协同训练后,成功率最高提升 90%;英伟达等 2025 年的仿真-真机协同训练研究中,混入仿真数据让真机任务成功率平均提高 38%。
- 也叫
- 联合训练、混合训练、协同微调、co-fine-tuning、仿真-真机协同训练、Sim-and-Real Co-training
- 相关
- 数据配比、仿真到现实迁移、跨本体数据、RT-2、π0.5、Mobile ALOHA
- 来源
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv 2307.15818)
Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation (arXiv 2401.02117)
Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation (arXiv 2503.24361) - 信息截至
- 2025-04