具身智能新手名词表English

字节 GR-RL

GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation (ByteDance Seed)进阶

字节 Seed 用强化学习把通用 VLA 练成专家,首个能自主穿鞋带的学习型策略。

GR-RL 由字节跳动 Seed 团队 2025 年 12 月发布,以通用模型 GR-3 为起点。它的出发点是:常规 VLA 默认人类演示是最优的,但在精细的长程灵巧任务里,演示常带抖动和多余动作。GR-RL 分三步:先用稀疏奖励做离线强化学习,把学到的 Q 值当作「任务进度」估计,删掉对进度没有贡献的片段;再做形态对称增强,即左右翻转图像、交换左右腕部相机、同步改写指令里的左右,扩充数据;最后做在线强化学习,学一个隐空间噪声预测器,引导基于流匹配的策略往高回报方向输出,让训练和实际部署时的行为对齐。实验平台是带两条 7 自由度机械臂的轮式机器人 ByteMini-v2。

例子穿鞋带:把鞋带依次穿过鞋上的多个鞋眼,需要长程规划、毫米级精度和对软鞋带的柔顺操作。GR-RL 成功率 83.3%,作者称这是首个能自主完成该任务的学习型策略。

也叫
GR-RL
相关
字节 GR-3、强化学习微调、离线强化学习、噪声空间策略引导、数据筛选、长程任务
来源
GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation (arXiv 2512.01801)
GR-RL 论文 HTML 全文
信息截至
2025-12

在完整名词表里查看 →