具身智能新手名词表English

Embodied-R1

Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation进阶

天津大学的 3B 具身推理模型,以「指向」为中间表示,用强化微调训练。

Embodied-R1 是天津大学团队 2025 年 8 月发布的工作,已被 ICLR 2026 接收。作者把「看得懂却做不到」称为 seeing-to-doing gap,提出用「指向」(在图上输出点、区域或一串轨迹点)作为与机器人本体无关的中间表示,定义了指代定位、区域定位、功能部位定位和视觉轨迹生成四种能力。模型基于 Qwen2.5-VL-3B,在自建的 Embodied-Points-200K 数据上做两阶段强化微调:用 GRPO 算法,按任务设计可自动判分的奖励。模型输出的点和轨迹再交给运动规划等底层模块去执行。权重和数据集已开源。

例子不做任何任务专门微调,Embodied-R1 在 SimplerEnv 仿真中成功率 56.2%,在 8 个 xArm 真机任务上达到 87.5%,论文称比强基线提升 62%。

也叫
Embodied R1
相关
具身推理模型、指向(点预测)、强化学习微调、组相对策略优化、中间表示、可供性
来源
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation (arXiv 2508.13998)
Embodied-R1 GitHub 仓库
信息截至
2026-03

在完整名词表里查看 →