Seer(预测式逆动力学模型)
Seer: Predictive Inverse Dynamics Models are Scalable Learners for Robotic ManipulationPIDM进阶先预测接下来的画面、再用逆动力学推出动作的端到端机器人操作策略
上海人工智能实验室等机构 2024 年 12 月发布,入选 ICLR 2025 口头报告。常见做法要么直接从当前画面模仿动作(行为克隆),要么先用视频模型生成未来画面、再单独推算动作,两步分开训练。Seer 提出「预测式逆动力学模型」(PIDM):在一个端到端训练的 Transformer 里,先预测机器人接下来会看到的画面,再用逆动力学模型(根据当前状态和目标状态反推该做什么动作)从「现在」和「预测的未来」之间算出动作,视觉预测和动作预测一起优化。它可以先在 DROID 等大规模机器人数据上预训练,再少量微调到下游任务。论文报告相比此前最好的方法,在 LIBERO-LONG 上提升 13%,在 CALVIN ABC-D 上提升 21%,真机任务提升 43%。
例子执行「打开抽屉」时,Seer 先预测下一刻夹爪贴近把手的画面,再根据当前画面和这张预测图算出机械臂该怎么移动。
- 也叫
- Seer、预测式逆动力学模型、Predictive Inverse Dynamics Model
- 相关
- 逆动力学模型、视频预测策略、DROID 数据集、CALVIN、LIBERO、上海人工智能实验室
- 来源
- Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation (arXiv 2412.15109)
OpenRobotLab/Seer (GitHub) - 信息截至
- 2025-01