具身智能新手名词表English

GRAPE

GRAPE: Generalizing Robot Policy via Preference Alignment进阶

用成功和失败轨迹做偏好对齐,提升 VLA 在新任务上泛化的方法。

GRAPE 由北卡罗来纳大学教堂山分校、华盛顿大学、芝加哥大学的研究者 2024 年 11 月提出,实验以 OpenVLA 为基础模型。多数 VLA 只对成功示范做行为克隆(照着示范学),没见过失败,不知道哪些做法要避免,泛化到新任务时容易出错。GRAPE 借鉴大语言模型的偏好对齐思路:让模型自己执行多次,按得分给整条轨迹排出好坏,再用「轨迹级偏好优化」(TPO)让模型偏向好轨迹,失败轨迹也能提供信息。打分时先把复杂任务拆成若干阶段,由视觉语言模型为各阶段生成时空约束作为评分依据;换一套约束,就能按「更安全」「更高效」等不同目标来对齐。

例子作者报告,GRAPE 让训练内任务和未见任务的成功率分别提升 51.79% 和 58.20%;按安全、效率目标对齐时,碰撞率下降 37.44%,执行步数减少 11.15%。

也叫
偏好对齐机器人策略
相关
直接偏好优化、视觉-语言-动作模型、OpenVLA、行为克隆、泛化、强化学习微调
来源
GRAPE: Generalizing Robot Policy via Preference Alignment (arXiv 2411.19309)
GRAPE 项目页
信息截至
2025-02

在完整名词表里查看 →