具身智能新手名词表English

PerAct

Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation进阶

把场景体素化,用 Perceiver Transformer 预测下一个关键位姿的多任务操作策略

华盛顿大学与英伟达的 Mohit Shridhar、Lucas Manuelli、Dieter Fox 在 CoRL 2022 提出。它把 RGB-D 观测转成 100×100×100 的体素网格(三维像素块),与语言指令一起送进 PerceiverIO Transformer;输出不是连续轨迹,而是「下一个最佳体素」:末端该到哪个格子、离散化的旋转、夹爪开合以及是否需要避碰,再由运动规划器把机械臂送到这个关键位姿。一个模型同时在 RLBench 18 个任务(249 种变体)和 7 个真实任务上训练,每个任务只要少量演示。它把「3D 表示 + 关键帧动作预测」这套做法立了起来,RVT、3D Diffuser Actor、BridgeVLA 等后续工作都拿它当基线。

例子指令「打开中间的抽屉」:PerAct 先在体素网格里给出把手所在格子和抓取朝向,夹爪到位后闭合;下一步再预测把抽屉拉开后的末端位置。

也叫
Perceiver-Actor
相关
RVT-2、3D Diffuser Actor、RLBench、体素、关键帧动作预测、CLIPort
来源
arXiv 2209.05451: Perceiver-Actor
PerAct 项目主页
信息截至
2022-11

在完整名词表里查看 →