CrossFormer
CrossFormer: Scaling Cross-Embodied Learning (One Policy for Manipulation, Navigation, Locomotion and Aviation)进阶一套权重同时控制单臂、双臂、四足、无人车和无人机的跨本体 Transformer 策略。
伯克利 Sergey Levine 组与 CMU 2024 年 8 月提出,CoRL 2024 口头报告。不同机器人的相机数量、本体感知、动作维度和控制频率各不相同,以往跨本体训练常要手工对齐观测和动作空间,或丢掉部分输入。CrossFormer 把多路相机图像、本体感知和任务(语言或目标图像)都切成 token 排成序列,送进所有本体共享的仅解码器 Transformer;序列里插入读出 token(readout token),再按本体类别接不同的动作头,输出对应维度的动作块,如单臂 7 维末端增量、双臂 14 维关节位置、导航 2 维路点。模型约 1.3 亿参数,在 20 种本体、90 万条轨迹上训练,真机上与各本体的专用策略相当,并明显超过此前的跨本体方法。
例子同一个 CrossFormer:接 WidowX 单臂时一次输出 4 步 7 维末端动作,接 ALOHA 双臂时一次输出 100 步 14 维关节位置,接 Go1 四足时每步输出 12 维关节目标。
- 也叫
- Scaling Cross-Embodied Learning
- 相关
- 跨本体、Octo、本体专属头、Open X-Embodiment 数据集、异构预训练 Transformer、动作分块
- 来源
- Scaling Cross-Embodied Learning / CrossFormer (arXiv:2408.11812)
CrossFormer 项目主页(CoRL 2024 Oral) - 信息截至
- 2024-08