人形行走即下一个 token 预测
Humanoid Locomotion as Next Token Prediction进阶把人形机器人行走当成语言模型式的「预测下一个 token」问题来学
UC Berkeley 的 Ilija Radosavovic、Koushil Sreenath、Jitendra Malik 等 2024 年 2 月发布。它把真实人形机器人控制写成类似语言建模的问题:用因果 Transformer 对观测和动作组成的传感器运动轨迹做自回归预测,每个 token 预测同一模态的下一个 token。这样缺少动作标签的数据(如从人类视频里提取的动作轨迹)也能参与训练。数据来自已有神经网络策略和基于模型控制器的仿真轨迹、人体动作捕捉数据和 YouTube 人类视频。模型部署到 Agility Robotics 的全尺寸人形 Digit 上,零样本在旧金山街头行走;只用 27 小时行走数据也能迁移到真机,还能泛化到训练中没有的倒退走指令。
例子训练数据里没有倒退走的指令,模型部署后仍能按指令让 Digit 向后走。
- 也叫
- Humanoid Locomotion as Next Token Prediction
- 相关
- 下一个 token 预测、自回归解码、无动作标签视频、双足行走、Agility Digit 人形机器人、真实世界人形强化学习行走
- 来源
- Humanoid Locomotion as Next Token Prediction (arXiv 2402.19469)
Project page - 信息截至
- 2024-02