LeVERB
LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction进阶用「潜在动词」把视觉语言模型和人形全身控制器连起来的双系统框架。
LeVERB 由加州大学伯克利分校牵头,合作者包括彭学斌、Trevor Darrell、Koushil Sreenath 等,2025 年 6 月发布。已有 VLA 多假定底层控制器只接收末端位姿、底盘速度这类人工定义的指令,只能做准静态任务。LeVERB 分两层:上层 LeVERB-VL(System 2,10Hz)用 SigLIP 编码第一、第三人称图像和指令,通过条件变分自编码器学出一个「潜在动词」空间;下层 LeVERB-A(System 1,50Hz)是全身控制器,先用 PPO 训练跟踪参考动作的教师,再用 DAgger 蒸馏成以潜在动词为条件的学生。作者用 IsaacSim 渲染动捕回放,建了 150 多个任务的 LeVERB-Bench。在宇树 G1 上零样本部署,简单视觉导航成功率 80%,整体 58.5%,是朴素分层方案的 7.8 倍。
例子对机器人说「走到红色椅子前坐下」,上层模型看相机画面输出潜在动词,下层控制器据此让 G1 走过去、转身坐下。
- 也叫
- Latent Vision-Language-Encoded Robot Behavior、LeVERB-Bench
- 相关
- 学习型全身控制、快慢双系统、潜在动作、条件变分自编码器、宇树 G1、DAgger(数据集聚合)
- 来源
- LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction (arXiv 2506.13751)
- 信息截至
- 2025-09