具身智能新手名词表English

LeVERB

LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction进阶

用「潜在动词」把视觉语言模型和人形全身控制器连起来的双系统框架。

LeVERB 由加州大学伯克利分校牵头,合作者包括彭学斌、Trevor Darrell、Koushil Sreenath 等,2025 年 6 月发布。已有 VLA 多假定底层控制器只接收末端位姿、底盘速度这类人工定义的指令,只能做准静态任务。LeVERB 分两层:上层 LeVERB-VL(System 2,10Hz)用 SigLIP 编码第一、第三人称图像和指令,通过条件变分自编码器学出一个「潜在动词」空间;下层 LeVERB-A(System 1,50Hz)是全身控制器,先用 PPO 训练跟踪参考动作的教师,再用 DAgger 蒸馏成以潜在动词为条件的学生。作者用 IsaacSim 渲染动捕回放,建了 150 多个任务的 LeVERB-Bench。在宇树 G1 上零样本部署,简单视觉导航成功率 80%,整体 58.5%,是朴素分层方案的 7.8 倍。

例子对机器人说「走到红色椅子前坐下」,上层模型看相机画面输出潜在动词,下层控制器据此让 G1 走过去、转身坐下。

也叫
Latent Vision-Language-Encoded Robot Behavior、LeVERB-Bench
相关
学习型全身控制、快慢双系统、潜在动作、条件变分自编码器、宇树 G1、DAgger(数据集聚合)
来源
LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction (arXiv 2506.13751)
信息截至
2025-09

在完整名词表里查看 →