具身智能新手名词表English

HAMSTER(分层动作模型)

HAMSTER: Hierarchical Action Models for Open-World Robot ManipulationHAMSTER进阶

英伟达等 2025 年的分层 VLA:高层画 2D 路径,底层 3D 策略照着做。

HAMSTER 由英伟达、华盛顿大学、南加州大学的研究者 2025 年 2 月提出,发表于 ICLR 2025。常规 VLA 直接把视觉语言模型(VLM)微调成输出动作,只能用昂贵的真机数据训练。HAMSTER 把系统拆成两层:高层是微调过的 VLM(基于 VILA),看一张 RGB 图和任务描述,画出一条粗略的 2D 路径,表示末端执行器大致该怎么走;底层是能处理 3D 输入的控制策略(论文试了 RVT-2 和 3D Diffuser Actor),把这条路径当引导去做精确操作。高层只需输出 2D 路径,所以能用便宜的「域外数据」训练,比如无动作标签的视频、手绘草图、仿真数据;高层不管精细动作,底层不管任务推理,各做擅长的事。

例子在真机上沿 7 个泛化维度(如新物体、新背景、新指令语义)测试,HAMSTER 比 OpenVLA 平均成功率高约 20%,相对提升约 50%。

也叫
分层动作模型
相关
分层架构、中间表示、视觉-语言-动作模型、RVT-2、3D Diffuser Actor、OpenVLA
来源
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation (arXiv 2502.05485)
HAMSTER 项目页
信息截至
2025-05

在完整名词表里查看 →