视觉-语言-动作模型
Vision-Language-Action ModelVLA入门必知看图、听懂语言指令,直接输出机器人动作的大模型。
视觉-语言-动作模型以相机图像和自然语言指令为输入,直接输出机器人控制动作,通常由预训练的视觉语言模型(VLM,能看图回答问题的大模型)再用机器人数据训练而来。这个名字来自谷歌 DeepMind 2023 年 7 月的 RT-2 论文:它把动作写成文本 token,和网页图文数据一起训练,让机器人借用互联网知识处理没见过的物体和指令。之后有开源的 OpenVLA(7B 参数,用 97 万条机器人演示训练),以及 Physical Intelligence 的 π0(用流匹配生成连续动作块)。各家的主要差别在动作怎么输出:离散 token、扩散或流匹配动作头,或两者混合。
例子给 OpenVLA 一张桌面照片和指令「把茄子放进锅里」,它输出 7 个动作 token,解码成机械臂末端的位移、旋转和夹爪开合。
- 也叫
- 视觉语言动作模型、VLA 模型、Vision-Language-Action Models
- 相关
- 视觉语言模型、RT-2、OpenVLA、π0、动作分词器、动作专家
- 来源
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv:2307.15818)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164) - 信息截至
- 2024-10