TinyVLA
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation进阶用小型多模态模型加扩散策略头、不做机器人数据预训练的快速 VLA
美的集团 AI Lab 与华东师范大学等(Junjie Wen、Yichen Zhu 等)2024 年 9 月发布,发表于 IEEE RA-L 2025。当时的 OpenVLA 等模型推理慢,还要先在大规模机器人数据上预训练。TinyVLA 的做法是:先按 LLaVA 流程训练一族以 Pythia 为语言模型、参数 7000 万到 14 亿的小型视觉语言模型,作为策略骨干;在机器人数据上微调时冻结预训练部分,只用 LoRA 训练约 5% 的参数,并接一个扩散策略解码器直接输出连续动作。在 Franka 单臂和双臂 UR5 真机上,最大的 TinyVLA-H 成功率比 OpenVLA 高 25.7%,参数少 5.5 倍,推理延迟低约 20 倍。同一团队之后又做了 DexVLA。
例子在双臂 UR5 任务上,依赖单臂 Open X-Embodiment 数据预训练的 OpenVLA 表现吃力,而不做机器人预训练、直接微调的 TinyVLA 表现更好。
- 也叫
- Tiny-VLA
- 相关
- 视觉-语言-动作模型、OpenVLA、扩散策略、低秩适配、推理延迟、DexVLA
- 来源
- TinyVLA (arXiv 2409.12514)
TinyVLA project page - 信息截至
- 2025-05