具身智能新手名词表English

OpenVLA-OFT

OpenVLA-OFT (Optimized Fine-Tuning recipe for VLAs)OFT常用

斯坦福提出的 VLA 微调配方,让 OpenVLA 动作生成快 26 倍、成功率更高。

OpenVLA-OFT 是斯坦福 Moo Jin Kim、Chelsea Finn、Percy Liang 在 2025 年 2 月提出的 VLA 微调配方。原版 OpenVLA 把动作离散成 token 逐个自回归输出,推理慢,难做高频控制。OFT 在微调时改了四处:并行解码(一次前向算出全部动作)、动作分块(一次预测多步)、连续动作表示、L1 回归损失;OFT+ 再加 FiLM 特征调制,加强对语言指令的跟随。结果 LIBERO 平均成功率从 76.5% 提到 97.1%,动作生成吞吐提升 26 倍,在 ALOHA 双臂真机上也胜过 π0、RDT-1B 等微调后的 VLA。它常被当作 VLA 微调的强基线。

例子在 LIBERO 上微调 OpenVLA 时,把输出从逐个吐出的离散动作 token 改成一次前向回归出一整段连续动作,推理吞吐大幅提升,成功率也更高。

也叫
OFT、OpenVLA-OFT+、VLA 优化微调配方
相关
OpenVLA、视觉-语言-动作模型、动作分块、并行解码、FiLM 特征调制、LIBERO
来源
OpenVLA-OFT 项目主页
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (arXiv:2502.19645)
信息截至
2025-04

在完整名词表里查看 →