力觉 VLA
Force-aware Vision-Language-Action Model进阶在视觉和语言之外,把力/力矩信号也当作输入的 VLA 模型。
力觉 VLA 指把六维力/力矩传感器(测三个方向的力和三个方向的力矩)等力信号,作为与图像、语言并列的输入模态的视觉-语言-动作模型。普通 VLA 只靠相机,而插插头、擦桌子、装配这类接触丰富任务里,是否接触到位、用了多大力往往看不出来,容易卡住或用力过猛。代表工作 ForceVLA(Yu 等,NeurIPS 2025)以 π0 为基础,用力感知混合专家模块(FVLMoE)在动作解码阶段融合力 token,五个接触任务上比 π0 基线平均高 23.2%,而把力直接拼到输入上只带来很小提升。2026 年 3 月的 ForceVLA2 又加入力位混合控制,据论文报告比 π0、π0.5 分别高 48% 和 35%。
例子插插头时,插头顶到插座边缘,图像上几乎看不出区别,力传感器读数却会突变;ForceVLA 用这个信号修正位姿,插插头这类任务最高达到 80% 成功率。
- 也叫
- 力感知 VLA、Force-aware VLA、力反馈 VLA
- 相关
- 视觉-语言-动作模型、六维力传感器、接触丰富操作、力位混合控制、视觉-触觉-语言-动作模型、混合专家模型
- 来源
- ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation (arXiv 2505.22159)
ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness (arXiv 2603.15169)
Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning (arXiv 2608.07558) - 信息截至
- 2026-09