视觉-触觉-语言-动作模型
Vision-Tactile-Language-Action ModelVTLA进阶在 VLA 基础上加入触觉输入的机器人模型,专攻需要「手感」的接触类任务。
VTLA 指把触觉传感器信号和相机图像、语言指令一起输入、输出机器人动作的模型,是 VLA(视觉-语言-动作模型)的扩展。这个叫法出自 2025 年 5 月的论文《VTLA》,作者来自三星中国研究院、北京智源研究院和中科院自动化所:他们以 Qwen2-VL 7B 为底座,把夹爪指尖 GelStereo 视触觉传感器的读数整理成图像式输入,在仿真轴孔插装数据上训练,再用直接偏好优化(DPO)缓解「按 token 分类」和连续控制之间的不匹配。加触觉的原因是插装、拧盖、抓易碎物这类接触丰富任务里,接触点常被手指挡住,视觉看不出力的大小和是否打滑。现在 VTLA 已成为一类模型的统称,2026 年仍有工作研究如何用少量数据把现成 VLA 改造成 VTLA。
例子原始 VTLA 论文的真机实验中,模型根据相机画面和指尖触觉图像逐步调整插入位置和角度,方形轴孔在 0.6 毫米间隙下插装成功率 95%,对没见过的轴形状也达到 95%–100%。
- 也叫
- 触觉 VLA、视触觉 VLA、Tactile VLA
- 相关
- 视觉-语言-动作模型、视触觉传感器、视触觉融合、接触丰富操作、轴孔装配、力觉 VLA
- 来源
- VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation (arXiv:2505.09577)
VT-Bridge: Bridging Pretrained Foundation VLAs to VTLAs via Lightweight Residual Adaptation (arXiv:2609.22606) - 信息截至
- 2026-09