触觉表征学习
Tactile Representation Learning进阶把触觉传感器读数编码成通用特征,供滑移检测、插拔等下游任务复用。
触觉表征学习研究怎样把触觉传感器的原始信号(如 GelSight、DIGIT 这类视触觉传感器拍到的凝胶形变图像)编码成紧凑特征,供滑移检测、力估计、精密插装等下游任务直接使用。难点是触觉数据少、标注更少,不同传感器成像差异大,换一款常要重训。近年主流做法借用视觉里的自监督学习:Meta 的 Sparsh(CoRL 2024)用掩码和自蒸馏在 46 万多张触觉图像上预训练;MIT 的 T3 用共享 Transformer 加各传感器专属编码器;AnyTouch(ICLR 2025)跨四种传感器学统一表征。它是视触觉融合和触觉 VLA 的基础。
例子Sparsh 在 46 万多张无标注视触觉图像上做自监督预训练,在作者提出的 TacBench 六项任务上,据论文报告平均比按任务、按传感器端到端训练的模型高出 95.1%。
- 也叫
- 触觉表示学习、触觉预训练、Touch Representation Learning
- 相关
- 视触觉传感器、自监督学习、Sparsh、AnyTouch、视触觉融合、表征学习
- 来源
- Higuera et al. 2024: Sparsh: Self-supervised Touch Representations for Vision-based Tactile Sensing (CoRL 2024)
Zhao et al. 2024: Transferable Tactile Transformers for Representation Learning Across Diverse Sensors and Tasks (T3)
Feng et al. 2025: AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors (ICLR 2025) - 信息截至
- 2025-04