多模态感知
Multimodal Perception常用同时用视觉、触觉、力觉、声音等多种感官信息来理解环境。
多模态感知指机器人不只靠相机,还同时用触觉、力/力矩、声音、本体感知(关节角、电机电流等对自身状态的感知),甚至语言指令来理解场景和任务进展。原因是各模态擅长的东西不同:2022 年的 See, Hear, and Feel 工作总结,视觉能看到全局但常被遮挡,声音能及时反映看不见的关键时刻,触觉提供精确的局部几何。难点在于各模态的频率、维度和噪声差别很大,需要为每种模态设计编码器,再选拼接、注意力等方式融合,数据采集也更麻烦。多项研究显示,在插孔、倒水这类接触丰富的操作中,加入触觉和力觉比只用视觉更稳。
例子See, Hear, and Feel(CoRL 2022)让机械臂用相机、接触式麦克风和视触觉传感器完成密集装箱和倒水,三路信号用自注意力融合,效果好于只用一两种模态。
- 也叫
- 多模态传感、多感官感知
- 相关
- 多传感器融合、视触觉融合、本体感知、触觉传感器、接触丰富操作、视觉-触觉-语言-动作模型
- 来源
- See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation (CoRL 2022)
Making Sense of Vision and Touch: Self-Supervised Learning of Multimodal Representations for Contact-Rich Tasks (ICRA 2019)