视听导航
Audio-Visual Navigation进阶智能体同时用「眼睛」和「耳朵」,在三维环境中找到发声的目标。
在视觉导航的基础上加入听觉:智能体同时接收第一人称画面和音频,要走到一个正在发声的物体旁边。声音能绕过墙体、在房间里反射,既提示方向也透露空间结构,目标不在视野内时尤其有用。ECCV 2020 的 SoundSpaces 是这一方向的早期代表:它基于几何声学,为 Matterport3D 和 Replica 两套真实扫描场景渲染声音,并接入 Habitat 仿真器,用多模态深度强化学习训练智能体。后续的「语义视听导航」让物体发出符合自身语义的短暂声音,如马桶冲水、门吱呀响,声音停了仍要凭记忆找过去。
例子在 SoundSpaces 中,智能体被放进一套陌生公寓,只听到某处有声音在响,需要结合画面和声音一路走到声源旁并停下。
- 也叫
- 音视频导航、音频视觉导航
- 相关
- 导航、物体目标导航、点目标导航、多模态感知、麦克风阵列、Habitat
- 来源
- SoundSpaces: Audio-Visual Navigation in 3D Environments (arXiv 1912.11474)
Semantic Audio-Visual Navigation (arXiv 2012.11583)