多模态数据
Multimodal Data常用同一时刻同步记录的图像、深度、关节状态、力触觉、语言等多路信号。
在具身智能里,多模态数据指机器人干活时同步采下的多路信号:多视角 RGB 图像、深度图、本体感知(关节角、末端位姿等机器人自身状态)、力或触觉读数、语言指令,有时还有声音。只靠相机看不到被手挡住的接触点,也看不出用了多大力,所以精细操作往往要把视觉之外的信号一起记下。以北京人形机器人创新中心和北大的 RoboMIND 为例,每条轨迹存成一个 HDF5 文件,里面有多视角 RGB-D、本体状态、末端状态和遥操作者的身体状态;RoboMIND 2.0 又加了 1.2 万条带触觉的片段。难点在各路信号的时间同步、存储体积,以及某一路缺失时怎么训练。
例子RoboMIND 2.0 的触觉增强片段里,同一时刻既有多视角 RGB-D 画面和关节状态,也有他山触觉传感器测到的法向力与切向力。
- 也叫
- 全模态数据、Omni-modal Data
- 相关
- 多模态融合、触觉数据、本体感知、多传感器时间同步(时间戳对齐)、HDF5 格式、RoboMIND 数据集
- 来源
- RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation (arXiv HTML)
RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence - 信息截至
- 2025-12