观测-动作对
Observation-Action Pair常用某一时刻机器人「看到了什么」和「接着做了什么」配成的一条训练样本。
模仿学习数据的最小单位。每个时间步记一份观测 o(相机图像、关节角等本体状态,常附语言指令)和这一刻执行的动作 a(目标关节角、末端位移或夹爪开合),一条演示轨迹就是按时间排好的一串 (o, a)。行为克隆把它当监督学习来做:输入 o,预测 a。严格讲,「状态」是环境的完整描述,「观测」只是传感器看得到的那部分,真机上一般只有观测。这些样本前后相关,策略一旦走偏就会遇到训练里没见过的观测,误差越积越大,这就是复合误差。LeRobot 数据集每一帧的 observation.state、observation.images 和 action 就是这种结构。
例子用 LeRobot 以每秒 30 帧录一条 SO-101 抓方块的演示,每一帧都存下相机画面、从臂的关节读数,以及主臂此刻给出的目标关节角作为动作。
- 也叫
- 状态-动作对、State-Action Pair
- 相关
- 观测、动作标签、行为克隆、轨迹、演示数据、复合误差
- 来源
- LeRobotDataset v3.0 (Hugging Face LeRobot docs)
google-research/rlds (GitHub)