观测
Observation入门必知智能体每个时刻从环境拿到的信息,是策略做决策的输入。
观测是智能体每一步从环境得到的输入。在强化学习的「观测—动作—奖励」循环里,环境重置时和每执行一个动作后都会返回新观测;观测空间规定这些输入的格式和取值范围,比如 Gymnasium 里 CartPole 的观测就是小车位置、速度、杆角度等几个数。真实机器人的观测通常包括多路相机图像、深度或点云、关节角度和夹爪开合等本体感知信息,以及语言指令。观测不等于状态:状态是环境的完整描述,观测常只看到一部分(有遮挡、有噪声),这种情形用部分可观测马尔可夫决策过程(POMDP)建模。很多策略会输入最近几帧观测,Diffusion Policy 把这个帧数叫观测视界。
例子一个 VLA 策略每一步的观测:头部相机和腕部相机各一张 RGB 图、7 个关节角、夹爪开度,加上指令「把杯子放到盘子上」。
- 也叫
- 观测空间、Observation Space、观察
- 相关
- 状态空间、动作空间、本体感知、部分可观测马尔可夫决策过程、策略、观测-动作对
- 来源
- Basic Usage (Gymnasium Documentation)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv:2303.04137)