部分可观测马尔可夫决策过程
Partially Observable Markov Decision ProcessPOMDP进阶智能体看不全真实状态、只能凭观测推断时的决策数学框架。
部分可观测马尔可夫决策过程是马尔可夫决策过程(MDP,序贯决策的标准模型)的扩展:智能体拿不到真实状态,只能得到带噪声、不完整的观测。Åström 在 1965 年提出这一框架,1998 年 Kaelbling、Littman 等人把它系统引入人工智能规划。常用做法是维护一个「信念」,即对真实状态的概率分布,每拿到新观测就按贝叶斯公式更新。机器人几乎总处在部分可观测的环境里:相机有遮挡,抽屉里看不见,物体多重要拿起来才知道。精确求解计算量极大,实际中常用近似规划,或让策略网络输入历史帧、加记忆模块来隐式估计状态。
例子机器人要从一排关着门的柜子里找杯子,开门前看不到杯子在哪,只能根据已经看过的柜格更新「杯子可能在哪一格」的概率,再决定下一扇先开哪个。
- 也叫
- 部分可观察马尔可夫决策过程
- 相关
- 马尔可夫决策过程、观测、状态空间、具身记忆、记忆增强 VLA、强化学习
- 来源
- Partially observable Markov decision process - Wikipedia