蒙特卡洛方法(蒙特卡洛回报)
Monte Carlo Methods (Monte Carlo Return)MC进阶靠大量随机采样求平均来估算;在强化学习里指用整局实际回报来估价值。
蒙特卡洛方法泛指用随机采样加统计平均来近似计算的一大类方法。在强化学习里它特指:让智能体完整跑完一个回合,把从某一步起实际拿到的(折扣)奖励加起来,得到「蒙特卡洛回报」,再对多个回合取平均来估计状态或动作的价值。它不依赖对后续状态价值的估计(不做自举),因此没有自举带来的偏差,但回合越长方差越大,而且必须等回合结束才能更新,只适用于有终点的任务。与之相对的是每一步都能更新的时序差分学习,TD(λ) 可以在两者之间连续调节。蒙特卡洛树搜索也借用了随机模拟的思路。
例子π*0.6 的 RECAP 训练价值函数时直接用蒙特卡洛回报:每走一步奖励 −1,成功结束得 0,失败另扣一大笔,于是价值大致等于「离完成还差多少步」的负数。
- 也叫
- MC 方法、蒙特卡洛回报、MC Return
- 相关
- 回报、时序差分学习、价值函数、折扣因子、蒙特卡洛树搜索、RECAP
- 来源
- Wikipedia: Reinforcement learning (Monte Carlo methods)
Physical Intelligence 2025: π*0.6: a VLA That Learns From Experience (RECAP)