无模型强化学习
Model-Free Reinforcement Learning常用不学环境模型,直接从试错数据里学策略或价值函数的强化学习。
与基于模型的强化学习相对:算法不去估计环境的状态转移和奖励规律,只拿交互得到的(状态、动作、奖励)样本直接学策略或价值函数,相当于纯粹的试错学习。主要分两类:一类直接优化策略,如策略梯度、PPO;另一类学 Q 函数(估计「在某状态做某动作最终能拿多少回报」),如 Q 学习、DQN;DDPG、SAC 介于两者之间。优点是实现简单、不受模型误差影响;缺点是需要大量交互,样本效率低。机器人领域常用 GPU 并行仿真来弥补:在 Isaac Gym 或 Isaac Lab 里同时跑上千个环境收集数据,训好后再迁移到真机。
例子腿足机器人运控的主流做法:用 rsl_rl 库里的 PPO 在 Isaac Lab 中并行训练行走策略,全程不建环境模型,训好后部署到真机。
- 也叫
- Model-Free RL、免模型强化学习
- 相关
- 基于模型的强化学习、策略梯度、近端策略优化、深度 Q 网络、样本效率、大规模并行强化学习
- 来源
- Wikipedia: Model-free (reinforcement learning)
OpenAI Spinning Up: Kinds of RL Algorithms
RSL-RL (GitHub, leggedrobotics)