安全强化学习
Safe Reinforcement LearningSafe RL进阶在最大化奖励的同时,保证训练和部署过程中不违反安全约束。
García 和 Fernández 2015 年的综述把安全强化学习定义为:在需要保证合理表现或遵守安全约束的问题中,于学习和/或部署期间最大化期望回报。常见做法分两类:一是改优化目标,例如把问题写成约束马尔可夫决策过程(在奖励之外再给「代价」设上限),用拉格朗日乘子法或 2017 年提出的约束策略优化(CPO)求解;二是改探索过程,例如引入先验知识,或用安全滤波器、控制障碍函数把危险动作拦下来。它对真机强化学习和人形、足式机器人运控尤其重要,因为摔倒、碰撞、关节超限会直接损坏硬件甚至伤人。
例子CaT 方法把足式机器人运控中的各项约束改写成「一旦违反,就按一定概率提前终止回合」,只需对 PPO 做很小改动,就在真实的 Solo 四足机器人上学会了穿越障碍。
- 也叫
- 约束强化学习、Constrained Reinforcement Learning、Constrained RL
- 相关
- 具身安全、控制障碍函数、安全滤波器、真机强化学习、近端策略优化、奖励塑形
- 来源
- García & Fernández 2015: A Comprehensive Survey on Safe Reinforcement Learning (JMLR)
Achiam et al. 2017: Constrained Policy Optimization
Chane-Sane et al. 2024: CaT: Constraints as Terminations for Legged Locomotion Reinforcement Learning