CleanRL
进阶把每个深度强化学习算法写成单个文件的开源实现库,便于读懂和改
CleanRL 是一个开源的深度强化学习算法库,主要作者是黄胜意(Shengyi Huang)等人,相关论文发表在 JMLR(2022)。它的特点是「单文件实现」:PPO、DQN、SAC、TD3、DDPG 等算法各自写在一个独立的 Python 文件里,从环境创建到网络、训练循环都在同一页,没有层层封装。好处是新手可以从头到尾读懂一个算法的全部细节,研究者也方便直接复制改动做实验;它还内置了用 Weights & Biases 和 TensorBoard 记录实验的功能。与 Stable-Baselines3 这类模块化库相比,它更适合学习和做研究原型,而不是当成通用工具包调用。
例子运行 python cleanrl/ppo_continuous_action.py --env-id HalfCheetah-v4,就能在 MuJoCo 环境上训练 PPO 并在 TensorBoard 里看曲线。
- 相关
- 强化学习、近端策略优化、Stable-Baselines3、Gymnasium、rsl_rl、Weights & Biases
- 来源
- vwxyzjn/cleanrl (GitHub)
CleanRL (JMLR 2022)