D4RL 离线强化学习基准
D4RL: Datasets for Deep Data-Driven Reinforcement LearningD4RL进阶离线强化学习领域最常用的标准数据集和评测基准
D4RL 由 UC Berkeley 与 Google Brain 的 Justin Fu、Aviral Kumar、Ofir Nachum、George Tucker、Sergey Levine 于 2020 年发布。离线强化学习(只用事先收集好的数据训练策略,训练中不再和环境交互)当时缺少专门的测试数据,各家结果难以比较。D4RL 按「数据怎么来的」设计数据集:人工控制器轨迹、人类示范、多任务数据、多种策略混合的数据,覆盖 Maze2D 与 AntMaze 迷宫导航、Gym-MuJoCo 运动控制、Adroit 灵巧手、Franka Kitchen 厨房操作,以及 Flow 交通和 CARLA 驾驶。它提供归一化分数,方便跨任务比较。CQL、IQL 等离线 RL 算法论文普遍报告 D4RL 分数。原仓库已停止维护:环境迁到 Gymnasium-Robotics,数据迁到 Minari。
例子halfcheetah-medium-v2:用一个训练到中等水平的策略采集的猎豹奔跑数据,离线算法只能从这批数据里学,最后用 get_normalized_score 报告归一化分数。
- 也叫
- D4RL
- 相关
- 离线强化学习、基准测试、Gym MuJoCo 连续控制任务、Adroit 灵巧手任务、Franka Kitchen、保守 Q 学习
- 来源
- D4RL: Datasets for Deep Data-Driven Reinforcement Learning (arXiv 2004.07219)
Farama-Foundation/D4RL GitHub(已弃用,迁往 Minari) - 信息截至
- 2026-09