具身智能新手名词表English

D4RL 离线强化学习基准

D4RL: Datasets for Deep Data-Driven Reinforcement LearningD4RL进阶

离线强化学习领域最常用的标准数据集和评测基准

D4RL 由 UC Berkeley 与 Google Brain 的 Justin Fu、Aviral Kumar、Ofir Nachum、George Tucker、Sergey Levine 于 2020 年发布。离线强化学习(只用事先收集好的数据训练策略,训练中不再和环境交互)当时缺少专门的测试数据,各家结果难以比较。D4RL 按「数据怎么来的」设计数据集:人工控制器轨迹、人类示范、多任务数据、多种策略混合的数据,覆盖 Maze2D 与 AntMaze 迷宫导航、Gym-MuJoCo 运动控制、Adroit 灵巧手、Franka Kitchen 厨房操作,以及 Flow 交通和 CARLA 驾驶。它提供归一化分数,方便跨任务比较。CQL、IQL 等离线 RL 算法论文普遍报告 D4RL 分数。原仓库已停止维护:环境迁到 Gymnasium-Robotics,数据迁到 Minari。

例子halfcheetah-medium-v2:用一个训练到中等水平的策略采集的猎豹奔跑数据,离线算法只能从这批数据里学,最后用 get_normalized_score 报告归一化分数。

也叫
D4RL
相关
离线强化学习、基准测试、Gym MuJoCo 连续控制任务、Adroit 灵巧手任务、Franka Kitchen、保守 Q 学习
来源
D4RL: Datasets for Deep Data-Driven Reinforcement Learning (arXiv 2004.07219)
Farama-Foundation/D4RL GitHub(已弃用,迁往 Minari)
信息截至
2026-09

在完整名词表里查看 →