OGBench 离线目标条件强化学习基准
OGBench: Benchmarking Offline Goal-Conditioned RLOGBench进阶专门考离线目标条件强化学习算法的基准,含 8 类环境、85 个数据集。
OGBench 由 Seohong Park、Sergey Levine 等人提出,发表于 ICLR 2025。目标条件强化学习是让策略学会到达任意指定的目标状态;离线指只用固定数据集训练,不再与环境交互。作者认为旧基准上各算法成绩接近、难分高下,于是设计了迷宫导航、方块操作、拼图等 8 类环境和 85 个数据集,分别考察轨迹拼接(把多段不完整轨迹拼成新路线)、长程推理、图像输入和环境随机性,另有 410 个标准离线强化学习任务。它基于 MuJoCo 和 Gymnasium 接口,pip 即可安装,附 GCBC、GCIQL、HIQL 等 6 个参考算法实现。
例子数据集 antmaze-large-navigate-v0:蚂蚁四足机器人在大型迷宫中,需从起点走到评测时指定的目标位置;多数环境各提供 5 个评测目标。
- 相关
- 目标条件强化学习、离线强化学习、D4RL 离线强化学习基准、基准测试、隐式 Q 学习、MuJoCo
- 来源
- OGBench: Benchmarking Offline Goal-Conditioned RL (ICLR 2025)
OGBench project page
GitHub: seohongpark/ogbench