Eureka
Eureka: Human-Level Reward Design via Coding Large Language Models常用让 GPT-4 写奖励函数代码并反复改进,自动为强化学习设计奖励
英伟达与宾夕法尼亚大学、加州理工、得克萨斯大学奥斯汀分校 2023 年 10 月发布,发表于 ICLR 2024。强化学习的效果高度依赖奖励函数,而手写奖励费时又靠经验。Eureka 把环境源代码和任务描述交给 GPT-4,让它一次写出多份奖励函数代码,分别在 GPU 并行仿真里训练策略,再把训练中各奖励项的统计反馈给模型(奖励反思),让它改写出下一轮更好的版本,像进化搜索一样迭代。在 10 种机器人形态、29 个开源强化学习环境上,它设计的奖励在 83% 的任务上超过人类专家,平均归一化提升 52%。后续的 DrEureka 把这套思路用到仿真到现实迁移上。
例子仿真中的 Shadow 灵巧手用 Eureka 设计的奖励,学会让笔在指间快速连续旋转。
- 相关
- 奖励函数、奖励工程、大语言模型、DrEureka、代码即策略、Isaac Gym
- 来源
- Eureka (arXiv 2310.12931)
- 信息截至
- 2024-04