DIAMOND(扩散世界模型)
DIAMOND: Diffusion for World Modeling (Visual Details Matter in Atari)DIAMOND进阶用扩散模型逐帧生成画面当世界模型,让强化学习智能体在生成的环境里练游戏。
DIAMOND 由日内瓦大学、爱丁堡大学和微软研究院的研究者于 2024 年 5 月发布,是 NeurIPS 2024 Spotlight 论文。此前不少世界模型(如 IRIS、DreamerV3)把画面压成离散 token 或隐变量再预测,容易丢掉小而关键的视觉细节。DIAMOND 直接用扩散模型根据过去几帧和动作生成下一帧图像,并梳理了让它稳定做长时间预测的关键设计。智能体完全在这个生成环境里用强化学习训练,再到真实游戏中测试:在 Atari 100k 基准上平均人类归一化分数 1.46,是当时纯世界模型训练智能体的最好成绩。它还展示了扩散世界模型可当可交互的游戏引擎,与 GameNGen、Genie 思路相近。
例子作者用 87 小时《反恐精英:全球攻势》(CS:GO)人类对局数据训练了一个 3.81 亿参数的扩散世界模型,在 RTX 3090 上约 10 帧/秒运行,人可以用键鼠在里面实时「玩」。
- 也叫
- Diffusion for World Modeling
- 相关
- 世界模型、扩散模型、想象中学习、GameNGen(神经游戏引擎)、DreamerV3、Atari 游戏基准(街机学习环境 / Atari 100k)
- 来源
- Diffusion for World Modeling: Visual Details Matter in Atari (arXiv:2405.12399)
DIAMOND 项目主页 - 信息截至
- 2024-10