具身智能新手名词表English

TD-MPC2

TD-MPC2: Scalable, Robust World Models for Continuous Control进阶

在学到的隐空间世界模型里做规划的强化学习算法,一套超参数通吃上百个控制任务

UC San Diego 的 Nicklas Hansen、苏昊、王小龙 2023 年 10 月发布,是 ICLR 2024 Spotlight 论文,改进自同一团队的 TD-MPC。它属于基于模型的强化学习:先学一个只在隐空间里预测下一状态、奖励和价值的世界模型(不重建图像,即无解码器);决策时在隐空间里做模型预测控制(MPC),短期靠模型推演,更远的回报交给用时序差分(TD)学到的价值函数估计,名字由此而来。TD-MPC2 在 DMControl、Meta-World、ManiSkill2、MyoSuite 四个领域共 104 个连续控制任务上,用同一套超参数表现稳定;还训练出一个 3.17 亿参数、能做 80 个任务的多任务智能体,显示能力随模型和数据规模增长。

例子同一个 TD-MPC2 多任务模型既能控制 DMControl 里的猎豹奔跑,也能控制 Meta-World 里的机械臂开抽屉,训练时不用为每个任务单独调超参数。

也叫
TD-MPC 2
相关
基于模型的强化学习、世界模型、模型预测控制、隐空间世界模型、时序差分学习、DreamerV3
来源
TD-MPC2: Scalable, Robust World Models for Continuous Control (arXiv 2310.16828)
TD-MPC2 project page
信息截至
2024-01

在完整名词表里查看 →