具身智能新手名词表English

更新-数据比

Update-to-Data RatioUTD进阶

每采集一步环境数据做几次梯度更新;越高越省数据,也越费算力。

更新-数据比指离策略强化学习里,每和环境交互一步、往经验回放里加一条数据后,网络做多少次梯度更新。标准 SAC 通常取 1。真机强化学习里采数据慢而贵,算力相对便宜,于是希望调高这个比值,把同一批数据多学几遍。但直接调高容易让 Q 函数过拟合和高估,训练变差。REDQ(ICLR 2021)用 Q 网络集成,首次让无模型算法在 UTD 远大于 1 时稳定工作;DroQ 改用 dropout 和层归一化,计算更省。SERL 等真机强化学习框架依赖高 UTD 提高样本效率,并把采集和训练拆成两个线程。

例子「A Walk in the Park」(2022)在宇树 A1 四足上以 SAC 为基础,加层归一化并把 UTD 提到 20,即每采一步数据做 20 次评论家更新,约 20 分钟真机训练学会行走。

也叫
UTD 比、UTD Ratio、重放比、Replay Ratio
相关
样本效率、经验回放、异策略、真机强化学习、SERL、Q 值高估
来源
Chen et al. 2021: Randomized Ensembled Double Q-Learning: Learning Fast Without a Model (REDQ, ICLR 2021)
Smith, Kostrikov, Levine 2022: A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning
Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning

在完整名词表里查看 →