具身智能新手名词表English

时序差分学习

Temporal Difference LearningTD常用

用「这一步奖励 + 下一状态的估计价值」来更新当前价值估计的方法。

时序差分学习由 Richard Sutton 在 1988 年的论文中系统提出,是强化学习里估计价值函数(衡量某个状态或动作之后能拿多少总回报)的核心方法。它不必等一整局结束拿到真实回报,而是每走一步就更新:把「实际拿到的奖励 r + 折扣后的下一状态估计值 γV(s′)」当作目标,它与当前估计 V(s) 的差叫 TD 误差,按它修正 V(s)。这种「用估计去更新估计」的做法叫自举,比等整局结束再算的蒙特卡洛方法方差更小、能边走边学,代价是会引入偏差。Q 学习、DQN,以及 SAC、TD3 的评论家网络都靠 TD 目标训练;早期名作 TD-Gammon 用它学到了专家水平的西洋双陆棋。

例子机械臂走一步得到奖励 0,评论家估计下一状态价值为 0.8,折扣因子 γ=0.99,则 TD 目标为 0+0.99×0.8=0.792;若当前状态估值是 0.5,TD 误差为 0.292,网络就把当前估值往 0.792 的方向调一点。

也叫
TD 学习、TD 误差、时间差分学习
相关
价值函数、贝尔曼方程、自举、Q 学习、蒙特卡洛方法(蒙特卡洛回报)、广义优势估计
来源
Temporal difference learning (Wikipedia)
Soft Actor-Critic (OpenAI Spinning Up)

在完整名词表里查看 →