AI Rookies

TD Learning — 时序差分学习(Temporal-Difference Learning)

事实

一种用当前估计差值逐步更新价值的强化学习方法。

人话

它像月考后估分:不用等期末总成绩,先看这题比预想高还是低,下一次立刻改策略。

常用来更新价值判断,让智能体边走边学、越估越准。

相关概念

Reinforcement-learning
它是强化学习中的经典学习方法,用奖励差值逐步更新判断。

Q-learning
Q-learning 用它更新 Q 值,不必等整局结束再学习。

Actor-critic
Actor-Critic 里负责评价的 critic,常靠它持续修正。

Policy-gradient
它重在学价值估计,和直接优化策略的方法形成互补。