一种用当前估计差值逐步更新价值的强化学习方法。
它像月考后估分:不用等期末总成绩,先看这题比预想高还是低,下一次立刻改策略。
常用来更新价值判断,让智能体边走边学、越估越准。
Reinforcement-learning
它是强化学习中的经典学习方法,用奖励差值逐步更新判断。
Q-learning
Q-learning 用它更新 Q 值,不必等整局结束再学习。
Actor-critic
Actor-Critic 里负责评价的 critic,常靠它持续修正。
Policy-gradient
它重在学价值估计,和直接优化策略的方法形成互补。