用神经网络近似动作价值函数的强化学习方法。
它像下棋时心里先给每一步偷偷标分:这手能不能翻盘、会不会送子,久了就更会落子。
常用于游戏和控制任务,把试错经验学成动作分值。
Q-Learning它是 Q 学习的深度版,用神经网络代替查表。
Deep-Reinforcement-Learning它是深度强化学习的经典代表方法之一。
Bellman Equation它用贝尔曼方程来构造价值更新目标。
TD Learning它属于时序差分学习路线,边走边改估值。