AI Rookies

Deep Q-Network — 深度 Q 网络

事实

用神经网络近似动作价值函数的强化学习方法。

人话

它像下棋时心里先给每一步偷偷标分:这手能不能翻盘、会不会送子,久了就更会落子。

常用于游戏和控制任务,把试错经验学成动作分值。

相关概念

Q-Learning
它是 Q 学习的深度版,用神经网络代替查表。

Deep-Reinforcement-Learning
它是深度强化学习的经典代表方法之一。

Bellman Equation
它用贝尔曼方程来构造价值更新目标。

TD Learning
它属于时序差分学习路线,边走边改估值。