AI Rookies

Q-Learning — Q 学习

事实

一种通过奖励反馈学习动作价值的强化学习方法。

人话

像下棋时自己记胜率:这步走完更容易赢还是送子?多吃几次亏,心里那本账就准了。

让智能体靠试错学决策,常见于游戏、控制和路径规划。

相关概念

Reinforcement-learning
它是强化学习中最经典、最常见的基础方法之一。

Temporal-difference-learning
它用时序差分方式,根据新反馈持续修正价值估计。

Policy Gradient
它先学动作值,后者则直接优化采取动作的策略。

Actor-critic
它的价值评估思路,后来被吸收到 Actor-Critic 框架里。