AI Rookies

Bellman Equation — 贝尔曼方程

事实

描述当前价值与未来回报关系的递推方程。

人话

像老中医开方子:不能只看今天这口气色,得把后面几服药的走向一并算进去。

常用于计算长期价值,是强化学习评估和找最优策略的基础。

相关概念

Reinforcement-learning
它是强化学习里定义和计算长期回报的核心公式。

Markov-decision-process
贝尔曼方程通常建立在 MDP 的状态转移设定上。

Q-Learning
Q-Learning 的更新规则可看作对它的采样近似。

Dynamic-programming
动态规划常利用它递推求出价值函数或最优策略。