描述当前价值与未来回报关系的递推方程。
像老中医开方子:不能只看今天这口气色,得把后面几服药的走向一并算进去。
常用于计算长期价值,是强化学习评估和找最优策略的基础。
Reinforcement-learning
它是强化学习里定义和计算长期回报的核心公式。
Markov-decision-process
贝尔曼方程通常建立在 MDP 的状态转移设定上。
Q-Learning
Q-Learning 的更新规则可看作对它的采样近似。
Dynamic-programming
动态规划常利用它递推求出价值函数或最优策略。