把大问题拆成重叠子问题并复用结果的方法。
像做糖葫芦先熬一锅糖浆:这串裹好了,后面同样的果子别再从白糖重新起火。
常用于求最优解和路径,也是很多强化学习方法的基础。
Bellman-equation动态规划常把最优问题写成贝尔曼方程来递推。
Value-iteration价值迭代是用动态规划反复更新价值的经典做法。
Policy-iteration策略迭代先评估再改进,核心也建立在动态规划上。
Q-LearningQ 学习继承了它的思想,但不必先知道环境全貌。