AI Rookies

DP — Dynamic Programming|动态规划

事实

把大问题拆成重叠子问题并复用结果的方法。

人话

像做糖葫芦先熬一锅糖浆:这串裹好了,后面同样的果子别再从白糖重新起火。

常用于求最优解和路径,也是很多强化学习方法的基础。

相关概念

Bellman-equation
动态规划常把最优问题写成贝尔曼方程来递推。

Value-iteration
价值迭代是用动态规划反复更新价值的经典做法。

Policy-iteration
策略迭代先评估再改进,核心也建立在动态规划上。

Q-Learning
Q 学习继承了它的思想,但不必先知道环境全貌。