一种反复更新状态价值来求最优策略的方法。
像租房前把几套房的通勤、房租、采光反复盘:一轮轮算完,最值那套自然冒出来。
常用于序贯决策中求最优策略,是规划和强化学习的经典方法。
Bellman-equation
价值迭代通过反复做贝尔曼更新来逼近最优解。
Dynamic-programming
它是动态规划在序贯决策问题中的经典做法。
Policy-iteration
它和策略迭代并列,都是求最优策略的经典方法。
Markov-decision-process
价值迭代常用于求解已知环境的马尔可夫决策过程。