AI Rookies

Value Iteration — 价值迭代

事实

一种反复更新状态价值来求最优策略的方法。

人话

像租房前把几套房的通勤、房租、采光反复盘:一轮轮算完,最值那套自然冒出来。

常用于序贯决策中求最优策略,是规划和强化学习的经典方法。

相关概念

Bellman-equation
价值迭代通过反复做贝尔曼更新来逼近最优解。

Dynamic-programming
它是动态规划在序贯决策问题中的经典做法。

Policy-iteration
它和策略迭代并列,都是求最优策略的经典方法。

Markov-decision-process
价值迭代常用于求解已知环境的马尔可夫决策过程。