AI Rookies

Policy Iteration — 策略迭代

事实

一种交替做策略评估与改进的强化学习求解法。

人话

像武侠门派拆招:先验这套招法能不能赢,再把破绽改掉,下一轮换更强的出手。

常用于已知环境模型的规划,靠反复评估和改进逼近更优决策。

相关概念

Reinforcement-learning
它是强化学习里求最优决策的经典方法。

Markov-decision-process
它通常在 MDP 框架下定义状态、动作和回报。

Bellman-equation
策略评估这一步,要靠贝尔曼方程计算价值。

Value-iteration
它和价值迭代目标相同,但分开评估与改进。