一种交替做策略评估与改进的强化学习求解法。
像武侠门派拆招:先验这套招法能不能赢,再把破绽改掉,下一轮换更强的出手。
常用于已知环境模型的规划,靠反复评估和改进逼近更优决策。
Reinforcement-learning
它是强化学习里求最优决策的经典方法。
Markov-decision-process
它通常在 MDP 框架下定义状态、动作和回报。
Bellman-equation
策略评估这一步,要靠贝尔曼方程计算价值。
Value-iteration
它和价值迭代目标相同,但分开评估与改进。