AI Rookies

MDP — Markov Decision Process(马尔可夫决策过程)

事实

描述在状态中行动并获得回报的决策框架。

人话

像下棋走子:你这一步不只图眼前吃子,还得算清会把后面整盘带到哪条路上。

常用来描述强化学习任务,适合机器人控制等连续决策。

相关概念

Reinforcement-learning
强化学习通常先把环境和目标表述成这个框架。

Bellman-equation
贝尔曼方程用来描述它里面的价值递推关系。

Policy-gradient
策略梯度方法通常在这个框架下优化策略。

Q-Learning
Q 学习把决策问题写成它后再学习动作价值。