描述在状态中行动并获得回报的决策框架。
像下棋走子:你这一步不只图眼前吃子,还得算清会把后面整盘带到哪条路上。
常用来描述强化学习任务,适合机器人控制等连续决策。
Reinforcement-learning强化学习通常先把环境和目标表述成这个框架。
Bellman-equation贝尔曼方程用来描述它里面的价值递推关系。
Policy-gradient策略梯度方法通常在这个框架下优化策略。
Q-LearningQ 学习把决策问题写成它后再学习动作价值。