按回报直接更新策略的蒙特卡洛策略梯度方法。
REINFORCE像月底算提成:这单成了,就把前面那套话术动作都算功劳,下次继续这么干。
常用于策略优化,适合回合结束后统一记奖惩的任务。
Policy GradientREINFORCE 是策略梯度方法的经典入门形式。
Reinforcement Learning它用环境回报来直接更新策略参数。
Actor-CriticActor-Critic 可看作对它的改进版,方差更低。
RLHFRLHF 的策略优化部分继承了这类强化学习思路。