AI Rookies

REINFORCE — REINFORCE 算法

事实

按回报直接更新策略的蒙特卡洛策略梯度方法。

人话

REINFORCE像月底算提成:这单成了,就把前面那套话术动作都算功劳,下次继续这么干。

常用于策略优化,适合回合结束后统一记奖惩的任务。

相关概念

Policy Gradient
REINFORCE 是策略梯度方法的经典入门形式。

Reinforcement Learning
它用环境回报来直接更新策略参数。

Actor-Critic
Actor-Critic 可看作对它的改进版,方差更低。

RLHF
RLHF 的策略优化部分继承了这类强化学习思路。