一种把选动作与打分估值分开的强化学习方法。
跟说相声似的:一个负责现挂出活,一个负责台下听响,别让演员自己给自己鼓掌。
常用于机器人、游戏和 RLHF,让动作学习更稳、更少乱试。
Policy Gradient它在策略梯度上加入价值评估,训练通常更稳。
Q-learning它吸收价值学习思路,但不只学打分,也直接学动作。
Reinforcement-learning它是强化学习中的经典方法族,常用于连续控制。
RLHF很多对齐训练会用它来优化策略并稳定学习过程。