AI Rookies

Actor-Critic — 演员-评论家方法

事实

一种把选动作与打分估值分开的强化学习方法。

人话

跟说相声似的:一个负责现挂出活,一个负责台下听响,别让演员自己给自己鼓掌。

常用于机器人、游戏和 RLHF,让动作学习更稳、更少乱试。

相关概念

Policy Gradient
它在策略梯度上加入价值评估,训练通常更稳。

Q-learning
它吸收价值学习思路,但不只学打分,也直接学动作。

Reinforcement-learning
它是强化学习中的经典方法族,常用于连续控制。

RLHF
很多对齐训练会用它来优化策略并稳定学习过程。