一种限制策略更新幅度的强化学习算法。
PPO 像老中医下药先小调方:能改,但不能猛加猛减,不然人还没养好,先被药劲晃翻了。
常用于训练会连续试错的智能体,也常见于 RLHF。
Reinforcement-learning
PPO 是强化学习中常用的策略优化算法。
Policy-gradient
PPO 基于策略梯度思路,重点是让更新更稳。
RLHF
RLHF 常用 PPO 来根据人类偏好继续调模型。
Kullback-leibler-divergence
PPO 常借助 KL 约束,防止策略一下改太猛。