一种直接优化策略、提升长期回报的强化学习方法。
它教 AI 踢球不盯每脚姿势,只看这回合最后进没进:进了,就把刚才那套跑位和出脚多练几遍。
它常用于机器人控制和 RLHF,让模型根据反馈逐步学会更好的决策。
RLHFRLHF 常用它根据奖励信号,调整模型偏好的方向。
SGD它算出梯度后,通常还是靠梯度下降更新参数。
Agent它适合训练需要连续决策的智能体不断试错。