AI Rookies

Policy Gradient — 策略梯度

事实

一种直接优化策略、提升长期回报的强化学习方法。

人话

它教 AI 踢球不盯每脚姿势,只看这回合最后进没进:进了,就把刚才那套跑位和出脚多练几遍。

它常用于机器人控制和 RLHF,让模型根据反馈逐步学会更好的决策。

相关概念

RLHF
RLHF 常用它根据奖励信号,调整模型偏好的方向。

SGD
它算出梯度后,通常还是靠梯度下降更新参数。

Agent
它适合训练需要连续决策的智能体不断试错。