通过奖励信号试错学习策略的方法。
教小孩游泳那套就是它:不先背标准动作,呛几口水、扑腾两下,身体自己学会。
适合游戏、机器人和自动决策,让系统在试错中找到更优动作。
RLHF它加上人类反馈后,形成更贴近对话模型的 RLHF。
Policy Gradient策略梯度是强化学习里直接优化策略的经典方法。
Q-learningQ-learning 是强化学习中按价值学习动作的代表算法。
Alignment强化学习常靠奖励设计,让系统行为更贴近人类目标。