AI Rookies

RL — Reinforcement Learning|强化学习

事实

通过奖励信号试错学习策略的方法。

人话

教小孩游泳那套就是它:不先背标准动作,呛几口水、扑腾两下,身体自己学会。

适合游戏、机器人和自动决策,让系统在试错中找到更优动作。

相关概念

RLHF
它加上人类反馈后,形成更贴近对话模型的 RLHF。

Policy Gradient
策略梯度是强化学习里直接优化策略的经典方法。

Q-learning
Q-learning 是强化学习中按价值学习动作的代表算法。

Alignment
强化学习常靠奖励设计,让系统行为更贴近人类目标。