AI Rookies

RLHF — 人类反馈强化学习

事实

用人类偏好反馈训练模型更符合预期的方法。

人话

RLHF 像给 AI 上礼仪课:这句像人话,那句像客服灾难,慢慢改。

它能让模型更有帮助、更少乱来,但也可能把回答训练得太圆滑。

相关概念

Alignment
RLHF 通过人类反馈推动模型行为接近 Alignment 目标。

Fine-tuning
RLHF 常发生在 Fine-tuning 阶段,用于调整偏好。

LLM
经过 RLHF 后,LLM 更倾向于符合人类预期的回答。