用人类偏好反馈训练模型更符合预期的方法。
RLHF 像给 AI 上礼仪课:这句像人话,那句像客服灾难,慢慢改。
它能让模型更有帮助、更少乱来,但也可能把回答训练得太圆滑。
AlignmentRLHF 通过人类反馈推动模型行为接近 Alignment 目标。
Fine-tuningRLHF 常发生在 Fine-tuning 阶段,用于调整偏好。
LLM经过 RLHF 后,LLM 更倾向于符合人类预期的回答。