AI Rookies

Post-training — 后训练

事实

预训练后调校模型行为与偏好的阶段。

人话

后训练就是相亲前的礼仪课:本事已有,再教模型别抢话、会接梗。

用于调安全和偏好,常在助手上线前完成。

相关概念

Pretraining
预训练先学通识,后训练再调行为和偏好。

Fine-tuning
微调是后训练里最常见的技术手段之一。

Instruction Tuning
指令微调用样例教模型更好地听人话。

RLHF
RLHF 用人类反馈把回答调得更符合偏好。