AI Rookies

Instruction Tuning — 指令微调

事实

用指令—回答数据把模型调成更会听话的训练方式。

人话

指令微调像给实习生带教:让他按“做表、改稿、列提纲”反复练,慢慢不再一听需求就自由发挥。

常把基础模型调成更会按要求回复的助手。

相关概念

Pretraining
它通常接在预训练之后,给模型补上“听指令”这一步。

Fine-tuning
它本质上属于微调,是微调里很常见的一种做法。

RLHF
它常作为 RLHF 的前一步,先让模型学会按要求回答。

Base model
它把偏通用的基础模型,调成更像聊天助手的样子。