用大规模数据训练模型获得通用能力的阶段。
预训练像先把孩子扔进巨型图书馆,能不能成才另说,见识先堆满。
它让模型学会语言、知识和模式,是后续微调和应用的地基。
Foundation-model
Foundation-model 的通用能力主要来自大规模 Pretraining。
Parameter
Pretraining 通过海量数据不断更新 Parameter。
Scaling-law
Scaling-law 推动了持续扩大的 Pretraining 规模与数据投入。
GPU
Pretraining 规模越大,对 GPU 算力的需求越高。