模型性能随参数、数据和算力扩大呈规律性提升的经验规律。
缩放定律像补习班提分公式:题刷得多、课时够足,分数大概率往上走。
它用来预估大模型训练收益,决定要不要继续砸数据和算力。
Parameter
更多 Parameter 往往需要更大规模的 Pretraining 才能发挥作用。
Pretraining
Scaling-law 推动了持续扩大的 Pretraining 规模与数据投入。
Compute-race
Scaling-law 推动了对算力的持续竞争,最终形成 Compute-race。
Emergence
当模型规模持续扩大时,AI 可能突然出现原本没人预料到的新能力。