模型分数逼近满分,基准难以再区分能力的现象。
基准饱和好比全班刷透一套模拟卷:满分挤成早高峰,学霸和背题王都看不出来。
排行榜会失去区分度,得换更难、更新的题目。
Benchmark Contamination训练数据混入测试题,会让饱和来得更早。
Leaderboard分数扎堆后,排行榜难再拉开模型差距。
Evaluation Harness评测框架需持续换题,才能保留区分度。