AI Rookies

Benchmark Saturation — 基准测试饱和

事实

模型分数逼近满分,基准难以再区分能力的现象。

人话

基准饱和好比全班刷透一套模拟卷:满分挤成早高峰,学霸和背题王都看不出来。

排行榜会失去区分度,得换更难、更新的题目。

相关概念

Benchmark Contamination
训练数据混入测试题,会让饱和来得更早。

Leaderboard
分数扎堆后,排行榜难再拉开模型差距。

Evaluation Harness
评测框架需持续换题,才能保留区分度。