衡量基准是否真正测到目标能力的程度。
武馆里只会对木人桩打满分,真遇上擂台未必顶用;基准有效性测的是模型能不能实战。
它决定排行榜能否反映真本事,影响模型选型和发布判断。
Benchmark Contamination训练数据泄漏会虚高成绩,破坏基准的有效性。
Benchmark Saturation题目被模型刷透后,基准难再区分真实能力。
Leaderboard排行榜是否可信,取决于所用基准是否有效。