模型在训练时见过测试题,会让评测结果失真。
基准污染就像考前偷看题库:上榜时像学霸,换套卷子立刻原形毕露。
它会让模型评测虚高,常见于排行榜、第三方评测,也逼着训练数据更仔细清洗。
Pretraining
如果测试集内容混进预训练数据,后面的评测成绩就不再可靠。
LLM
benchmark contamination 会让人高估 LLM 的真实能力,以为它会做,其实只是见过。
AGI
当大家用基准分数判断 AGI 进展时,污染会让结论显得过度乐观。
AI-regulation
监管若参考被污染的评测结果,可能建立在失真的能力判断上。