按统一评测结果对模型进行排名的榜单。
榜单一出,AI 圈立刻进入放榜模式:谁冲上前排谁就被围观,分高那位先享受全场注目礼。
它常用于选模型和看趋势,但高分不一定等于好用。
Benchmark contamination
如果测试题被模型见过,排行榜成绩就可能好看得不真实。
Third-party-ai-evaluation
第三方评测能从不同维度补充排行榜,避免只盯单一分数。
LLM-as-a-judge
有些排行榜会用模型来辅助打分,尤其在主观任务上。
Frontier model
前沿模型最常在排行榜上被放在一起比较高低。