AI Rookies

Leaderboard — 模型排行榜

事实

按统一评测结果对模型进行排名的榜单。

人话

榜单一出,AI 圈立刻进入放榜模式:谁冲上前排谁就被围观,分高那位先享受全场注目礼。

它常用于选模型和看趋势,但高分不一定等于好用。

相关概念

Benchmark contamination
如果测试题被模型见过,排行榜成绩就可能好看得不真实。

Third-party-ai-evaluation
第三方评测能从不同维度补充排行榜,避免只盯单一分数。

LLM-as-a-judge
有些排行榜会用模型来辅助打分,尤其在主观任务上。

Frontier model
前沿模型最常在排行榜上被放在一起比较高低。