评估前沿模型高难数学推理的基准测试。
FrontierMath 把 AI 拉进考场做压轴题:题目没在题库里,背答案也拿不到分。
它检验顶尖模型是否真会推理,也让排行榜少靠刷题分高下。
Leaderboard其成绩可作为比较模型数学能力的一项参考。
Benchmark contamination它通过未公开的新题,尽量避免模型靠见过原题得分。
Reasoning-model它主要检验模型处理高难数学问题的推理能力。