AI Rookies

FrontierMath — 前沿数学基准测试

事实

评估前沿模型高难数学推理的基准测试。

人话

FrontierMath 把 AI 拉进考场做压轴题:题目没在题库里,背答案也拿不到分。

它检验顶尖模型是否真会推理,也让排行榜少靠刷题分高下。

相关概念

Leaderboard
其成绩可作为比较模型数学能力的一项参考。

Benchmark contamination
它通过未公开的新题,尽量避免模型靠见过原题得分。

Reasoning-model
它主要检验模型处理高难数学问题的推理能力。