用多学科选择题评测语言模型知识的基准。
MMLU 像给 AI 办超级联考:文理医法全上桌,看是真学霸还是会蒙。
常用于模型排行榜,衡量通识与专业知识,但分数不等于会干活。
LLMMMLU 常用来衡量 LLM 的多学科知识水平。
Leaderboard排行榜常用 MMLU 分数比较模型强弱。
Benchmark Contamination若题目进了训练集,MMLU 分数会虚高。
QAMMLU 的题目主要以选择问答形式呈现。