AI Rookies

MMLU — Massive Multitask Language Understanding,大规模多任务语言理解

事实

用多学科选择题评测语言模型知识的基准。

人话

MMLU 像给 AI 办超级联考:文理医法全上桌,看是真学霸还是会蒙。

常用于模型排行榜,衡量通识与专业知识,但分数不等于会干活。

相关概念

LLM
MMLU 常用来衡量 LLM 的多学科知识水平。

Leaderboard
排行榜常用 MMLU 分数比较模型强弱。

Benchmark Contamination
若题目进了训练集,MMLU 分数会虚高。

QA
MMLU 的题目主要以选择问答形式呈现。