MMLU(Measuring Massive Multitask Language Understanding)

类型:评测数据集(arXiv:2009.03300,ICLR 2021) 规模:57 个学科(初等数学、美国史、计算机科学、法律等) 题型:4 选 1 多选题 测什么:知识广度 + 学科问题解决

它是过去五年最流行、也最有争议的大模型榜单。


它测的到底是什么

MMLU 被设计成”多学科知识考试”。关键是它测的主要是知识回忆,不是多步推理——这一点在它的升级版 MMLU-Pro 上被直接证实。

论文自己承认的局限

“Models also have lopsided performance and frequently do not know when they are wrong.”

模型的能力分布很不均衡,而且经常不知道自己错了——它给错误答案时也一样自信。这是 MMLU 只测准确率带来的盲区。

“they still have near-random accuracy on some socially important subjects such as morality and law.”

在道德、法律这类有社会重要性的科目上,模型的准确率和瞎猜差不多。这是原始 MMLU 论文自己指出的问题。

三个已知问题

1. 提示词高度敏感(已在升级版中改善)

MMLU-Pro 论文(arXiv:2406.01574)的对比数据:

“the sensitivity of model scores to prompt variations decreased from 4-5% in MMLU to just 2% in MMLU-Pro”

即:同一模型换个提示词模板,MMLU 分数能差 4–5 个百分点。

2. 思维链在它上面无效(这个反转很有信息量)

“models utilizing Chain of Thought (CoT) reasoning achieved better performance on MMLU-Pro compared to direct answering, which is in stark contrast to the findings on the original MMLU, indicating that MMLU-Pro includes more complex reasoning questions.”

这是”知识榜 ≠ 推理榜”的直接证据:同样的 CoT,在纯知识榜上没用,在推理榜上有用。见 思维链。

3. 它是污染的重灾区

MMLU 是 评测污染改写法论文 点名的三个被攻破的榜之一(MMLU、GSM8K、HumanEval):

“a 13B model can easily overfit a test benchmark and achieve drastically high performance, on par with GPT-4”

具体到 MMLU:Llama-2-13B 用改写样本微调后,从约 45–54% 升到 88.5–89.9%。

4. 选择题格式本身脆弱

多选格式存在”选项位置偏见”,详见 评测污染 中提到的 arXiv:2309.03882。

升级版:MMLU-Pro(arXiv:2406.01574)

MMLUMMLU-Pro
选项数410
规模57 学科12,000 题 / 14 学科
难度—准确率比 MMLU 低 16%–33%
提示词敏感度4–5%2%
CoT 是否有效否是

2026 年的现状

  • MMLU 原始版已被多数评测机构归入”Legacy(遗留)“,不再作为前沿模型的区分指标。
  • MMLU-Pro 仍在使用:2026-08-31 快照榜首为 Gemini 3 Pro Preview(high)89.8%。
  • Artificial Analysis 的综合指数不使用 MMLU-Pro,它认为智能体与推理类任务更能反映当代模型能力。

相关页面