MMLU(Measuring Massive Multitask Language Understanding)
类型:评测数据集(arXiv:2009.03300,ICLR 2021) 规模:57 个学科(初等数学、美国史、计算机科学、法律等) 题型:4 选 1 多选题 测什么:知识广度 + 学科问题解决
它是过去五年最流行、也最有争议的大模型榜单。
它测的到底是什么
MMLU 被设计成”多学科知识考试”。关键是它测的主要是知识回忆,不是多步推理——这一点在它的升级版 MMLU-Pro 上被直接证实。
论文自己承认的局限
“Models also have lopsided performance and frequently do not know when they are wrong.”
模型的能力分布很不均衡,而且经常不知道自己错了——它给错误答案时也一样自信。这是 MMLU 只测准确率带来的盲区。
“they still have near-random accuracy on some socially important subjects such as morality and law.”
在道德、法律这类有社会重要性的科目上,模型的准确率和瞎猜差不多。这是原始 MMLU 论文自己指出的问题。
三个已知问题
1. 提示词高度敏感(已在升级版中改善)
MMLU-Pro 论文(arXiv:2406.01574)的对比数据:
“the sensitivity of model scores to prompt variations decreased from 4-5% in MMLU to just 2% in MMLU-Pro”
即:同一模型换个提示词模板,MMLU 分数能差 4–5 个百分点。
2. 思维链在它上面无效(这个反转很有信息量)
“models utilizing Chain of Thought (CoT) reasoning achieved better performance on MMLU-Pro compared to direct answering, which is in stark contrast to the findings on the original MMLU, indicating that MMLU-Pro includes more complex reasoning questions.”
这是”知识榜 ≠ 推理榜”的直接证据:同样的 CoT,在纯知识榜上没用,在推理榜上有用。见 思维链。
3. 它是污染的重灾区
MMLU 是 评测污染改写法论文 点名的三个被攻破的榜之一(MMLU、GSM8K、HumanEval):
“a 13B model can easily overfit a test benchmark and achieve drastically high performance, on par with GPT-4”
具体到 MMLU:Llama-2-13B 用改写样本微调后,从约 45–54% 升到 88.5–89.9%。
4. 选择题格式本身脆弱
多选格式存在”选项位置偏见”,详见 评测污染 中提到的 arXiv:2309.03882。
升级版:MMLU-Pro(arXiv:2406.01574)
| MMLU | MMLU-Pro | |
|---|---|---|
| 选项数 | 4 | 10 |
| 规模 | 57 学科 | 12,000 题 / 14 学科 |
| 难度 | — | 准确率比 MMLU 低 16%–33% |
| 提示词敏感度 | 4–5% | 2% |
| CoT 是否有效 | 否 | 是 |
2026 年的现状
- MMLU 原始版已被多数评测机构归入”Legacy(遗留)“,不再作为前沿模型的区分指标。
- MMLU-Pro 仍在使用:2026-08-31 快照榜首为 Gemini 3 Pro Preview(high)89.8%。
- Artificial Analysis 的综合指数不使用 MMLU-Pro,它认为智能体与推理类任务更能反映当代模型能力。
相关页面
- 能力维度 —— 为什么知识榜不能代表全部
- 评测污染 —— 它最大的问题
- HELM整体评估框架 —— 多维评估的对照