能力维度(Capability Dimensions)

一句话定义:大模型的”智能”不是一根轴上的高低,而是一组彼此相关但不完全同步的独立能力。同一个模型,可能数学满分而工具调用拉胯,也可能知识渊博但推不动一步逻辑。

这是理解”为什么跑分互相打架”的钥匙。


1. 为什么必须拆成多维

HELM整体评估框架 给出的理由最扎实:

“Prior to HELM, models on average were evaluated on just 17.9% of the core HELM scenarios, with some prominent models not sharing a single scenario in common.”

两个模型可能根本没在同一张卷子上考过——这是”跑分不能横向比较”的方法论根源。

HELM 的做法是建立”场景(scenario)× 指标(metric)“矩阵,其中指标有 7 个:accuracy(准确率)、calibration(校准)、robustness(鲁棒性)、fairness(公平性)、bias(偏见)、toxicity(毒性)、efficiency(效率)。

2. 2026 年主流的能力切分

第三方评测机构 Artificial Analysis 用两套标签:

  • skill(能力):Reasoning、Agentic、Tool Use、Coding、Instruction Following、Long Context、Writing、User Interaction、Faithfulness、Multilingual
  • knowledge(知识域):Humanities、Science、Math、Business、Legal、Medical、Finance

它自己的综合指数权重也隐含了价值判断:Agents 34%、Coding 24%、Scientific Reasoning 24%、General 18%。“什么算智能”本身就是个可以被质疑的选择。

3. 几个关键维度以及它们的独立性

维度主要取决于什么与参数量的关系
知识广度预训练数据的覆盖与质量、知识容量正相关,但有 2 bits/param 上限
推理(reasoning)后训练 / 强化学习、思维链弱相关——见第 4 节
工具调用专门的工具调用后训练数据不单调——见 工具调用
长上下文位置编码、长文本训练、注意力稀疏化标称长度 ≠ 有效长度,见 长上下文
指令遵循指令微调数据 + 指令是否可验证小模型未必输大模型,见 指令遵循
稳定性/一致性模型自身方差与单次成功率不成正比,见 一致性指标pass的k次方
拒答(abstention)训练中的”不知道”信号独立维度——见第 5 节

4. 最硬的一条:知识与推理是两条独立的轴

知识操纵与思维链论文 的受控实验:

模型能把每个人的出生月份答对 100%,训了 25,000 条样本,却回答不了”这个人出生在偶数月吗”——除非让它先把月份说出来,再判断奇偶。

“language models cannot efficiently be trained+finetuned to perform even a single step of knowledge manipulation during inference time without CoT”

不做思维链的话,语言模型连一步知识操纵都做不到。注意 “even a single step”(连一步都)这个措辞——不是「多步推理会失败」,而是一步都不行。

“Improving model’s knowledge extraction don’t improve its manipulation ability”

而且这个缺陷规模也救不了:“modern large models like GPT-4 or Llama-3 … struggle with these tasks … these limitations may be inherent to generative language models and not easily overcome by scaling up.”

5. 拒答能力:一个常被忽略的维度

Chroma 的 ContextRot技术报告 发现模型家族之间存在系统分化:

“Claude models consistently exhibit the lowest hallucination rates. … they tend to abstain when uncertain, explicitly stating that no answer can be found. In contrast, GPT models show the highest rates of hallucination, often generating confident but incorrect responses when distractors are present.”

关键点:幻觉率低不等于懂得多,而是”更愿意说不知道”。这是一个与知识量正交的能力。

6. 这对”参数 → 智能”意味着什么

  • 参数是必要不充分条件。参数决定了”能装多少”,但装什么、怎么取、会不会用,是几个不同的能力。
  • 不同维度的”解锁”节奏不同:有的随规模平滑改善,有的靠后训练数据突然可用,有的取决于工程框架。
  • 所以”这个模型多强”是个不完整的问题,正确问法是:“在我关心的那一两个维度上,它排第几?“

7. 2026 年的实证:各榜榜首不是同一个模型

抓取于 2026-08-31(Artificial Analysis 口径,各榜快照时间不同步):

榜单榜首
综合指数Claude Opus 5(63)
GPQA Diamond(科学推理)Grok 4.6(94.9%)
MMLU-Pro(知识+推理)Gemini 3 Pro Preview(89.8%)
LiveCodeBench(代码)Gemini 3 Pro Preview(91.7%)
Terminal-Bench v2.1(终端智能体)GPT-5.6 Sol(89.5%)
Humanity’s Last Exam(前沿学术)Claude Fable 5(55.5%)
LMArena Text(人类偏好)Claude Fable 5(1507)

没有一个模型同时拿下两个以上的榜首——这就是能力多维的最直观证据。

相关页面