机械可解释性(Mechanistic Interpretability)

一句话定义:把大模型当成一台可以被拆开看内部的机器,反推出里面”具体跑了哪些算法”。它是回答”LLM 是不是只是在排字/统计糊”最硬的一条机制层证据线。

核心反直觉结论:如果 LLM 只是统计噪声,它的内部应该无法解析;但它内部存在可以被人类看懂、命名、甚至编辑的具体算法结构。


1. 地基:残差流与回路

Anthropic 的《A Mathematical Framework for Transformer Circuits》(2021-12)提出两个核心概念:

  • 残差流(residual stream):每一层都往同一条”信息高速公路”上读写向量——可以想成一块共用的白板/公共总线。
  • 回路(circuit):多个注意力头/MLP 协同完成一个可命名的”小算法”。

该文还点出了模型内部极其拥挤:残差流的神经元数量是维度数的约 100 倍,只好”以叠加(superposition)的方式通信”。

2. 归纳头(Induction Head):“看过一遍就会照做”的最小算法

Olsson, Elhage et al.(Anthropic, arXiv:2209.11895)摘要逐字:

“‘Induction heads’ are attention heads that implement a simple algorithm to complete token sequences like [A][B] … [A] -> [B] … We find that induction heads develop at precisely the same point as a sudden sharp increase in in-context learning ability.”

翻译:归纳头实现一个简单算法——补全形如 [A][B] … [A] → [B] 的序列;它恰好和”上下文学习能力突然陡增”出现在同一时刻(训练损失曲线上表现为一个凸起)。

机制:第一个头把”前一个 token”的信息抄下来;第二个头(归纳头)回找”当前 token A 上次出现的位置”,注意它后面那个 token B,抄过来。

为什么重要:模型能做到”看一遍示范、当场就会照做”——这不是死记训练语料,而是运行时(in-context)动态学到的模式,且是一个看得见、说得清的算法。

⚠️ 论文自陈:对小的”纯注意力”模型是因果性证据;对带 MLP 的大模型只是相关性证据。

3. 叠加(Superposition)与稀疏自编码器(SAE)

问题:一个神经元常对好几种不相干的东西都有反应(多义性 polysemanticity),使”一个神经元 = 一个概念”的天真解读失败。

叠加(Elhage et al., arXiv:2209.10652)解释原因:“Superposition simply means that there are more features than dimensions.”(特征数量多于维度数量。)

对策——稀疏自编码器(sparse autoencoder, SAE):把混沌的激活向量拆成成千上万个**近乎单义(monosemantic)**的特征。

论文对象关键
Towards Monosemanticity(2023)单层 Transformer,MLP 仅 512 个神经元在 80 亿数据点上训 SAE;扩维 1×–256×(512 → 131,072 特征)
Scaling Monosemanticity(2024)Claude 3 Sonnet抽出高度抽象、跨语言、多模态的特征

最好玩的一手案例:特征编号 34M/31164353(“金门大桥”),对中、日、韩、俄等多语种维基首句都强烈触发。把它钳制到 10 倍激活时,模型开始”自认是金门大桥”。

⚠️ 常见误引(中文读物高频错误):《Towards Monosemanticity》分解的是单层小模型,不是 GPT-2。把 SAE 用到 Claude 3 Sonnet 的是 2024 年的《Scaling Monosemanticity》。

4. 世界模型证据:Othello-GPT 及其反方

正方:Li et al.(arXiv:2210.13382, ICLR 2023 oral)只给模型看黑白棋走子序列、从不给棋盘,却发现模型内部涌现出对棋盘状态的表示,且干预该表示能改变输出。后续(Nanda et al., arXiv:2309.00941)甚至找到线性棋盘表示,可用简单向量加减操控模型行为。

反方:Vafa et al.(arXiv:2406.03689)——生成模型”在现有世界模型检测上表现很好,但新指标显示其世界模型远没有看上去那么自洽”,做细微不同的任务时会突然失败。

平衡结论:LLM 在内部构造的是**“有用的、局部可靠的”世界模型**,而非人类那样完备统一的模型。这既否定”纯排字”,也否定”它真懂”。

5. 为什么这条线对”排字之争”关键

立场该线提供的证据
支持”不只是排字”内部有可命名、可干预的算法结构与抽象特征
支持”仍未真懂”世界模型不自洽;归纳头在大模型上只是相关性证据

一句话:机械可解释性把”内部是不是统计糊”这个问题,从哲学争论变成了**可以指着一个具体特征说”看,这是金门大桥”**的实证问题。

相关页面

来源

  • 《LLM 真的只是排字游戏吗?》机制层底稿:processed/LLM排字游戏-机制层数据底稿.md
  • Olsson et al., In-context Learning and Induction Heads, arXiv:2209.11895
  • Elhage et al., Toy Models of Superposition, arXiv:2209.10652
  • Bricken et al., Towards Monosemanticity(2023);Templeton et al., Scaling Monosemanticity(2024)
  • Li et al., Emergent World Representations, arXiv:2210.13382;Nanda et al., arXiv:2309.00941;Vafa et al., arXiv:2406.03689