机械可解释性(Mechanistic Interpretability)
一句话定义:把大模型当成一台可以被拆开看内部的机器,反推出里面”具体跑了哪些算法”。它是回答”LLM 是不是只是在排字/统计糊”最硬的一条机制层证据线。
核心反直觉结论:如果 LLM 只是统计噪声,它的内部应该无法解析;但它内部存在可以被人类看懂、命名、甚至编辑的具体算法结构。
1. 地基:残差流与回路
Anthropic 的《A Mathematical Framework for Transformer Circuits》(2021-12)提出两个核心概念:
- 残差流(residual stream):每一层都往同一条”信息高速公路”上读写向量——可以想成一块共用的白板/公共总线。
- 回路(circuit):多个注意力头/MLP 协同完成一个可命名的”小算法”。
该文还点出了模型内部极其拥挤:残差流的神经元数量是维度数的约 100 倍,只好”以叠加(superposition)的方式通信”。
2. 归纳头(Induction Head):“看过一遍就会照做”的最小算法
Olsson, Elhage et al.(Anthropic, arXiv:2209.11895)摘要逐字:
“‘Induction heads’ are attention heads that implement a simple algorithm to complete token sequences like [A][B] … [A] -> [B] … We find that induction heads develop at precisely the same point as a sudden sharp increase in in-context learning ability.”
翻译:归纳头实现一个简单算法——补全形如 [A][B] … [A] → [B] 的序列;它恰好和”上下文学习能力突然陡增”出现在同一时刻(训练损失曲线上表现为一个凸起)。
机制:第一个头把”前一个 token”的信息抄下来;第二个头(归纳头)回找”当前 token A 上次出现的位置”,注意它后面那个 token B,抄过来。
为什么重要:模型能做到”看一遍示范、当场就会照做”——这不是死记训练语料,而是运行时(in-context)动态学到的模式,且是一个看得见、说得清的算法。
⚠️ 论文自陈:对小的”纯注意力”模型是因果性证据;对带 MLP 的大模型只是相关性证据。
3. 叠加(Superposition)与稀疏自编码器(SAE)
问题:一个神经元常对好几种不相干的东西都有反应(多义性 polysemanticity),使”一个神经元 = 一个概念”的天真解读失败。
叠加(Elhage et al., arXiv:2209.10652)解释原因:“Superposition simply means that there are more features than dimensions.”(特征数量多于维度数量。)
对策——稀疏自编码器(sparse autoencoder, SAE):把混沌的激活向量拆成成千上万个**近乎单义(monosemantic)**的特征。
| 论文 | 对象 | 关键 |
|---|---|---|
| Towards Monosemanticity(2023) | 单层 Transformer,MLP 仅 512 个神经元 | 在 80 亿数据点上训 SAE;扩维 1×–256×(512 → 131,072 特征) |
| Scaling Monosemanticity(2024) | Claude 3 Sonnet | 抽出高度抽象、跨语言、多模态的特征 |
最好玩的一手案例:特征编号 34M/31164353(“金门大桥”),对中、日、韩、俄等多语种维基首句都强烈触发。把它钳制到 10 倍激活时,模型开始”自认是金门大桥”。
⚠️ 常见误引(中文读物高频错误):《Towards Monosemanticity》分解的是单层小模型,不是 GPT-2。把 SAE 用到 Claude 3 Sonnet 的是 2024 年的《Scaling Monosemanticity》。
4. 世界模型证据:Othello-GPT 及其反方
正方:Li et al.(arXiv:2210.13382, ICLR 2023 oral)只给模型看黑白棋走子序列、从不给棋盘,却发现模型内部涌现出对棋盘状态的表示,且干预该表示能改变输出。后续(Nanda et al., arXiv:2309.00941)甚至找到线性棋盘表示,可用简单向量加减操控模型行为。
反方:Vafa et al.(arXiv:2406.03689)——生成模型”在现有世界模型检测上表现很好,但新指标显示其世界模型远没有看上去那么自洽”,做细微不同的任务时会突然失败。
平衡结论:LLM 在内部构造的是**“有用的、局部可靠的”世界模型**,而非人类那样完备统一的模型。这既否定”纯排字”,也否定”它真懂”。
5. 为什么这条线对”排字之争”关键
| 立场 | 该线提供的证据 |
|---|---|
| 支持”不只是排字” | 内部有可命名、可干预的算法结构与抽象特征 |
| 支持”仍未真懂” | 世界模型不自洽;归纳头在大模型上只是相关性证据 |
一句话:机械可解释性把”内部是不是统计糊”这个问题,从哲学争论变成了**可以指着一个具体特征说”看,这是金门大桥”**的实证问题。
相关页面
- LLM 真的只是排字游戏吗 —— 本文的完整论证
- 自回归生成 —— 被解释的对象
- 思维链 —— 相关:文本作为计算介质
- 中文房间 —— 另一条”懂不懂”的哲学线
来源
- 《LLM 真的只是排字游戏吗?》机制层底稿:
processed/LLM排字游戏-机制层数据底稿.md - Olsson et al., In-context Learning and Induction Heads, arXiv:2209.11895
- Elhage et al., Toy Models of Superposition, arXiv:2209.10652
- Bricken et al., Towards Monosemanticity(2023);Templeton et al., Scaling Monosemanticity(2024)
- Li et al., Emergent World Representations, arXiv:2210.13382;Nanda et al., arXiv:2309.00941;Vafa et al., arXiv:2406.03689