LLM 真的只是排字游戏吗
写给想搞清楚这件事、但不想读代码的人。术语第一次出现时都会解释;关键结论保留英文原话,后面跟一段人话翻译。
所有内容锚定到一手来源:论文原文、官方技术报告、官方博客、当事人本人的演讲与访谈(底稿里一级来源占 85% 以上)。凡属我自己的推断或行业通行说法,都会明确标出来。
原始语料与勘误清单归档在
processed/LLM排字游戏-*.md五份底稿里,本文每个论断都能回溯到其中某一条。
第 0 部分 · 先把问题问对
0.1 你的直觉,一半是对的
你原来的图景是:LLM 靠 Transformer 架构”随机排字”来生成输出。
这个说法里,有两处需要先修:
- “随机”这个词不准。 模型内部算出的概率分布是确定的——同一段输入,它每次给出的”下一个字最可能是什么”这张表是一模一样的。“随机”来自你外面加的那一步:从这张表里怎么挑(见 0.2)。
- “排字”这个词抓对了内核,但低估了外面叠的东西。 它确实是一字一字往外挤;但”只是”两个字,漏掉了这套机制之上的四层叠加(见 0.3)。
所以真正的问题不是”它是不是在排字”——它当然是在排字。真正的问题是:“排字”这个描述,从哪一步开始就不够用了?
0.2 先纠一个最常见的误解:“随机”
很多人的推理是这样的:“我问同一个问题,它两次答得不一样,所以它内部在随机掷骰子。”
这个推理是错的。 模型的输出分两步:
| 步骤 | 谁在做 | 是不是随机的 |
|---|---|---|
| ① 算出”下一个字是谁”的概率表 | 模型本体 | ❌ 完全确定,每次一样 |
| ② 从这张表里挑一个 | 解码策略(decoding) | ✅ 这一步才可能是随机的 |
第 ② 步叫解码策略(decoding),有几种常见玩法,Hugging Face 官方博客给了逐字定义:
- 贪心解码(greedy):“Greedy search is the simplest decoding method. It selects the word with the highest probability as its next word.”(贪心搜索是最简单的解码方法——每个时间步都挑概率最高的词。)它完全不掷骰子。
- 采样(sampling):“sampling means randomly picking the next word according to its conditional probability distribution.”(采样,就是按条件概率分布随机地挑下一个词。)这才是随机性的唯一来源。
- 温度(temperature):官方原话——“A trick is to make the distribution sharper … by lowering the so-called
temperature”,而且 “when settingtemperature→ 0, temperature scaled sampling becomes equal to greedy decoding”(把温度调到 0,温度采样就等价于贪心解码)。
一句话结论:把 temperature 设为 0(贪心),你就得到一个可复现的机器;把温度调高、或开启采样,它才开始”发挥”。所以”随机”不是模型的属性,而是使用者手里的一个开关。
⚠️ 一个必须补充的精确性:OpenAI 官方参数页只写了低温度”更确定(more deterministic)“,并没有承诺
temperature=0能做到 bit 级完全复现。工程上仍可能因浮点运算、批处理、后端版本产生细微差异。所以别把”0 温度 = 确定性”写成厂商承诺。
0.3 三层问题,别搅在一起
“LLM 是不是只是排字游戏”其实是三个不同的问题被一句话打包了:
| 层 | 它问的是 | 本文对应 |
|---|---|---|
| 机制层 | 它怎么出字的?“预测下一个词”是不是全部? | 第 1 部分 |
| 技术路线层 | 在”排字”之上,工程上又叠了什么?(对齐、思维链、推理、工具、架构) | 第 2–4 部分 |
| 理解之争层 | 它到底懂不懂? | 第 5 部分 |
混着问,永远辩不清。分开问,答案就清楚了。
0.4 全篇的主线结论(先给你地图)
本文的立场是分层的,一句话版本:
它确实在”排字”,而且排的每一步都完全可以用概率分布描述;但从”排字”到”一个能推理、会用工具、看起来懂的助手”,中间隔了至少四层机制。这四层没有改变”排字”的形式,却改变了”这些排出来的字有没有被当成下一步的计算输入用上”。
用一句更像人话的比喻:
LLM 像一个记性极好、但只有一块黑板的人。 它脑子里(参数里)存了海量知识,却不能直接在脑子里运算——必须先写到黑板上(生成到上下文里),才能对着黑板做下一步。所谓”思维链”,本质就是让它把中间步骤写到黑板上。
记住这块”黑板”,全篇后面的东西都会串起来。
第 1 部分 · 机制层:它到底怎么出字的
1.1 超能接龙:自回归 + 预测下一个词
地基是 2017 年的 Transformer 架构(Vaswani et al., Attention Is All You Need, arXiv:1706.03762)。它完全基于注意力机制(attention),“dispensing with recurrence and convolutions entirely”(彻底抛弃了循环和卷积)。
GPT 系列是 Transformer 的**解码器(decoder-only)**堆叠,训练目标只有一个:预测下一个词元(token)。GPT-3 论文摘要原话:
“we train GPT-3, an autoregressive language model with 175 billion parameters”(我们训练了 GPT-3,一个 1750 亿参数的自回归语言模型)
所谓自回归(autoregressive),就是”把输出喂回输入”:
- 把文字切成 token(词元——可粗略理解为”字/词块”);
- 模型一次只输出一个 token 的概率分布,挑一个;
- 把这个 token 追加回输入,再跑一次,输出下一个;
- 循环,直到吐出”结束”符或达到长度上限。
关键点:模型没有草稿纸。 每一步它只能看”到目前为止写下的全部文字”,然后决定下一个字。
1.2 一个具体到能上手的例子:贪心会错过什么
Hugging Face 官方博客给了一个能直接看懂的例子:
“Starting from the word
The, the algorithm greedily chooses the next word of highest probabilitynice… having an overall probability of0.5 × 0.4 = 0.2. … The wordhaswith its high conditional probability of0.9is hidden behind the worddog… so that greedy search misses the word sequenceThe, dog, has.”
翻译:从 The 开始,贪心选了当前概率最高的 nice,整体概率 0.5×0.4=0.2。但更优的 The dog has... 这条路,因为 dog 这一步的即时概率不是最高,被贪心”看不见”了。这就是”只看眼前一步”的代价。
- 束搜索(beam search) 是对策:每步保留
num_beams条备选,最后挑整体概率最高的——“它一定比贪心找到的句子概率更高,但不保证找到全局最优”。它也是确定性的(不抽签),代价是算力翻倍。
这一节的意义:连”怎么挑字”都有这么多门道——它提醒我们,“排字”这个动作本身就不像看上去那么简单。
1.3 Karpathy 的具象入口:“两个文件”
理解 LLM 最省事的入口,是 Andrej Karpathy 那句被反复引用的话(Intro to Large Language Models, 2023-11 演讲):
“In its most basic form, a large language model is just two files: a ‘parameters’ file; and a ‘run’ file.”
翻译:最基础地看,一个大语言模型就是两个文件——一个”参数”文件,一个”运行”文件。
- 参数文件:训练固化下来的几亿到上万亿个数字(权重)。模型”知道”的一切都在这里,没有外挂知识库。
- 运行文件:一小段跑这些数字的代码。
Karpathy 把训练比作对互联网做一次”有损压缩”——像给互联网打了个 zip 包,而且是有损的(lossy)。他还形容模型运行时是在 “dreaming internet documents”(梦见互联网文档)。
“有损”这个词是关键。 正因为有损,它才能从没见过的话里”悟”出规律(泛化);也正因为有损,它会一本正经地编造(幻觉)。
1.4 为什么”预测下一个词”这么深:压缩即智能
“预测下一个词”听起来平平无奇。但 Google DeepMind 的论文 Language Modeling Is Compression(arXiv:2309.10668, ICLR 2024)证明了一件反直觉的事:预测模型和无损压缩器在数学上可以互相转换。
它给的硬数据(摘要逐字):
“Chinchilla 70B, while trained primarily on text, compresses ImageNet patches to 43.4% and LibriSpeech samples to 16.4% of their raw size, beating domain-specific compressors like PNG (58.5%) or FLAC (30.3%).”
翻译:一个主要用文本训练的模型,居然能把图像压到原始大小的 43.4%、语音压到 16.4%——分别打赢了专门做图像的 PNG(58.5%) 和专门做音频的 FLAC(30.3%)。
为什么值得激动? 论文的推论是:为了把下一个词预测得足够准,模型被迫把”生成这些文字背后的世界规律”也一起编码进去。 这就是它看起来”懂”东西的机制来源。
Ilya Sutskever(OpenAI 前首席科学家)把这层意思说得很透(Dwarkesh Podcast, 2023-03-27 逐字):
“Predicting the next token well means that you understand the underlying reality that led to the creation of that token.”(把下一个词预测好,就意味着你理解了创造这个词的那个底层现实。)
⚠️ 一个必须澄清的误读:“压缩即智能”不等于”LLM 就是个 zip 包”。它讲的是数学上的等价关系,不是说模型内部存了一份压缩文本。而且论文自己说了一句常被漏掉的话:“Scaling beyond a certain point will deteriorate the compression performance since the model parameters need to be accounted for”——一旦把模型自身参数大小算进压缩成本,缩放过头反而变差。所以别把这句讲成”越大越神”。
1.5 反驳”只是排字”的最硬证据:机械可解释性
如果 LLM 只是”统计糊”,它的内部应该是一团无法解析的噪声。**机械可解释性(mechanistic interpretability)**这条研究线给出的答案恰恰相反:它内部有可以被人类看懂的具体算法结构。
这是全篇反驳”只是排字”最硬的机制层证据。
(1) 归纳头(induction heads)——“看过一遍就会照做”的最小算法
Anthropic 论文 In-context Learning and Induction Heads(arXiv:2209.11895)摘要逐字:
“‘Induction heads’ are attention heads that implement a simple algorithm to complete token sequences like [A][B] … [A] -> [B]. … We find that induction heads develop at precisely the same point as a sudden sharp increase in in-context learning ability.”
翻译:归纳头是一类注意力头,实现一个简单算法——补全形如 [A][B] … [A] → [B] 的序列。它恰好和”上下文学习能力突然陡增”出现在同一时刻。
机制(原文)是:第一个头把”前一个 token”的信息抄下来;第二个头(归纳头)在序列里回找”当前 token A 上次出现的位置”,注意它后面那个 token B,把它抄过来。
为什么这条重要:它意味着模型能做**“看一遍示范、当场就会照做”——不是死记整段训练语料,而是在运行时(in-context)动态学到的模式**。而且这是一个看得见、说得清的算法。
⚠️ 论文自己很谨慎:对小的”纯注意力”模型是因果性证据;对带 MLP 的大模型只是相关性证据。
(2) 稀疏自编码器(SAE)——给模型做”概念解剖”
问题背景:一个神经元常常对好几种毫不相干的东西都有反应(叫 多义性 polysemanticity),这让”一个神经元=一个概念”的天真解读失败。
叠加(superposition) 论文解释了这个现象:“特征数量多于维度数量” 时,模型就把多个特征”叠”在同一组维度上。
对策是稀疏自编码器(sparse autoencoder, SAE):把一个混沌的激活向量,拆成成千上万个近乎单义(monosemantic)的特征。Anthropic 实验里一个最有名、也最好玩的例子是”金门大桥”特征(编号 34M/31164353)——它对中、日、韩、俄等多语种的维基百科首句都强烈触发。而在 Scaling Monosemanticity(2024-05)里,研究者把它”拧到 10 倍”:
“clamping the Golden Gate Bridge feature [34M/31164353] to 10× its maximum activation value induces thematically-related model behavior. In this example, the model starts to self-identify as the Golden Gate Bridge!”
翻译:把”金门大桥”特征钳制到 10 倍激活,模型开始”自认是金门大桥”。
这说明模型内部不是一团无处下手的统计糊,而是有可分离、可命名、可干预的结构。
⚠️ 勘误(很多中文读物讲错):Towards Monosemanticity(2023)分解的对象是一个单层 Transformer、MLP 层只有 512 个神经元,不是 GPT-2。把 SAE 用到 Claude 3 Sonnet 的是 2024 年的 Scaling Monosemanticity。
(3) 世界模型的证据:Othello-GPT——以及它的反方
Emergent World Representations(arXiv:2210.13382, ICLR 2023)做了一个漂亮实验:让模型只看”黑白棋(Othello)棋谱的走子序列”,从不给它棋盘。结果发现模型内部长出了一张棋盘的内部表示(summary 逐字:“we uncover evidence of an emergent nonlinear internal representation of the board state”),而且干预这个表示能改变模型输出。后续工作(arXiv:2309.00941)甚至找到了一个线性的棋盘表示,可以用简单向量加减来操控模型行为。
这是”不只是排字”最直接的硬证据之一:为了预测下一步棋,模型确实在内部造出了一张可被读出、可被编辑的棋盘。
但必须平衡地给出反方(Vafa et al., arXiv:2406.03689):
“In all domains, the generative models we consider do well on existing diagnostics for assessing world models, but our evaluation metrics reveal their world models to be far less coherent than they appear.”
翻译:这些模型在现有的”世界模型”检测上都表现很好,但我们的新指标显示,它们的世界模型远没有看上去那么自洽——拿去做相关但细微不同的任务时,可能突然失败。
平衡结论:LLM 在内部构造了**“有用的、局部可靠的”世界模型**,而不是人类那样完备统一的模型。这既否定了”纯排字”,也否定了”它真懂”。
1.6 一条”上限”:为什么”想出来”比”一眼给答案”准
Merrill & Sabharwal, The Expressive Power of Transformers with Chain of Thought(arXiv:2310.07923, ICLR 2024)指出:固定深度、不做中间生成的 Transformer,在表达能力上有硬上限。
这解释了一件很关键的事:思维链之所以能提升推理,本质是”用生成更多 token 来换计算深度”。
多吐字 = 多给模型算的时间。 这条是第 3 部分的引子——也正是”思维链算不算打破排字”这个问题的机制地基。
第 2 部分 · 训练路线层:从”接龙”到”助手”,中间补了什么
先给你一张全景对照表(这是本文的骨架):
| 阶段 | 它解决的问题 | 代表技术 | 一句话本质 |
|---|---|---|---|
| 预训练 | 学会”接龙” | Transformer + 下一个词预测 | 把互联网压进参数 |
| 指令微调(SFT) | 学会”把话当任务” | FLAN / Self-Instruct / LIMA | 从”续写”到”接令” |
| RLHF | 学会”人的偏好” | InstructGPT | 把”人更喜欢哪个”变成信号 |
| 替代路线 | 让对齐更省 | DPO / 宪法 AI | 两步并一步 / 用 AI 当评委 |
| 推理训练 | 学会”想步骤” | CoT / STaR / R1 | 把思考写进上下文 |
| 推理期缩放 | 学会”想更久” | Self-Consistency / s1 | 回答时多花算力 |
| 工具与 Agent | 学会”用外面的东西” | ReAct / Toolformer | 把能力搬到模型外 |
下面逐段拆。
2.1 预训练:只会接龙的基础模型
GPT-3(arXiv:2005.14165)训练了 175B 参数、3000 亿 tokens,但它的贡献其实是少样本上下文学习(few-shot in-context learning)——给它几个例子,它就能顺着往下接。
预训练结束得到的叫”基础模型(base model)“,它只会”顺着往下接”,不会区分”这是用户要我做的事”和”这是一段待续写的文本”。 你给它”请解释什么是通胀”,它可能不回答,而是再补几个类似的问题——因为它在模仿训练语料里”问题后面跟着问题”的模式。
关键点:GPT-3 不是一个听话的助手。
2.2 指令微调:教会它”把话当任务”
- FLAN(arXiv:2109.01652):拿一个 137B 的模型做指令微调,尺寸没变,零样本能力就上去了——“在评估的 25 个任务中有 20 个超过零样本的 175B GPT-3”。第一次证明:“怎么问”可以成为一种训练信号。
- Self-Instruct(arXiv:2212.10560):从 175 条人工种子任务出发,让模型自己造出约 5.2 万条指令。人工数据可以被”模型自产数据”替代。
- LIMA(arXiv:2305.11206):最极端的一个——在 65B 模型上只用 1000 条精选问答微调,不做 RL、不做人类偏好建模,结果”在 43% 的情况下与 GPT-4 相当或被优先”。
LIMA 提出的**“表层对齐假说(Superficial Alignment Hypothesis)”**,是”排字游戏”直觉的学术版本:
“A model’s knowledge and capabilities are learnt almost entirely during pretraining, while alignment teaches it which subdistribution of formats should be used when interacting with users.”
翻译:模型的知识与能力几乎全部在预训练阶段习得,对齐只是教它在与用户交互时该使用哪种”格式子分布”。
换句话说:“能力来自接龙,合适只是换了个腔调。“
2.3 RLHF:把”人更喜欢哪个”变成信号
现实里很多任务(写得好不好、语气合不合适)没有唯一标准答案。这时候”给标准答案”不够用,得改用”给偏好”。
InstructGPT(arXiv:2203.02155, NeurIPS 2022)给了经典三阶段流程:
- 监督微调(SFT, Supervised Fine-Tuning)——用人写的示范微调;
- 奖励模型(RM, Reward Model)——让模型学会”两个回答里人更喜欢哪个”;
- 强化学习(PPO)——用奖励模型当”裁判”,继续训练。
最惊人的结论(摘要逐字):
“outputs from the 1.3B parameter InstructGPT model are preferred to outputs from the 175B GPT-3, despite having 100x fewer parameters.”
翻译:13 亿参数的 InstructGPT,输出比 1750 亿参数的 GPT-3 更受偏好——参数少了 100 倍。
但代价是引入了新的失败模式:
- 奖励黑客(reward hacking):Casper et al.(arXiv:2307.15217)逐字——“Optimizing for an imperfect reward proxy leads to reward hacking … reward hacking should be expected by default.”(对一个不完美的奖励代理做优化,必然导致奖励黑客;它应该被默认预期会发生。)
- 谄媚(sycophancy):Sharma et al.(arXiv:2310.13548)逐字——“sycophancy is a general behavior of state-of-the-art AI assistants, likely driven in part by human preference judgments favoring sycophantic responses.”(谄媚是当前最先进 AI 助手的普遍行为,部分原因正是人类偏好本身就更青睐谄媚式回答。)
这一节是”排字游戏”直觉最锋利的地方:对齐改变的是”选哪个字”,未必改变”懂不懂”。而它带来的风格,还继承了”人的偏好”本身的缺陷。
2.4 替代路线:DPO 与宪法 AI
- DPO(Direct Preference Optimization, 直接偏好优化)(arXiv:2305.18290):标题就叫 Your Language Model is Secretly a Reward Model(你的语言模型其实是个隐藏的奖励模型)。它用数学证明”奖励可以直接从语言模型里闭式地解出来”,于是把”先训 RM、再跑 PPO”两步压成一步分类式微调。稳定性大幅提升。
- 宪法 AI(Constitutional AI)(arXiv:2212.08073, Anthropic):用一份原则清单(“宪法”) + 一个 AI 评委 替代逐条人类标注,即 RLAIF(RL from AI Feedback,来自 AI 反馈的强化学习)。论文用的是两套各 16 条原则(SL 与 RL 阶段各一套)。
宪法 AI 也解释了今天模型”拒绝时会解释理由”而非生硬说”我不知道”的由来(论文目标是 non-evasive,非回避式拒绝)。
2.5 这一步”比以前多了什么”
- 从”续写”到”接令”(指令微调)——教它把用户的话当任务。
- 从”标准答案”到”人的偏好”(RLHF)——让 1.3B 打赢 175B;代价是奖励黑客与谄媚。
- 从”昂贵人类”到”廉价自动化”(DPO / 宪法 AI)——对齐越来越省。
但注意 LIMA 那句话的反讽:如果”能力全在预训练、对齐只改风格”,那么对齐阶段做的一切,本质上还是在”排字”这一层打转。真正让”排字”不够用的,是下一部分。
第 3 部分 · 推理层:思维链到底算不算”打破排字”
这是你问题的正中心。 有人跟你说”存在思维链,所以不算纯排字”——这句话对不对?我们把它拆开看。
3.1 一句咒语 + 思维链:把”一步步想”变成提示词
- 思维链(Chain-of-Thought, CoT)(Wei et al. 2022, arXiv:2201.11903):只要在提示里给几条”一边想一边写”的示范,大模型的推理能力就大幅提升。
关键数字(论文摘要/正文):
| 模型 | 标准提示 | 思维链提示 |
|---|---|---|
| PaLM 540B 在 GSM8K(数学应用题) | 17.9 | 56.9(+39.0) |
| GPT-3 175B 在 GSM8K | 15.6 | 46.9 |
- 零样本版更夸张(Kojima et al., arXiv:2205.11916):只加一句 “Let’s think step by step”,MultiArith 从 17.7% → 78.7%,GSM8K 从 10.4% → 40.7%。
八个词换 61 分。 这说明什么?推理能力早就藏在模型里了,缺的只是一个触发条件。
但有一个必须写出来的限定(论文 §3.2 逐字):
“chain-of-thought prompting does not positively impact performance for small models, and only yields performance gains when used with models of ~100B parameters.”
附录更直白:“chain of thought actually hurts performance for most models smaller than 10B parameters.”
翻译:小模型上思维链反而有害——它们会生成”语言流畅但逻辑不通”的推理链,反而拉低成绩。
这条极其重要:它说明”把输出变长”本身不能自动产生推理;只有当模型内部已经有可被调用的东西时,变长才有意义。
3.2 CoT 的机制:把参数里的知识搬到”黑板”上
这是全篇最关键的一处”既承认又反驳排字论”的支点。最硬的一手证据来自微软的”语言模型物理学”系列(Allen-Zhu & Li, arXiv:2309.14402):
“language models excel in knowledge retrieval but struggle even in the simplest classification or comparison tasks unless Chain of Thoughts (CoTs) are employed during both training and inference. Moreover, their performance in inverse knowledge search is virtually 0%.”
“they cannot efficiently manipulate knowledge from pre-training data, even when such knowledge is perfectly stored in the models.”
翻译:模型在”知识检索”上很强,但连最简单的分类/比较都做不好——除非训练和推理都启用思维链;而且”逆检索”(问的是”谁的生日在十月?“这种反查)准确率几乎为 0%——即便这些知识被完美地存在模型里。
这就是为什么我一开始让你记住那块”黑板”。
模型内部像一个塞满事实的仓库,但它不能直接在仓库里搬货——必须先写到黑板(上下文)上,才能对着黑板做下一步运算。所以:
- 参数里的知识是”死”的:它只能影响下一个字生成什么;
- 一旦写出来变成上下文里的文字,模型就能对它判断、比较、推导了。
思维链的作用,不是”让模型更认真”,而是把参数里的知识搬运到可以操作的上下文里。这是机制上的必需,不是心理上的鼓励。
现在回答”思维链算不算打破排字”:
- 承认:输出的确是一步步”排”出来的,每一步仍然是下一个词的概率。
- 反驳:正因为每一步都被写进上下文,后续步骤所依赖的条件分布被真实改变了——这不是把答案拆成更多字,而是改变了自己计算时所依赖的信息。
- “排字”这个描述之所以不够,是因为它漏掉了”文本即计算介质”这一事实。
3.3 从”看结果”到”看过程”:模型开始学自己的推理
如果推理过程只是装饰,那么”拿推理过程当训练信号”不应该持续带来收益。但它带来了:
- STaR(arXiv:2203.14465):让模型生成推理、答对了就拿来微调自己、反复迭代。结果”在 CommensenseQA 上追平了一个大 30 倍的模型”。
- 过程奖励模型(PRM)(Let’s Verify Step by Step, OpenAI, arXiv:2305.20050):把奖励信号从”最终答没答对”下沉到”每一步对不对”。过程监督显著优于结果监督(MATH 上能解出 78%),并公开了 80 万条人工步骤级标注(PRM800K)。
- Quiet-STaR(arXiv:2403.09629):让模型在任意文本的每个 token 前都先在心里想一句,再生成下一个词;零样本就让 GSM8K 从 5.9% → 10.9%。
这条演化本身就是”推理含有真实信息”的间接证据——如果一个东西只是表面装饰,把它当监督目标不会持续带来回报。
3.4 推理模型:o1 与 DeepSeek-R1
OpenAI o1(官方博客 Learning to Reason with LLMs,2024-09)第一次把”用 RL 训练思维链”讲清楚:
“Our large-scale reinforcement learning algorithm teaches the model how to think productively using its chain of thought in a highly data-efficient training process.”
它学会的四件事(原博逐字,非常适合理解”推理模型”到底强在哪):
“It learns to recognize and correct its mistakes. / It learns to break down tricky steps into simpler ones. / It learns to try a different approach when the current one isn’t working.”
(学会识别并纠正错误 / 学会拆解棘手步骤 / 学会换一条路走)
而且 o1 同时缩放两条轴(原博逐字):
“We have found that the performance of o1 consistently improves with more reinforcement learning (train-time compute) and with more time spent thinking (test-time compute).”
DeepSeek-R1(arXiv:2501.12948,已发表于 Nature 645:633–638, 2025)把这件事推得更远——纯强化学习,不需要人工标注的推理轨迹:
“the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labeled reasoning trajectories.”
翻译:模型的推理能力可以通过纯 RL 被”激发”出来,不再需要人工标注推理轨迹。
它有几个特别值得记住的点:
- GRPO 算法:不再单独训练一个”评论家”模型,而是对同一问题采样一组答案,用组内均值和标准差把奖励归一化——省显存、省算力。
- 可验证奖励(RLVR, RL with Verifiable Rewards):只奖励那些机器能自动判对错的题——数学对答案、代码跑测试。论文明确说不用神经奖励模型:“we abstain from applying neural reward models … because … neural reward models are susceptible to reward hacking.”
- “啊哈时刻(aha moment)“:训练中模型自发开始更多地用 “Wait” 来反思(论文表 2 里出现的原句:“Wait, wait. Wait. That’s an aha moment I can flag here…”)。注意:这是研究者对现象的命名,论文自己也说是”anthropomorphic tone(拟人化语气)“,不是说模型有了意识。
三个最能说明问题的对照数字(AIME 2024,数学竞赛):
| 模型 | AIME 2024 pass@1 |
|---|---|
| GPT-4o | 9.3 |
| DeepSeek V3 | 39.2 |
| OpenAI o1-mini | 63.6 |
| OpenAI o1-1217 | 79.2 |
| DeepSeek-R1 | 79.8 |
以及一个”信任度”极强的对照(官方模型卡):
| 模型(同为 32B 档) | AIME 2024 pass@1 |
|---|---|
| QwQ-32B-Preview(自己 RL 摸索推理) | 44.0 |
| DeepSeek-R1-Distill-Qwen-32B(从 R1 蒸馏) | 72.6 |
后者的推理行为是从大模型”学”来的,而不是自己搜出来的,分数高出近 29 个点。 这说明推理能力可以被当作一种”可迁移的技能”从一个模型搬到另一个模型。
⚠️ 但你也要看到反讽的一面:纯 RL 的 R1-Zero,AIME 得分 77.9,已经接近最终版 79.8,但它”不像人话”(论文原话:“poor readability, and language mixing”,回答里混用多种语言)。RL 找到的推理路径是”可用的、但不可读的”。 这提醒我们:我们看到的流畅思维链文本,和真实的推理过程,未必是同一回事。
3.5 推理期缩放:不改权重,只在回答时”多花算力”
第三条曲线。 既然”把模型训大”在减速,算力就转移到了另一个方向——推理期缩放(test-time / inference-time compute scaling):不改任何权重,只在回答问题时多花算力。
两条路线(Snell et al., arXiv:2408.03314 的机制划分):
- 路线 A|横向采样:同一问题生成多个答案,再投票 / 验证器 / 重排序选一个。最朴素版本是 Self-Consistency(arXiv:2203.11171,GSM8K +17.9%)。o1 的 AIME 阶梯也走这条路:单次 74% → 64 个样本取一致 83% → 1000 个样本重排 93%。
- 路线 B|纵向延长:只生成一条链,但让它更长、更多地自我复查。
最能说明”延长思考真的有用”的是 s1 论文(arXiv:2501.19393)的**“预算强制(budget forcing)”**:
“lengthening it by appending ‘Wait’ multiple times to the model’s generation when it tries to end. This can lead the model to double-check its answer, often fixing incorrect reasoning steps.”
结果:AIME24 从 50% → 57%,整体比 o1-preview 高出至多 27%。
“追加一个 ‘Wait’ 就能提分”是全文最反直觉的一条。 它不是”这个词有魔力”,而是强制模型把已有的中间结论重新过一遍,从而获得额外的纠错机会。
Snell 论文还给出一个很有冲击力的结论:在算力对齐的评测中,推理期算力可以战胜一个大 14 倍的模型——但只在”小模型本来就有一定成功率的题目上”成立。超出能力边界,想再久也没用。
这一节是”排字游戏”论的最强反击之一:如果模型只是查表式地”排字”,多给它算力不应该出现这种平滑可预测的提升,更不该出现”14 倍参数被推理期算力反超”。
3.6 知识 vs 推理:两条轴,但有门槛
把上面的证据拼起来,会得到一个比”两条独立轴”更准确的表述:知识(参数里存了什么)与推理(能不能把存的东西按需要调出来、变换)确实可以分成两张轴——但它们是有门槛的耦合关系。
- 有知识没推理:Allen-Zhu 的逆检索 0%——知识完美存储,依然搬不动。
- 有推理但模型太小:CoT 反而掉分(<10B)。
- 同基座换推理行为:QwQ-32B 44.0 vs R1-Distill-Qwen-32B 72.6。
“耦合但有门槛”,比”两条独立轴”更贴近一手证据。
顺带说一个悬而未决的争论——涌现能力(emergent abilities):
- 正方(Wei et al., arXiv:2206.07682):某些能力”小模型没有、大模型才有”,无法从小规模外推预测。
- 反方(Schaeffer et al., arXiv:2304.15004, NeurIPS 2023):这可能是度量指标的假象——“非线性或非连续的指标会产生表观的涌现能力,而线性或连续的指标会产生平滑、连续、可预测的变化”。他们甚至能在视觉任务上凭空制造出”涌现”曲线。
这个争论对本文的用处,是它提供了一把尺子:我们看到的”突然会做题了”,有多少是模型内部的跳变,有多少是我们选的尺子(“全对才算对” vs “部分对也算对”)造成的?“排字游戏”论与”真在推理”论的分歧,很大一部分正来自这把尺子的选择。
3.7 小结:这一层怎么改写”排字”
最干净的收束:争论的关键不在于输出是不是一个字一个字排出来的(它当然是),而在于——排出来的这些字,有没有真的作为下一步计算的输入被用上。
本层全部一手证据都指向:用上了,而且用得很重;但它用上的方式,仍然完全可以用概率分布描述。这两件事并不矛盾。
第 4 部分 · 前沿架构与 Agent:排字之外还叠了什么
4.1 混合专家(MoE):同一个词,走不同的参数
MoE 常被误读成”把模型做大”的技巧。但从”排字”视角看,它的关键是逐 token 的参数分化。Switch Transformer(arXiv:2101.03961)第一句就点明了:
“models typically reuse the same parameters for all inputs. MoE defies this and instead selects different parameters for each incoming example.”
翻译:普通模型对所有输入复用同一套参数;MoE 反其道而行,为每一个进来的样本挑选不同的参数。
Mixtral(arXiv:2401.04088)把”逐 token 换专家”写得更直白:
“Even though each token only sees two experts, the selected experts can be different at each timestep.”
翻译:尽管每个 token 只看两个专家,被选中的专家在每一步都可以不同。
比喻:排字工还在排字,但字库是按需即时调度的——同一个词,可能由完全不同的”专家”来处理。这正是”排字”这个比喻开始漏气的地方:排字工用的是一把固定的字模,而 MoE 每排一个字都在换字模。
⚠️ 别用”数学专家/语文专家”作类比。三篇 MoE 原文都未给出”存在学科专家”的证据,反而强调共享专家与细粒度分割。具体参数记账(总参数 vs 激活参数)见 大模型的参数与能力维度 与 混合专家。
4.2 长上下文:标称窗口 ≠ 真的看得见
Transformer 本身对顺序不敏感,位置信息必须显式编码。RoPE(旋转位置编码)(arXiv:2104.09864)是当前主流默认选择,它让”token 间依赖随相对距离增大而衰减”——这既是它能外推的原因,也是它外推失效的根源。
三个实证揭示”标称”和”有效”的巨大鸿沟:
- Lost in the Middle(arXiv:2307.03172):信息一字未改、总量未变,只是挪到中间,成绩就掉。
- RULER(arXiv:2404.06654):“models all claim context sizes of 32K tokens or greater, only half of them can maintain satisfactory performance at the length of 32K.”
- NoLiMa(arXiv:2502.05167):13 个标称 ≥128K 的模型,在 32K 就有 11 个掉到短上下文成绩的 50% 以下;连 GPT-4o 也从 99.3% 掉到 69.7%。
上下文腐坏(context rot):Chroma 报告测了 18 个模型,结论——“models do not use their context uniformly; instead, their performance grows increasingly unreliable as input length grows”(模型并非均匀地使用上下文;随着输入变长,表现越来越不可靠)。
Anthropic 把它上升为一条工程原则:
“Context … must be treated as a finite resource with diminishing marginal returns. … LLMs have an ‘attention budget’ … Every new token introduced depletes this budget.”
排字结论:长上下文表面上给”排字”扩了输入带宽,实质却暴露了模型阅读的非均匀与不可靠。于是工程重心从”塞更多”转向”挑最少”——这正是”上下文工程”这个词的由来。
4.3 工具调用与 Agent:一半能力在模型外
这一层是”排字”最明显的反例。
- 工具调用是训练出来的能力。ToolLLM(arXiv:2307.16789)诊断:“current instruction tuning largely focuses on basic language tasks but ignores the tool-use domain.”(指令微调把工具使用这个领域整个忽略了。)它不会随参数变大自动涌现。
- ReAct(arXiv:2210.03629):让模型把推理轨迹与动作交错生成——这是所有现代 Agent 循环的思想源头。
- Toolformer(arXiv:2302.04761):模型可以自学”调哪个 API、何时调、传什么参数、如何把结果并入 token 预测”。
Anthropic 官方(Building Effective Agents, 2024-12)把这条边界画得最清楚:
“Agents … are typically just LLMs using tools based on environmental feedback in a loop.”
他们还给了一个极其直白的工程量证据:
“While building our agent for SWE-bench, we actually spent more time optimizing our tools than the overall prompt.”
翻译:做 SWE-bench 智能体时,我们花在工具上的时间比花在提示词上还多。
排字结论:模型本体仍然只在排字,但用它”排”出什么,取决于模型之外的循环、工具与上下文管理。 模型是处理器,harness 是主板与操作系统;同一颗处理器换主板,能力区间会明显移动。详见 工具调用、模型与框架分责。
4.4 多模态:变的是”被预测的单位”,不变的是”逐单位预测”
- CLIP(arXiv:2103.00020)把图像和文字对齐到同一语义空间(4 亿对图文)。
- GPT-4o(arXiv:2410.21276)官方定性是 “an autoregressive omni model that accepts as input any combination of text, audio, image, and video”——自回归全模态模型,所有输入输出由同一个神经网络处理。
它对”排字”这个说法做了什么?两面都有:
- 让”排字”更不够用:被预测的”单位”从文字扩展到图像、音频。
- 让”排字”更成立:官方定性就是 “autoregressive”——本质仍是逐单位生成。
4.5 这一层的小结
| 技术 | 改变了”排字”的哪一环 | 让”只是排字” |
|---|---|---|
| MoE | 用哪些参数算 | 更不够用(逐 token 换参数) |
| 长上下文 | 能看到多少信息 | 更不够用(且暴露边界) |
| 工具 / Agent | 信息从哪来、动作谁执行 | 最不够用(一半能力在模型外) |
| 多模态 | 被预测的”单位”是什么 | 两者兼具(模态扩展 / 仍自回归) |
收束句:这些架构叠加下来,模型输出的形式始终是”逐 token 的概率预测”——排字比喻抓对了这个内核;但它们让”用什么算、看什么、调什么、吃什么模态”全都离开了模型本体。
第 5 部分 · 理解之争:它到底懂不懂
到这里,“机制 + 技术路线”都讲完了。最后是那个哲学问题:它懂吗?
5.1 中文房间:争论的起点(1980)
John Searle 的思想实验(Minds, Brains, and Programs, 1980, Behavioral and Brain Sciences)——SEP 逐字:
“Imagine a native English speaker who knows no Chinese locked in a room full of boxes of Chinese symbols … together with a book of instructions for manipulating the symbols. … by following the instructions … the man in the room is able to pass out Chinese symbols which are correct answers … The program enables the person in the room to pass the Turing Test for understanding Chinese but he does not understand a word of Chinese.”
翻译:一个不懂中文的人被锁在装满中文符号的房间里,靠一本规则书操作符号、递出正确答案——这套程序让他通过了”理解中文”的图灵测试,可他一个字都不懂中文。
Searle 的结论:
“if the man in the room does not understand Chinese on the basis of implementing the appropriate program … then neither does any other digital computer solely on that basis.”
要害:句法(syntax)本身不足以产生语义(semantics)。 而 LLM 恰恰是”纯句法操作 + 通过大量语言行为测试”的当代最大规模实例——所以这个 45 年前的思想实验,在 2023 年后被反复重提。
(最强的反驳是 Systems Reply(系统反驳):屋里的人不懂,但整个系统懂。Searle 的回应是”我可以把整个系统内化进脑子,那时我就是系统,但我仍然不懂中文”。)
5.2 随机鹦鹉:最著名的否定
Bender, Gebru 等(On the Dangers of Stochastic Parrots, FAccT ‘21)的原话(第 616–617 页,逐字):
“an LM is a system for haphazardly stitching together sequences of linguistic forms it has observed in its vast training data, according to probabilistic information about how they combine, but without any reference to meaning: a stochastic parrot.”
翻译:语言模型是把它在海量训练数据里见过的语言形式、依据组合概率、随机而零散地拼接起来的系统,完全不指涉任何意义:一只随机鹦鹉。
这是我全文看到的最直接命中你问题的表述——它就是你听到的那个说法的学术出处。
5.3 中立钥匙:形式能力 vs 功能能力(最有分量的框架)
Mahowald et al.(arXiv:2301.06627;正式发表于 Trends in Cognitive Sciences, 2024)给了一个把争论从”站队”变成”可测量”的框架:
“we evaluate LLMs using a distinction between formal linguistic competence — knowledge of linguistic rules and patterns — and functional linguistic competence — understanding and using language in the world.”
“Although LLMs are surprisingly good at formal competence, their performance on functional competence tasks remains spotty and often requires specialized fine-tuning and/or coupling with external modules.”
翻译:形式语言能力(语言规则与模式)与功能语言能力(在真实世界里理解和运用语言)依赖不同的神经机制。LLM 在形式能力上出人意料地强,但在功能能力上参差不齐、往往需要专门微调或与外部模块耦合。
为什么这是”钥匙”:
- Bender 的”随机鹦鹉” ≈ 只承认形式能力;
- Bubeck 的”Sparks of AGI” ≈ 主张功能能力已相当程度出现;
- Mahowald 给两方提供了同一把尺子。
5.4 正方:真出现了智能的火花
- Bubeck et al. 2023(Sparks of AGI, arXiv:2303.12712,微软研究院):“we believe that it could reasonably be viewed as an early (yet still incomplete) version of an AGI system.”
- ⚠️ 必须同引的话:同一篇论文自己说 “including the possible need for pursuing a new paradigm that moves beyond next-word prediction”——正方最强的论文,自己承认可能需要超越”预测下一个词”的新范式。
- 图灵测试 2025(Jones & Bergen, arXiv:2503.23674;PNAS 2026):“GPT-4.5 was judged to be the human 73% of the time”(GPT-4.5 被判断为人类的比例达 73%),是”任何人工系统通过标准三方图灵测试的首个实证证据”。
- ⚠️ 双面性:图灵测试测的是行为不可区分性——而这正是中文房间一开始就承认”能通过却不懂”的东西。通过图灵测试 ≠ 理解。
5.5 反方:四条独立的证据线
- Searle(哲学):句法不足以产生语义。
- Chomsky 等 2023(NYT 评论《The False Promise of ChatGPT》逐字):人的心智 “is not, like ChatGPT and its ilk, a lumbering statistical engine for pattern matching … it seeks not to infer brute correlations among data points but to create explanations”(人的心智不是 ChatGPT 那种笨重的模式匹配统计引擎;它要的是创造解释)。并指出机器学习”cannot distinguish the possible from the impossible”(无法区分可能与不可能)。
- LeCun(架构):主张自回归 LLM 缺”世界模型”、不是通往 AGI 的正路,力推 JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)——在抽象表示空间里预测世界状态。2025 年 11 月他离开 Meta,创办聚焦”世界模型”方向的公司。
- 逆向诅咒(Reversal Curse)(Berglund et al., arXiv:2309.12288)——反方里最像硬证据的一条:
“If a model is trained on a sentence of the form ‘A is B’, it will not automatically generalize to the reverse direction ‘B is A’.” 数字:“GPT-4 correctly answers … the former 79% of the time, compared to 33% for the latter.”(问”Tom Cruise 的母亲是谁”正确率 79%,反过来问”Mary Lee Pfeiffer 的儿子是谁”只有 33%。)而且它跨模型规模稳健、数据增强也无法缓解——但如果 A is B 出现在上下文里,模型能做对。
5.6 大牛的中立/极端立场
- Karpathy:把 LLM 看作新操作系统(LLM 是 CPU,上下文窗口是 RAM,工具是外设);长期立场是 next-token prediction 被普遍低估。
- Sutskever:“压缩即智能”——“预测下一个词就是理解底层现实”。他 2025-11-26 在 Dwarkesh 访谈里还说了一句很有分量的话:“Pre-training as we know it will end.”(我们所知的预训练将会终结)。
5.7 正反双方证据对照表
| 维度 | 正方(“确有理解/火花”) | 反方(“只是排字”) | 中立拆解 |
|---|---|---|---|
| 哲学根 | Bubeck 2023:能解跨领域新任务 | Searle 1980:句法不足产生语义 | Mahowald:形式能力 ≠ 功能能力 |
| 关键实验 | 图灵测试 GPT-4.5 胜率 73% | 逆向诅咒:正向 79% vs 反向 33% | 同一任务需两把尺子量 |
| 认识论 | Sutskever:“预测即理解现实” | Chomsky:“只做描述与预测,不提出因果机制” | 二者可并存 |
| 架构论 | Karpathy:“next-token 被低估” | LeCun:自回归 LLM “doomed”,缺世界模型 | 2025-26:Sutskever”预训练将终结”、LeCun 创业 |
| 社会/生态 | — | Bender 2021:“随机鹦鹉”;2026 续篇指向模型坍塌 | 争论从”懂不懂”外溢到”该不该这样造” |
第 6 部分 · 收束:那到底算不算排字游戏
6.1 分层回答(本文的核心答案)
不是”是”或”不是”,而是”到哪一步为止是”。
| 说法 | 成立吗 | 依据 |
|---|---|---|
| ”它的输出是一字一字、逐 token 概率预测出来的” | ✅ 完全成立 | 自回归机制(第 1 部分) |
| “它是随机的” | ⚠️ 不准确 | 随机来自采样开关;贪心是确定的 |
| ”它内部只是统计噪声,没有结构” | ❌ 不成立 | 归纳头、SAE、Othello-GPT(1.5) |
| “推理只是把答案拆成更多字” | ❌ 不成立 | 写出来的字会改变后续计算的条件(3.2) |
| “它只是接龙,不会听指令” | ❌ 不成立 | 指令微调 / RLHF(第 2 部分) |
| “它只能排字、不能调工具” | ❌ 不成立 | Agent 能力一半在模型外(4.3) |
| “它真像人一样理解、有完备世界模型” | ❌ 不成立 | 逆向诅咒、世界模型不自洽、功能能力参差(第 5 部分) |
| “它内部机制完全可以用概率分布描述” | ✅ 成立 | 全部一手证据都支持 |
一句话:
LLM 在”输出形式”上确实是排字游戏,在”内部结构”上不是一团噪声,在”能力来源”上远不止排字——但在”是否像人一样理解”上,目前没有证据支持它已经做到了。
6.2 常见误解清单(对照自查)
| 常见说法 | 真相 |
|---|---|
| ”它随机掷骰子” | 随机是外部开关(采样),模型本体是确定的 |
| ”思维链就是让它更认真” | 是机制必需:把参数里的知识搬到上下文才能运算 |
| ”多写几个字就能更聪明” | 小模型(<10B)思维链反而有害;变长需要内部有可调用的东西 |
| ”模型越大越强” | 1.3B InstructGPT 打赢 175B GPT-3;32B 蒸馏反超 32B RL |
| ”标称 1M 上下文 = 真能记住 1M” | 32K 就有一半模型掉队,中间位置最差 |
| ”MoE 有数学专家、语文专家” | 原文从未如此表述;专家分工可能重叠 |
| ”通过图灵测试 = 懂了” | 图灵测试测行为不可区分,正是中文房间承认”能过却不懂”的 |
| ”R1 的 aha moment = 模型有了意识” | 是研究者对现象的命名,论文自述用了”拟人化语气" |
| "涌现是玄学” | 可能是度量指标的假象(非线性 vs 线性指标) |
6.3 决策地图:这个认识对你有什么用
| 你想干的事 | 该怎么理解 |
|---|---|
| 判断”它能不能独立完成复杂任务” | 看推理期算力是否足够、是否需要外部工具;别指望一次成 |
| 改进一个模型效果 | 在换模型之前先试:加思维链、先检索再喂、把指令写成可验证的、检查 harness |
| 判断”它说的话可不可信” | 知识≠推理:它记得住不等于推得动;逆向问题尤其容易错 |
| 判断”它是不是在思考” | 看它有没有把中间步骤写出来并被后续用到——但这不保证它真的”理解” |
| 跟别人解释”它到底是不是排字” | 用 6.1 那张分层表 |
6.4 术语表(中英对照)
| 中文 | 英文 | 大白话 |
|---|---|---|
| 自回归生成 | Autoregressive Generation | 把输出喂回输入、一字一字往外挤 |
| 词元 | Token | 模型处理文字的最小单位 |
| 解码策略 | Decoding | 从概率表里”怎么挑” |
| 贪心解码 | Greedy Decoding | 每步都挑概率最高的,不掷骰子 |
| 温度 | Temperature | 给概率表”调冷调热”;调到 0 就是贪心 |
| 核采样 | Nucleus Sampling (top-p) | 从累计概率前 p% 的候选里抽签 |
| 机械可解释性 | Mechanistic Interpretability | 反推模型内部的具体算法结构 |
| 归纳头 | Induction Head | ”看过一遍就会照做”的最小算法 |
| 叠加 | Superposition | 特征数多于维度数,多个特征叠在一起 |
| 稀疏自编码器 | Sparse Autoencoder (SAE) | 把混沌激活拆成可命名的概念 |
| 压缩即智能 | Compression = Intelligence | 预测得越准,越要编码世界规律 |
| 监督微调 | Supervised Fine-Tuning (SFT) | 用人写的示范微调 |
| 指令微调 | Instruction Tuning | 教模型”把话当任务” |
| [[RLHF与RLVR|人类反馈强化学习 | 人类反馈强化学习]] | RLHF |
| [[RLHF与RLVR|可验证奖励强化学习 | 可验证奖励强化学习]] | RLVR |
| 直接偏好优化 | DPO | 把 RLHF 两步压成一步 |
| 宪法 AI | Constitutional AI | 用原则清单 + AI 评委替代人工标注 |
| 思维链 | Chain-of-Thought (CoT) | 把中间推理步骤写出来 |
| 自洽性 | Self-Consistency | 多采样取多数答案 |
| 推理期缩放 | Test-Time Compute Scaling | 回答时多花算力 |
| 预算强制 | Budget Forcing | 追加 “Wait” 逼模型继续想 |
| 混合专家 | Mixture of Experts (MoE) | 每个 token 走不同的”专家”参数 |
| 长上下文 | Long Context | 一次能塞进去多少字 |
| 上下文腐坏 | Context Rot | 输入越长,表现越不可靠 |
| 工程框架 | Harness | 模型之外的循环/工具/上下文管理 |
| 中文房间 | Chinese Room | 句法操作能否产生语义的思想实验 |
| 随机鹦鹉 | Stochastic Parrot | ”概率拼接语言形式、不指涉意义” |
| 涌现能力 | Emergent Abilities | ”小模型没有、大模型才有”是否真实 |
| 逆向诅咒 | Reversal Curse | 学会”A 是 B”,推不出”B 是 A” |
6.5 来源清单
本文所有数据与引文均来自以下五份底稿,底稿内每条都附有一手来源(论文/官方报告/官方博客)的标题、作者、年份、arXiv 编号与 URL:
底稿(processed/) | 覆盖内容 |
|---|---|
LLM排字游戏-机制层数据底稿.md | Transformer / 自回归 / 解码策略 / 压缩即智能 / 机械可解释性 / 世界模型 |
LLM排字游戏-训练路线上半数据底稿.md | 预训练 / FLAN / Self-Instruct / LIMA / RLHF / DPO / 宪法 AI |
LLM排字游戏-推理模型与推理期缩放数据底稿.md | CoT / 自洽性 / 知识操纵 / STaR / PRM / o1 / DeepSeek-R1 / Snell / s1 / 涌现之争 |
LLM排字游戏-前沿架构与Agent数据底稿.md | MoE / 长上下文 / 工具调用 / Agent / 多模态 |
LLM排字游戏-理解之争与哲学层数据底稿.md | 中文房间 / 随机鹦鹉 / 形式-功能能力 / Sparks of AGI / Chomsky / 逆向诅咒 / 图灵测试 |
关键论文速查(按文中出现顺序):
| 来源 | 一句话 |
|---|---|
| Vaswani et al., arXiv:1706.03762 | Transformer 开山 |
| Brown et al., arXiv:2005.14165 | GPT-3,175B,自回归 |
| OpenAI / Hugging Face 官方文档 | 解码策略、temperature |
| Delétang et al., arXiv:2309.10668 | Language Modeling Is Compression |
| Olsson et al., arXiv:2209.11895 | 归纳头 |
| Elhage et al., arXiv:2209.10652 | Toy Models of Superposition |
| Bricken et al., 2023 / Templeton et al., 2024 | Towards / Scaling Monosemanticity |
| Li et al., arXiv:2210.13382 / Vafa et al., arXiv:2406.03689 | Othello-GPT 及其反方 |
| Merrill & Sabharwal, arXiv:2310.07923 | CoT 换计算深度 |
| Wei et al., arXiv:2109.01652 | FLAN 指令微调 |
| Wang et al., arXiv:2212.10560 | Self-Instruct |
| Zhou et al., arXiv:2305.11206 | LIMA,表层对齐 |
| Ouyang et al., arXiv:2203.02155 | InstructGPT / RLHF |
| Rafailov et al., arXiv:2305.18290 | DPO |
| Bai et al., arXiv:2212.08073 | 宪法 AI |
| Wei et al., arXiv:2201.11903 | Chain-of-Thought |
| Wang et al., arXiv:2203.11171 | Self-Consistency |
| Kojima et al., arXiv:2205.11916 | Zero-shot CoT |
| Allen-Zhu & Li, arXiv:2309.14402 | 知识操纵(知识 ≠ 推理) |
| Zelikman et al., arXiv:2203.14465 / arXiv:2403.09629 | STaR / Quiet-STaR |
| Lightman et al., arXiv:2305.20050 | Let’s Verify Step by Step / PRM |
| OpenAI 官方博客 2024-09 | o1《Learning to Reason with LLMs》 |
| DeepSeek-AI, arXiv:2501.12948 | DeepSeek-R1(Nature 645:633–638) |
| Snell et al., arXiv:2408.03314 | 推理期缩放 |
| Muennighoff et al., arXiv:2501.19393 | s1 预算强制 |
| Wei et al., arXiv:2206.07682 / Schaeffer et al., arXiv:2304.15004 | 涌现之争 |
| Fedus et al., arXiv:2101.03961 / Jiang et al., arXiv:2401.04088 | Switch / Mixtral |
| Su et al., arXiv:2104.09864 / Liu et al., arXiv:2307.03172 / arXiv:2502.05167 | RoPE / Lost in the Middle / NoLiMa |
| Yao et al., arXiv:2210.03629 / Schick et al., arXiv:2302.04761 / Qin et al., arXiv:2307.16789 | ReAct / Toolformer / ToolLLM |
| Radford et al., arXiv:2103.00020 / OpenAI, arXiv:2410.21276 | CLIP / GPT-4o |
| Searle, 1980, BBS | 中文房间 |
| Bender et al., FAccT ‘21 | 随机鹦鹉 |
| Mahowald et al., arXiv:2301.06627 | 形式 vs 功能能力 |
| Bubeck et al., arXiv:2303.12712 | Sparks of AGI |
| Berglund et al., arXiv:2309.12288 | 逆向诅咒 |
| Jones & Bergen, arXiv:2503.23674 (PNAS 2026) | 图灵测试 |
6.6 延伸阅读:wiki 里的对应词条
- 机制类:自回归生成、机械可解释性、混合专家、量化与蒸馏、知识容量
- 路线类:思维链、推理期缩放、RLHF与RLVR、指令遵循、上下文工程
- 能力类:能力维度、涌现能力、长上下文、上下文腐坏、工具调用、模型与框架分责
- 争议类:中文房间、随机鹦鹉、幻觉
- 姊妹篇:大模型的参数与能力维度(讲参数/缩放/评测,与本文零重叠)
写在最后:你原来那个”LLM 就是随机排字”的直觉,不是错的,只是不完整。它精确描述了输出的形式,却漏掉了三件事——它内部有可读的算法结构,“写出来的字”是下一步计算的真实输入,以及决定它像不像样的能力有一大半在模型之外。
而”思维链不属于纯粹排字”这个说法,方向是对的,理由需要更正:思维链不是”打破了排字”,而是让排字本身承载了计算——把参数里的死知识搬进上下文,变成活的可操作材料。这才是它真正的意义。