RLHF 与 RLVR(Reinforcement Learning from Human Feedback / with Verifiable Rewards)
一句话定义:RLHF 用人的偏好训练模型,把预训练模型变成聊天机器人;RLVR 用能被程序判对错的奖励训练模型,造出擅长数学等任务的推理模型。 两者是 TypeSafe 引入第三条路径(RLCD)时用来做对照的两条既有路线。
1. RLHF:人类反馈强化学习
官方 AI primer 的定义:
“Reinforcement learning from human feedback turned pretrained models into chatbots. It trains models to produce responses people prefer.”
翻译:人类反馈强化学习把预训练模型变成了聊天机器人,它训练模型产出人们更偏好的回复。
官方补充的事实:RLHF 被用于训练 InstructGPT 与 ChatGPT,并且是 TypeSafe 联合创始人 Diogo Almeida 共同发明的技术。这构成了 Jev 出身的一条技术脉络,也见 OpenAI。
2. RLVR:可验证奖励强化学习
“Reinforcement learning with verifiable rewards created reasoning models that are strong at tasks such as mathematics, but slower and more expensive.”
翻译:可验证奖励强化学习造出了推理模型,它们在数学等任务上很强,但更慢、也更贵。
官方用例页把这类模型匹配的场景描述为”可验证问题(数学证明、内核优化)“:当正确性能被廉价、自动地检查时,LLM 可以生成、测试、迭代直到找到可行解。这类”想得更久换更强”的机制见 思维链 与 推理期缩放。
3. 官方指出的问题
3.1 谄媚与”听起来很自信”的幻觉
“RLHF teaches a model to say things that people prefer. That objective works well for chatbots, but it can also reward sycophancy and confident-sounding hallucinations.”
翻译:RLHF 教模型说人们更爱听的话。这个目标对聊天机器人很有效,但它同时会奖励谄媚(sycophancy)以及听起来很自信的幻觉。
首页给出的是一句总结式的清单:
“Yet RLHF creates inherent issues such as mode dropping, overconfidence, and lack of reliability. These flaws mean that LLMs require humans-in-the-loop.”
翻译:然而 RLHF 会带来一些固有问题,比如模式掉落(mode dropping)、过度自信、以及缺乏可靠性。这些缺陷意味着 LLM 需要人类留在回路里。
3.2 模式掉落(Mode Dropping)
“Preference optimization also causes mode dropping: the model learns to favor a particular style, such as instruction following, while reducing the probability of other possible outputs.”
翻译:偏好优化还会造成模式掉落:模型学会偏好某种特定风格(例如指令遵循),同时压低其他可能输出的概率。
官方把模式掉落描述为模式崩溃(mode collapse)的温和版本——经典生成对抗网络(Generative Adversarial Network, GAN)的失效模式是生成器反复产出同一类输出,因为这类输出总能骗过判别器。
3.3 人的偏好不等于机器的可信
“An output can be compelling to a person without being reliable enough for unattended automation. Human preference and machine trustworthiness are different optimization targets.”
翻译:一个输出可以对人很有说服力,却不足以可靠到能无人值守地自动化。人类偏好与机器可信度是两个不同的优化目标。
3.4 慢且贵
RLVR 路线的推理模型”更强但更慢、更贵”(见第 2 节引文);官方博客给出的对照数字是:LLM 端到端响应时间 3 到 329 秒,而 TypeSafe 为 70ms–500ms,官方称在同等系统一智能水平下快 40 倍–200 倍。
4. 与 Jev 的关系
TypeSafe 把 RLHF 与 RLVR 作为两条既有的后训练(post-training)路径列出,并加上自己的第三条:RLCD(面向校准决策的强化学习,Reinforcement Learning for Calibrated Decisions)。
- RLHF 产出”文字”,RLVR 产出”推理”,RLCD 产出”带诚实概率的决策”。
- 官方立场:RLHF 仍然适合对话模型,但生产自动化需要另一个以受限决策与校准不确定性为中心的优化目标。
- RLHF 的过度自信问题,正是 概率校准 与置信度路由(见 置信度与概率)要解决的对照面。
相关来源
introduction__machine-learning-primer.md—— RLHF/RLVR/RLCD 三条路径的定义与 RLHF 问题清单o01-home.txt—— “mode dropping、overconfidence、lack of reliability”的总结o04-blog-sysone.txt—— 三条路径的优化目标对照表o03-docs-usecase.txt—— “可验证问题”适用场景concepts__how-to-build-with-system-one.md—— “人类偏好 vs. 机器可信度”的工程含义