RLCD(Reinforcement Learning for Calibrated Decisions)

一句话定义:RLCD 是 TypeSafe 自己的后训练(post-training)方法,优化目标既不是”写人爱看的文字”,也不是”答对可验证的题”,而是”给出认识论上诚实的概率”。 Jev 就是用 RLCD 训练的。


1. 官方定义

AI primer 的定义:

“Reinforcement learning for calibrated decisions trains TypeSafe to return decisions and calibrated probabilities instead of generated text.”

翻译:面向校准决策的强化学习训练 TypeSafe 返回决策与经过校准的概率,而不是生成文本。

官方把它在首页描述为一条新路线:新架构 + 新采样器 + 新训练算法,三件套中的训练算法即 RLCD。

2. 优化目标:诚实的概率

RLCD 定义了一份不同的输出契约:

“The model does not generate text. It returns decisions and probabilities. Higher probability should correspond to a greater chance that the answer is correct.”

翻译:模型不生成文本。它返回决策与概率。更高的概率应对应更大的”答案正确”的机会。

官方博客对照表把这一目标表述为 “calibrated decisions: answers with epistemically honest probabilities on System One tasks”(校准决策:在系统一任务上给出认识论上诚实的概率)。

“更高概率 = 更高正确率”这一性质的可检验含义见 概率校准。

3. 与 RLHF / RLVR 的对照表

下表取自官方发布博客的横向比较(RLHF 与 RLVR 属”既有 LLM”一列,RLCD 属”System One + Jev”一列):

维度RLHFRLVRRLCD
优化目标人类偏好:人类评分者更喜欢的文稿与聊天回复可验证奖励:可被程序化验证的输出校准决策:在系统一任务上给出认识论上诚实的概率
输入非结构化数据(如文本),偏重序列化的消息非结构化数据(如文本),偏重序列化的消息非结构化数据(如文本),偏重结构化的程序状态
输出字符串 / 生成文本;软件要用得先解析与校验,且总存在跑偏风险字符串 / 生成文本;同上类型安全的结构化值;可能输出与结构事先定义,模型不会犯类型错误,所有答案都带校准概率与置信度
置信度倾向过度自信且不一致;即使被要求给出把握度也不可靠同左每个输出都沟通置信度与不确定性;更校准,对相似输入返回更接近的答案

两点说明:

  • “输入""输出""置信度”三行中 RLHF 与 RLVR 合并表述,依据是博客把两者并列为同一列”Existing LLMs”。
  • RLHF 与 RLVR 各自的展开与问题清单见 RLHF与RLVR。

4. RLCD 训练出的模型是什么样

由 RLCD 训练出的系统一模型(System One Model)具有这些性质:

  • 不生成文本:不写回复、不写代码、不解释推理过程。
  • 返回决策与概率:概率分布覆盖你预先定义的选项或档位。
  • 概率与正确率挂钩:这是”校准”的可检验含义,见 概率校准。
  • 并行采样:官方称其输出在一次查询中并行生成(parallel sampler),与 LLM 逐 token 的自回归生成相对;这也是它在速度与成本上拉开差距的原因。
  • 可组合:因为输出是类型安全的受限值,可以像普通数据一样被排序、设阈值、做分支。

5. 与 Jev 的关系

  • Jev 是第一个公开的、用 RLCD 训练的系统一模型,官方称其为”旗舰模型(flagship model)”。
  • 同一份权重服务所有账户:

“Jev is not fine-tuned or LoRA-adapted with customer data. It is trained with RLCD to return calibrated decisions, and the same weights serve every account.”

翻译:Jev 不会用客户数据做微调或 LoRA 适配。它用 RLCD 训练以返回校准决策,同一份权重服务每一个账户。

  • 因此,面向领域的适配通过**请求(request)**完成,而不是通过每个账户单独的权重。
  • 产物怎么用:把置信度当阈值做门控,见 置信度与概率;它在”快判断/慢推理”分工里的位置见 双系统理论。

相关来源

  • introduction__machine-learning-primer.md —— RLCD 定义、输出契约、与 RLHF/RLVR 的并列说明
  • o04-blog-sysone.txt —— 三条路径的对照表与校准决策表述
  • o01-home.txt —— 新架构 + 新采样器 + RLCD 的”三件套”表述
  • models.md —— “同一份权重服务所有账户”
  • concepts__how-to-build-with-system-one.md —— “RLCD 用校准概率而非过度自信来沟通不确定性”