Introducing System One Models & Jev
TypeSafe AI 官方发布博客(2026 年 9 月 15 日,作者 Diogo Almeida,创始人)与官网首页(typesafe.ai)的来源摘要。这两份是 Jev 全部「官方声称」的第一手出处,包含官方的产品定位、新旧路径对照表、被引用的关键数字、以及官方主动承认的偏差与 caveat。原始语料见 processed/jev-原始资料/官方-网页/o04-blog-sysone.txt 与 o01-home.txt。
一句话摘要
TypeSafe 宣布其第一个「系统一模型(System One Model)」Jev 进入早期访问:官方称它在系统一类任务上达到与现有前沿大模型相近的智能水平,同时快两个数量级、便宜两个数量级,代价是放弃字符串生成——换来结构化、限定在预设选项内的类型安全输出,因此「不会幻觉、不会类型出错」。
关键要点
一、官方对「老路(Existing LLMs)vs System One + Jev」的完整对照表
以下为官方博客原表逐行摘录(左=现有 LLM,右=System One + Jev):
| 维度 | 现有大模型(Existing LLMs) | System One + Jev |
|---|---|---|
| 训练方法(Optimized with) | RLHF / RLVR | RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习) |
| 优化目标(Optimizes for) | 人类偏好:人类评分者更喜欢的文章与聊天回复;可验证奖励:能被程序化验证的输出 | 校准决策:在系统一类任务上给出「认知上诚实」的概率 |
| 输入(Inputs) | 非结构化数据(如文本),偏重顺序消息 | 非结构化数据(如文本),偏重结构化程序状态(program state) |
| 输出(Outputs) | 字符串 / 生成文本;灵活但需解析 + 校验,且「总有跑偏风险」 | 类型安全的结构化值;可能的输出与结构提前定义,模型永不产生类型错误,所有答案附带校准概率与置信度 |
| 采样(Sampling) | 串行(Sequential):一次一个词元,每个词元以上一个为条件 | 并行(Parallel):单次查询生成全部输出,极其高效且硬件友好 |
| 成本(Cost) | 输入词元 10 / Mtok;输出词元约为输入的 5 倍 | 输入词元 42 / 十亿词元);输出词元免费(“too cheap to meter”) |
| 速度(Speed) | 端到端 3–329 秒;与人交互够快,嵌进代码是巨大瓶颈 | 端到端 70 ms–500 ms;对系统一形态的查询,同等前沿智能下快 40–200 倍 |
| 置信度(Confidence) | 即便被要求给置信度估计,模型也倾向过度自信且前后不一致;官方原话:一个模型若 95% 情况能做对却说不出错的那 5%,就无法自动化该任务 | 每次输出都传达置信度与不确定性;校准(置信度越高准确率越高)、更一致(相似输入返回相似答案) |
| 用例(Use cases) | 人在环任务(聊天机器人、副驾、编程智能体)通用但需人监督;可验证问题(数学证明、内核优化)只要正确性可低成本自动检验,就能生成—测试—迭代;以及演示原型 | AI 驱动的工作流 / 智能 if 语句:结构化输出嵌进普通软件,做「分类、路由、打分、抽取、分支」;大数据的 Map-Reduce;实时应用(100 ms 级);校验一切(打分、评判、护栏、检测越狱) |
二、关键数字(官方口径)
- 193.6x Faster, 444.6x Cheaper:官网首页大字(标注 “based on workflows for System One tasks (proof)”),博客说明这来自 workflow evals,并承认属于真实世界增益的高位(higher end)。
- 首页同屏对照的具体一次运行:Jev 成本 0.013880、耗时 8.566 s。
- 42 / 十亿输入词元;官网称输入价格比 Claude Fable 5.1 低 238 倍(“238x Lower input price than Claude Fable 5.1”)。
- 速度:70 ms–500 ms(对比大模型 3–329 秒);系统一形态查询下快 40–200 倍。
- 官方定位句:「two orders of magnitude faster and more efficient」。
三、官方自己承认的 caveat 与 bias(博客 “Nuance” 小节,逐条)
关于可验证性
- 速度:官方称「我们真的有那么快」,但公布评测一般是在西海岸的笔记本上跑的(服务当前也部署在那里)。
- 价格:官方称定价透明,但**「我们没法证明它没有被补贴」,需要长期来证明定价的可持续性——并预期价格会下降而非上升**。
- 无类型错误:官方称这**「在数学上是不可推翻的」**,只要一个反例就能证伪,「但它数学上不可能」。
关于并排演示(side-by-side)
- 查询被高度简化,问句特意选用描述性、人类可读的键名,以便屏幕输出好懂。
- state 是一段短、密、详细的段落,为的是凸显采样方法的差异;较短的输入对 Jev 有利(“The relatively shorter input paints our model in an advantageous light.”)。
- 录制那一次唯一与 GPT-5.6 Terra 的分歧在 “Churn likelihood level”,官方认为该题答案本身确实含糊。
- 对比对象选 GPT-5.6 Terra(默认推理),因为官方认为它平均而言与 Jev 智能最可比。
关于 workflow evals
- 该评测不优化 ground truth 分类、不允许改 harness 与模型(避免通过「工程框架(Harness)调优」过拟合);而是假定存在正确计算图(代码里的 workflow),以最大、最聪明、最贵的外部模型的预测作为参考概率。
- 参考答案取 GPT-6 Astra 与 Fable 5.1 的平均,因此偏向 OpenAI 与 Anthropic 的模型;官方称可能低估了自家模型与 DeepSeek。
- 工作流不是为让自家模型好看而挑选或构造的,也不在训练分布里;但由模型能力团队的人制作,因此可能存在偏袒。
- 大模型一侧用 TypeSafe 的 System One LLM wrapper(把大模型约束成输出结构化决策),官方称这是从大模型拿决策最准的方式,但比不给概率的做法更慢更贵。
关于幻觉与类型安全
- 大模型侧的数字来自 OpenRouter,官方承认几乎肯定有偏——更复杂的查询可能被路由给更好的模型。
- Jev 的数字不是经验值:schema 匹配是保证的,所以可以自信地把 0% 加进图里。
四、三个官方 demo 及其标注的局限
① DOOM(博客 Fun Demos)
- 每秒约 10 次查询,折合约 $7/小时;作者原担心太贵,团队反而觉得「比预期低」。
- 局限(官方 Nuance):demo 跑在结构化 state(带文本的数据结构)上,而不是图像上(yet…);非 AI 的 DOOM bot 能打得更好,但官方想要的是「能对不同游戏状态表示作出反应」的 bot,并且「遵循指令这件事本身超酷」。
② Wikiracing(博客 Fun Demos)
- 玩法:从一个维基百科页面出发,只用途中遇到的链接抵达指定的另一个页面;每一步可能要在数百到数千个链接之间选择;是「每秒智能」以及「高基数选择下不幻觉所带来的复利收益」的极佳试验场。
- 局限(官方 Nuance):第 2、3 关都以 “Rubber Duck” 开头纯属偶然,作者是团队指出后才注意到的;此处的加速比前几个 demo 小得多,因为对手用的是非推理模式(Astra 也设为最低推理档),这也是 Jev 倾向用更少步数完成的原因(官方视作智能更高的迹象);大模型在开启推理时表现会比这里好得多;Jev 支持的基数上限是 255,遇到更高基数的选择时改用「先独立打分、再显式选择」的两阶段系统,因此偶有变慢。
③ 智能家居助手(官方文档 Demos 页,非博客)
- 演示投机式扇出(Speculative Fan-out):每个用户请求都对一长串问句求值,其中许多问题对多数请求并不相关,由代码事后过滤。
- 与生成模型分工:一个 Noul 问句判断「用户请求是否包含多个不同动作」,为真时用 LLM 把请求拆成原子命令再逐个交给 Jev;当 Jev 判定请求是「问信息或闲聊」时,交给 LLM 生成自由回复。
- 局限/边界:官方强调这个 demo 的初始 Jev 响应相比 LLM 响应快到几乎不给整体延迟增加负担,但仍需 LLM 兜底字符串生成;该 demo 页面未标注准确性局限。
- 反面做法(官方点名):把问题拆成多次 API 调用、等到确定需要再问,会明显更慢更贵。
五、FAQ 问题清单(两份,官方只列问题)
博客 FAQ(“We Give A FAQ”)
- Where do the names “System One Models” and “Jev” come from?
- Why was a new training algorithm needed?
- What use cases is Jev good for?
- Is Jev just a smaller LLM?
- How does Jev perform against public benchmarks?
- Where does our training data come from?
- These are results are kinda crazy - how is it possible?
首页 FAQ(“We give a FAQ”)
- What are System One Models? What is Jev?
- Is Jev just a smaller LLM?
- How is this different from JSON mode or structured outputs?
- How can Jev be so fast and inexpensive?
- Can you make Jev even faster?
- Are these prices temporary or subsidized?
- What is Jev good at? Where does it struggle?
- Can Jev still get things wrong?
- Is Jev deterministic?
- How do I get started or ask a question?
注:首页 FAQ 中仅第 1 条给出了正文答案——「System One 模型是一类为软件内决策而建的新 AI 模型;Jev 是 TypeSafe 首个公开的系统一模型,为自动化优化。给 Jev 结构化问句,得到带概率与置信度的类型化决策。」
重要引用
“Models have been superhuman at chat for years, so where is all the automation?”
模型在聊天上超越人类已经很多年,那么自动化到底在哪?
“Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.”
把 Jev 想成一次「前沿智能的函数调用」:非结构化的 state 进,带类型的概率化决策出。
“While Jev gives up string generation, it’s optimized for structured outputs and can’t hallucinate.”
Jev 放弃了字符串生成,但为结构化输出做了优化,并且不会幻觉。
“We can’t prove it isn’t subsidized; we’ll need the long-term to prove the sustainability of our pricing (which we expect to go down, not up).”
我们没法证明它没有被补贴;我们需要长期来证明这个定价的可持续性(我们预期它会降,不会涨)。
“If a model can do a task 95% of the time but doesn’t say when it’s in the 5%, it can’t automate that task.”
如果一个模型 95% 的时候能做对,却指不出它出错的那 5% 是什么时候,那就没法拿它做自动化。
“Jev is off the charts – owning the Pareto frontier for almost 2 orders of magnitude.”
Jev 直接冲出了图表——霸占帕累托前沿近两个数量级。
“Every order of magnitude drop in the cost of intelligence unlocks orders of magnitude more use cases.”
智能成本每下降一个数量级,就会解锁多出几个数量级的用例。
相关页面
- Jev 知识——面向非技术读者的全貌综合页
- Jev官方文档、Jev官方评测与用例地图、Jev官方缺陷清单jaggedness
- 丹尼尔卡尼曼(System One 命名由来)、模型与框架分责、Harness工程