一句话摘要:社区用完全公开的数据与配方在本地复现了 Jev 式的”类型化判断接口”——Luce 用 LLM 教师造数据 + Qwen3-4B-Base 上 LoRA + 决策头,12 GB GPU 就能跑;NanoJev 用 0.6B 模型在 Maze/Snake/ViZDoom 上单次前向直接输出动作概率;Laya 提供开放的本地 Choice/Score/Noul 决策模型与多语路由;poorjev 在零样本 NLI 模型上复现三种接口并把 ECE 从 0.170 降到 0.071;SemIf(原 OpenJev)复现的是接口模式而非 Jev 未公开的模型与训练。
Jev 开源复现:Luce · NanoJev · Laya · poorjev · SemIf
来源:processed/jev-原始资料/社区精选/awesome-typesafe.md 内五条开源复现条目的逐条摘要。
一、Luce:Jev 式决策模型的开放配方
项目:github.com/scienthoon/luce(与 jev-ood-calibration 同一作者)
关键要点
- 性质:开放的 Jev 式决策模型配方(recipe),不是权重发布,而是”怎么做”的完整流程。
- 三步配方:
- 先写一个任务描述(task description);
- 用一个 LLM 教师(LLM teacher)来写训练数据(合成数据);
- 在 Qwen3-4B-Base 上做 LoRA(Low-Rank Adaptation) 微调 加上一个决策头(decision head)。
- 产出:在 4B 基座模型上返回经过校准的 Choice、Score、Boolean 概率(calibrated choice, score, and boolean probabilities)。
- 硬件门槛:12 GB 显存(GPU)即可运行——意味着消费级单卡可复现,显著降低了复现门槛。
- 评估基准:README 报告了在完全相同的测试条目上,与 Jev 对比的准确率(accuracy)与期望校准误差(Expected Calibration Error, ECE)。
- 负面内容保留:报告明确包含”训练并不带来帮助的地方”(including where training does not help)——即不是一味宣称复现成功。
- 可复现性:附一个无需 GPU 的回放演示(GPU-free replay demo),无需显卡即可查看已有结果。
对使用者的含义
- 这条路线证明了”判断接口这一层是可复现的”:任务描述 + 合成数据 + 小模型 + 决策头,就能得到一个在本地跑的类型化判断器。
- 但它复现的是接口与行为,不是 Jev 的模型或训练方法(官方未公开);本地小模型的绝对水平取决于任务与数据质量。对照官方产品见 TypeSafe AI。
- 相关概念:模型与框架分责(决策头输出概率,阈值与动作仍归应用侧)。
二、NanoJev:0.6B 模型上的单次前向动作概率
项目:github.com/TianyuCodings/NanoJev
关键要点
- 性质:开放的 0.6B 参数 Jev 式模型。
- 用途:在三个环境里做单次前向传播(one-pass / one forward pass)的动作概率输出——Maze(迷宫)、Snake(贪吃蛇)、ViZDoom。
- 公开材料:公开检查点(checkpoint)、训练数据,以及可回放(replayable)的游戏对比。
- 关键限定(负面):它专精于这三款游戏,不是通用 Jev API 的替代品(“it is specialized to those games and is not a general Jev API replacement”)。
对使用者的含义
- NanoJev 展示的是”小到 0.6B 也能一次前向给出动作概率”的可行性,恰好对应 Jev 知识 里说的”每秒多次判断 ≠ 接管每一帧”——画面渲染/物理仍归游戏本身。
- 用途边界很窄:不是可迁移的通用能力,离开这三个环境就不适用。
- 相关概念:工具调用(动作空间是受限的索引集合)、Harness工程(确定性代码拥有模拟并验证提议)。
三、Laya:开放的本地决策模型与多语路由
项目:github.com/NandhaKishorM/laya
关键要点
- 性质:开放的本地 Choice、Score、Noul 决策模型,附带已发布的检查点(published checkpoints)。
- 特点:含一个面向英语与多语(multilingual)输入的路由器(router)——即先路由语言/输入,再交给对应决策模型(对应 模型路由 思路)。
- 关键限定(负面):
- 其与 Jev 的对比使用的是不同的提示(prompts)与不同的样本量(sample sizes),而不是受控的正面交锋(controlled head-to-head);
- 原始校准(raw calibration)仍然较弱;
- 部分语言仍然弱。
对使用者的含义
- 多语路由是它相对独特的方向,但对比方法不严谨(不同提示、不同样本量)意味着”与 Jev 谁更强”的结论不成立。
- 校准弱意味着它的概率不能直接当阈值依据使用。
- 相关概念:评测污染(不控制提示与样本量的对比会产生不可比的结果)。
四、poorjev:在零样本 NLI 模型上复现三种接口
项目:github.com/rupeshpoojary9/poorjev
关键要点
- 性质:开放、本地的复现——在现成的零样本 NLI(Natural Language Inference,自然语言推理)模型(commodity zero-shot NLI models)上复现 Choice / Score / Noul 三种接口。
- 两项关键技术:
- 温度缩放(Temperature Scaling)——用于校准;
- 共形弃权(Conformal Abstention)——用共形预测(Conformal Prediction)给出”不确定就弃权”的保证。
- 校准结果:自带一个可复现的校准评测,在其自己的小型标注集上,ECE 从 0.170 降到 0.071(且经过交叉验证,cross-validated)。
- 运行条件:离线运行,不需要 API 密钥(no API key)。
对使用者的含义
- 这是”零成本本地替代方案”的代表:用现成的 NLI 模型 + 校准 + 弃权,就能拿到一个带不确定出口的类型化判断器。
- ECE 0.170→0.071 的降幅说明温度缩放对这类模型是有效的;但作者强调是”自己的小型标注集”,泛化性需自行验证。
- 共形弃权与 jev-calibration-audit 的”弃权选项”结论呼应:给不确定留出口是可靠性的关键一环。
- 相关概念:模型与框架分责(弃权与阈值策略属于框架侧)。
五、SemIf(原 OpenJev):接口模式的开放研究基线
项目:github.com/TheoLeeCJ/SemIf(原名 OpenJev)
关键要点
- 性质:独立的开放模型研究基线,用于直接对类型化选项打分(direct typed option scoring)。
- 关键限定(负面,作者自陈):它复现的是接口模式(interface pattern),而不是 Jev 未公开的模型或训练(not Jev’s undisclosed model or training)。
对使用者的含义
- 名字里带”Jev”容易误解,作者明确划清界限:它是一个独立的选项打分基线,不是 Jev 的破解或等价物。
- 相关概念:模型与框架分责。
六、五个项目放在一起
| 项目 | 做法 | 硬件/运行条件 | 关键限定(负面) |
|---|---|---|---|
| Luce | 任务描述 + LLM 教师造数据 + Qwen3-4B-Base 上 LoRA + 决策头 | 12 GB GPU;含无 GPU 回放演示 | 报告包含”训练无帮助”之处,非全面成功 |
| NanoJev | 0.6B 模型,单次前向出动作概率 | 公开 checkpoint | 仅 Maze/Snake/ViZDoom,不是通用替代 |
| Laya | 开放本地 Choice/Score/Noul 模型 + 多语路由 | 公开 checkpoint | 与 Jev 对比非受控;原始校准与部分语言弱 |
| poorjev | 零样本 NLI 上复现三接口 + 温度缩放 + 共形弃权 | 离线,无需 API 密钥 | 校准结论来自其自身小型标注集 |
| SemIf | 直接类型化选项打分的开放基线 | 开放模型 | 复现接口模式,非 Jev 的未公开模型/训练 |
- 共同点:这些项目复现的都是”类型化判断接口”这一层——Choice/Score/Noul 的形状、校准与弃权;没有一个是 Jev 本体或其训练的复刻。
- 共同价值:它们给出了完全可审计、可离线运行、无需付费 API 的对照基线,可用于在自建场景里检验”是否真的需要 hosted 模型”。
- 共同局限:小模型/现成模型的绝对水平有限,且对比往往缺少受控条件——引用其数字前需回到各自 README 核对条件。
重要引用
“Open recipe for Jev-style decision models: a task description, an LLM teacher that writes the data, then LoRA plus a decision head on Qwen3-4B-Base returning calibrated choice, score, and boolean probabilities on a 12 GB GPU; the README reports accuracy and ECE against Jev on identical test items, including where training does not help, with a GPU-free replay demo.” 译文:Jev 式决策模型的开放配方:一份任务描述、一个撰写数据的 LLM 教师,然后在 Qwen3-4B-Base 上做 LoRA 加一个决策头,在 12 GB GPU 上返回校准过的 Choice/Score/Boolean 概率;README 报告了在相同测试条目上与 Jev 对比的准确率与 ECE,包含训练并无帮助之处,并附无需 GPU 的回放演示。
“Open 0.6B Jev-style model for one-pass action probabilities in Maze, Snake, and ViZDoom, with public checkpoint, training data, and replayable game comparisons; it is specialized to those games and is not a general Jev API replacement.” 译文:面向 Maze、Snake、ViZDoom 的单次前向动作概率的开放 0.6B Jev 式模型,含公开检查点、训练数据与可回放游戏对比;它专精于这些游戏,不是通用的 Jev API 替代品。
“its Jev comparisons use different prompts and sample sizes rather than a controlled head-to-head, and raw calibration and some languages remain weak.” 译文:(Laya)与 Jev 的对比使用了不同的提示与样本量,而非受控的正面交锋,且原始校准与部分语言仍然偏弱。
“ships a reproducible calibration eval (ECE 0.170 to 0.071 on its own small labelled set, cross-validated) and runs offline with no API key.” 译文:(poorjev)自带可复现的校准评测(在它自己的小型标注集上,ECE 从 0.170 降到 0.071,经交叉验证),且离线运行、无需 API 密钥。
“Independent open-model research baseline for direct typed option scoring; it reproduces the interface pattern, not Jev’s undisclosed model or training.” 译文:面向直接类型化选项打分的独立开放模型研究基线;它复现的是接口模式,而不是 Jev 未公开的模型或训练。