一句话摘要:这是一份由 61 位贡献者维护、明确声明与 TypeSafe AI 无隶属关系的 Jev 生态精选清单,它把官方资源(含官方 JavaScript / Python 开发包(Software Development Kit, SDK)、System One Adapter、Agent Skills、评测站、Discord)与社区项目按七大类归类,并为每条项目保留作者自己写下的局限与负面结论,是一份”看好它、也把坑写清楚”的实地指南。

Awesome Jev / TypeSafe

The field guide to typed decisions.(独立社区项目,非 TypeSafe AI 官方或背书)

来源:processed/jev-原始资料/社区精选/awesome-typesafe.md,最后更新 2026-09-21;贡献者徽章显示 all_contributors-61。许可 MIT。


一、这份清单的定位与核心主张

  • 一句话定位:“Jev turns context into a probability, a choice, or a score; your code owns the threshold and the action.”(Jev 把上下文变成概率、选择或分数;阈值与动作由你的代码掌控。)
  • 官方文档的支持工单示例(jev-1.13.0):Jev 选中技术团队(概率 0.85)、把客户愤怒度打在第 1 档(0–2 制评分量表)、给出紧迫度 1.0 的非是题概率(Noul probability);应用代码仍决定何时路由或升级。
  • 三类答案形状(原语,Primitives):
    • Noul:明确的”是/否”主张返回 0–1 的”是”的概率。
    • Choice:从命名选项中选一个,返回选中项、每个选项的概率与置信度。
    • Score:在有序列评分量表上打分,返回位置、各档概率与置信度。
  • 清单强调:阈值、回退行为、副作用都写在应用代码里;官方示例里的 0.9 路由规则是”说明性阈值,不是被测过或推荐的运行点”。
  • 免责声明原文:社区条目按区块标注,“inclusion is not a claim that TypeSafe has reviewed or approved them.”(收录不等于 TypeSafe 审查或批准过它们。)

二、“Before you trust a decision”:清单收录的 4 条独立研究结论

这是本清单最有价值的部分——四条提醒全部来自独立第三方研究的负面或警告结论:

  1. 给不确定的案例留出出口。 一份 KoBBQ 校准审计(Jev独立评测Janus与排序校验)发现,移除”unknown”这个 Choice 选项会迫使模型对无法回答的条目硬答;任务允许歧义时,应包含”无匹配”或复核路径。
  2. 阈值必须在你自己的标注数据上测量。 Janus 发现在一个数据集上有用的路由阈值无法迁移到另一个数据集,因此它不提供默认阈值。
  3. 把排序当作排序来测。 一项独立排序研究(jev-orderby-bench)通过了主题归属检查,却在多项商品相关性检查上失败;“分类准确率本身并不能证明对概率做 ORDER BY 有用”。
  4. 审计模型周边的策略(Policy)。 在一次智能体动作门控评估中,最大的误差来源是应用自身从答案到动作的映射;应把权限、阈值与副作用显式写在代码里。

清单对以上结论的限定:“These studies use particular tasks, datasets, and model versions. Treat their results as test designs for your workload, not universal guarantees.”(这些研究针对特定任务、数据集与模型版本,应视为你自身负载的测试设计,而非普适保证。)

三、官方资源清单

1. 产品与文档

  • TypeSafe AI 官网(System One 模型与 Jev 的产品站);文档站 docs.typesafe.ai(指南、SDK 参考、模式、Cookbook、HTTP API)。
  • HTTP API reference:直接集成用的请求/响应契约。
  • Interactive demos:官方动手示例,含智能家居助手。
  • Workflow evals(evals.typesafe.ai):TypeSafe 自己发布的工作流、模型对比、方法论与示例查询——即官方评测站。

2. SDK 与开发者工具

  • JavaScript SDK:官方 JavaScript 与 TypeScript 客户端,答案类型可推断(npm install @typesafe-ai/sdk,Node.js 20+)。
  • Python SDK:官方同步与异步 Python 客户端。(官方文档全貌见 Jev 官方文档|Jev 官方文档,发布方见 TypeSafe AI。)
  • System One Adapter(system-one-adapter-python):即插即用的 Python 适配器,让同一套类型化接口跑在 OpenAI、Anthropic 及 OpenAI 兼容的 LLM API 之上。
  • TypeSafe Agent Skills(typesafe-ai/skills):官方智能体技能(Agent Skill),让 Claude Code、Codex 等兼容技能的智能体设计 TypeSafe 工作流。
  • TypeSafe GitHub 组织:官方维护的源码仓库。

3. 概念、模式与 Cookbook

  • Primitives(Choice / Score / Noul 的结果形状与使用场景);Confidence(置信度与答案概率的区别,以及如何当作架构控制手段)。
  • Patterns:置信度门控(Confidence-Gated Routing)、复合评分(Composite Scoring)、投机式扇出(Speculative Fan-out)、意图路由(Intent Routing)。
  • Example use cases:从真实工作流到类型化判断的映射;Cookbook(并行提问、重排、语义搜索、护栏、抽取、分类等);Agent skill guide。

4. 研究与写作 / 社区与更新

  • 官方博客《Introducing System One Models & Jev》《The Bitterest Lesson》《AI: too good to be true, too bad to be useful》与 Manifesto。
  • Discord(官方社区服务器)、Show and Tell 频道(需先入 Discord)、X、LinkedIn。

四、社区项目:客户端库与集成(12+ 语言)

  • TypeScript / JavaScript:Advocaat(小型 TS 客户端,带 tag 助手);json-render(Vercel Labs 的生成式 UI 框架,实验性 Jev composer,API 未发布、需源码构建)。
  • Rust:s1-rs(Choice/Score/Noul 的 derive 层,支持无网测试);typesafe-rs(面向延迟、与官方客户端行为对齐);TypeSafe AI for Rust(阻塞与异步传输、可观察重试)。
  • Ruby:Hunch(Gem,if Hunch.likely?(...) 直接做控制流);RubyLLM TypeSafe(RubyLLM 2 的 provider);typesafe-sdk(线程安全连接池,无异步客户端);typesafe-ai-rails(Rails 集成,含用量/成本遥测)。
  • Go:TypeSafe SDK for Go(Retry-After 重试、errors.Is 可匹配的错误树、log/slog 记录请求体;未建模的答案类型会被丢弃并告警;尚无 tagged release,go get 拿到的是伪版本)。
  • Java / Kotlin / .NET / Scala:Java 17 客户端(Spring Boot starter,仅依赖 Jackson);Kotlin 移植(仅 Android 与 JVM,走 JitPack 而非 Maven Central);TypeSafeAI.Net(HttpClientFactory、DI 与 Microsoft.Extensions.AI 适配器);scala-jev-sdk(无自有 effect 系统,Future/阻塞/cats-effect/ZIO 均可,不支持 Scala 2.13)。
  • PHP / Elixir / OCaml / Swift:PHP 8.3 客户端(可在 TypeSafe 与 OpenRouter 间一键切换,调用同步、模型列表仅 TypeSafe 可用);typesafe_sdk(Elixir,类型化 struct);OCaml SDK(基于 eio);两款 Swift 客户端(marandaneto 的实验版;alterhq 的无依赖 Swift 6 版,生产 Apple 应用应经后端代理)。
  • 数据/SQL 集成:DuckDB Jev(原生扩展,谓词/Choice/Score 与流式批量;公布吞吐用的是重复合成工单语料,不测分类准确率);vgi-typesafe(经 VGI 扩展暴露为 SQL 表函数,每个非空行都可能是计费请求);jevql(psql 风格 CLI,WHERE jev(alias, 'condition'),过完 SQL 过滤的每一行都会被送去判);LlamaIndex Jev(非官方 重排序 器,score 模式是 0–3 rubric 而非余弦相似度)。
  • 网关与生态绑定:Vercel AI Gateway(第三方托管入口);Vercel AI SDK for Python(公开测试版,实验性 evaluate,仍需 Gateway 访问);jev-acp(独立 ACP 智能体);pi-typesafe(Pi 扩展,请求按用户 opt-in 且计费)。

五、社区项目:Agent 与开发者工具

  • Jev 当”反射神经”的编程助手项目:jev-cli(把判断变成可管道、按退出码门控的 shell 命令,rerank 最多 250 候选,compact 逐字丢弃陈旧工具调用,阈值与 --fail-on 政策写在代码里);jgrep(语义 grep,把文件切 5–60 行块,逐块独立判,跨文件问题匹配不到);jev.nvim(把 buffer 按函数拆分打分,按概率排进 quickfix)。
  • 门控与安全:jev-engineering(先跑确定性规则再发一次 Jev 请求;作者公布对抗结果——超过 300 次调用中,直白注入移动了 30 条危险命令中的 0 条,但造成安全命令 10% 误拒,而”权威框架”式诱导移动了 3/30);jev-use(jev_gate 只能拒绝或询问,后端不可达时升级而非放行,并公开了 Jev 表现更差的运行结果);pi-verdict(先跑确定性规则,灰区交给 fail-closed 分类器;Jev 后端实验性,会忽略受保护路径提示、可被对抗性转录内容摇动)。
  • 上下文与流程:pi-jev-context(在长工具输出进入上下文前压缩,只隐藏”确信不需要”的块,代码保证失败行/请求词/头部块存活;公开了一条负面结果——按 Jev 判断剪枝旧上下文会丢掉后来需要的信息,故该部分仅保留影子模式);Bicameral(LLM 写作 + Jev 提供类型化反射,明确不是沙箱);Jev-assisted shell / compaction(kamchatka 智能体给 shell 命令打安全评级)。
  • 其余:hush(GitHub Action 议题分类,低于阈值什么都不做);is-malicious(扫描源码/配置/CI 文件);Jev MCP / TypeSafe MCP(MCP 服务器);Jev Review、slop-grader、Supercov、Every(语义代码搜索)、jevcal(在你自己的标注数据上拟合每问阈值并做 CI 复检,不发布自己的 Jev 结果,少于约 100 行标注的阈值不可信)。

六、社区项目:浏览器智能体

  • Jev Ultrafast(Browser Use):动态索引动作空间、批量操作与目标决策、轨迹记录,含一项测过的 Google Flights 演示。
  • Jev for Chrome(非官方 Manifest V3 扩展):Jev 一次请求选操作与 DOM 元素,小文本模型写值,含 17 任务无头 Chromium 测试套件。
  • Cline Jev Browser:把受限的 Playwright 步骤交给 Jev(经 Vercel AI Gateway),其”审查指令”是模型指引而非强制安全边界。
  • jev-skip:读 YouTube 字幕轨,在进度条上画每段赞助概率,无众包数据库;报告在 23 个视频上覆盖 SponsorBlock 赞助秒数的 77%,每个视频 $0.0008。
  • PlotVeil:Chrome 扩展遮挡剧透评论,一条 Noul 问题判定是否泄露具体情节;阈值(0.5/0.7/0.85)归应用代码所有,检查失败或配额被拒时保持遮挡而非揭示;提交的评测只是 10 条手写回归集,非生产准确率。
  • 另:jev-agent-browser、Jev Social、unclutter(API 密钥明文存在本地扩展存储)。

七、社区项目:应用与工作流

  • BTK audit studies:生产 SEO 研究,每轮判 1,204 页、3 分钟内 4,816 条类型化判断,每 12 查询批 $0.0048(jev-1.13.0)。
  • Crowdcheck / Jevtown:对 10,000 个合成人格(Persona)做反应模拟;Jevtown 一次开场请求对约 60 个受众属性(商品/挂牌 83 个)加 7 个审核问题打分,再批量返回每个合成人格的反应;均为模拟而非真实行为预测(Jevtown 开源 MIT,无人格模型撰写)。
  • Jev Trade:Hyperliquid 实盘台,五个隔离钱包,每 tick 把盘口/成交/持仓打包为状态,Jev 用 Choice 答多空、开平、杠杆,代码下单(hold 不发单);含 dry-run 路径。
  • Jev Wrapped / TypeSafe Typewriter:公开 Telegram 频道 X 光(最多 1,500 帖,Choice 十类帖 + 三条 Noul)与 Val Town 上”16 条类型化判断随文本实时更新”的演示。
  • 其他:DocJev(文档分类,公布 40 文档 8 包对比但无人工标注复核);HA-Jev(Home Assistant 集成,答案不带解释,不适合安全决策);JevNoiseGate(Android 通知降噪,凭据明文存于应用私有存储);QuantDinger(量化平台,Jev 作可选 PASS/REJECT 门);Paper Trellis 引用校验器(尚无标注的生物医学验证集)。

八、社区项目:游戏与机器人

  • HEIST//ONE:可观测的浏览器潜行游戏,Jev 为 6 名守卫提供批量类型化判断,确定性代码拥有模拟并验证每个提议。
  • Jev Drone(MuJoCo 四旋翼,控制与安全留在代码)、Jev Plays StarCraft(结构化状态、可验证运行、概率轨迹、证据包)。
  • PlayJev:开放的 0.8B 模型,仅凭画面玩十款浏览器游戏,每步一次前向传播(Forward Pass),公开权重与浏览器演示。
  • Jev Plays Pokémon / Pokémon Red / TypeSafe Mario:宝可梦对战决策;Pokémon Red 中确定性代码拥有路线与算术,Jev 只在分支处选择,每个对战回合的倒下预测用 Brier 分数对模拟器 RAM 状态打分。
  • jev-physical-ai:300 次 Jev 调用的仓库车队分诊演示;事故由模板模拟,未测任何机器人硬件或生产准确率。

九、独立评测逐个摘要(清单收录)

  • Janus:Banking77 与 Web of Science 两数据集上的校准测量与 Jev→前沿模型级联定价;协议在任何结果前冻结,原始 JSONL 与图表已提交;无任何路由参数在两数据集间迁移。→ 详见 Jev独立评测Janus与排序校验
  • jev-orderby-bench:预注册门槛检验 ORDER BY 概率是否站得住;20 Newsgroups 主题归属通过,Amazon ESCI 商品相关性 6 项检验 4 项不通过。→ 详见 Jev独立评测Janus与排序校验
  • jev-calibration-audit:可复现代码与逐调用 JSONL,测弃权选项、韩英配对比对、问题形状干扰、选项顺序;强弃权结论在 KoBBQ 数据集上,非普适校准保证。→ 详见 Jev独立评测Janus与排序校验
  • jev-ood-calibration:三个公开基准 + 900 条规则生成工单;公开集上接近校准,在没见过的优先级规则上过度自信。→ 详见 Jev独立评测域外校准与安全
  • jev-sec-bench:盲测 662 条公开提示注入 + 200 对匹配的脆弱代码;分类分数使用固定的 0.5 阈值。→ 详见 Jev独立评测域外校准与安全
  • Jev Judge vs Dimension Scores:三任务对比”每行一条直接提问”与”12–14 个维度打分 + 本地拟合权重”;分解达 0.9076 对 0.8373,但把约 25 倍正常内容误判为攻击,四次修复失败。→ 详见 Jev独立评测域外校准与安全
  • Jev Enterprise Decision Fabric:实验性 .NET 决策架构,111 案例 Jev 对 Claude 的智能体动作评估,公开标签与原始 JSONL;一位标注者在看过 Jev 试点后修改了标签。→ 详见 Jev独立评测域外校准与安全
  • Luce:开放配方——任务描述 + LLM 教师造数据 + Qwen3-4B-Base 上 LoRA + 决策头,12 GB GPU 可跑;README 报告与 Jev 同题准确率与 ECE。→ 详见 Jev开源复现Luce与NanoJev
  • NanoJev:开放 0.6B 模型,Maze/Snake/ViZDoom 单次前向出动作概率;专精这三款游戏,不是通用 Jev API 替代品。→ 详见 Jev开源复现Luce与NanoJev
  • Laya:开放的本地 Choice/Score/Noul 决策模型与英/多语路由器;其 Jev 对比用不同提示与样本量而非受控对比,原始校准与部分语言仍弱。→ 详见 Jev开源复现Luce与NanoJev
  • poorjev:在现成零样本 NLI 模型上复现三种接口 + 温度缩放 + 共形弃权,自带可复现校准评测(ECE 0.170→0.071),离线运行无需 API 密钥。→ 详见 Jev开源复现Luce与NanoJev
  • SemIf(原 OpenJev):直接对类型化选项打分的开放模型研究基线,复现的是接口模式,而非 Jev 未公开的模型或训练。→ 详见 Jev开源复现Luce与NanoJev
  • 其他:Jev Rerank Bench(含原始响应、不确定性区间与局限)、Jev Spam Eval(零样本垃圾邮件探索性研究,含事后调参说明)、jev-measured(OpenRouter 上八用例的可复现测量与 27 条作者自写工单对比,作者公开原始数据并修正早期对比错误)、TypeSafe AI Benchmark(Jev 与 Qwen-on-Cerebras 并排对比,含原始导出与成本核算)。

十、展示与一线记录

  • Browser Use + Jev(Gregor Zunic 的实时航班搜索演示)、Jev Typewriter 发布帖、内部分类器一线笔记(与某私有微调 Qwen 分类器的匹配精度对比,属轶事证据,非可复现基准)、Qwen on Cerebras 对比、Typed Decisions Not Chat、typesafeai.app(独立目录,每条记录带证据等级与”官方/社区”标签)。

重要引用

“Jev turns context into a probability, a choice, or a score; your code owns the threshold and the action.” 译文:Jev 把上下文变成一个概率、一个选择或一个分数;阈值与动作由你的代码掌控。

“Before you trust a decision… Audit the policy around the model. In one agent-action gate evaluation, the largest error source was the application’s own mapping from answers to actions.” 译文:在你信任一个决策之前……审计围绕模型的策略。在一次智能体动作门控评估中,最大的误差来源是应用自身从答案到动作的映射。

“Community projects are independent unless their repository says otherwise. Read the code, licenses, data-handling notes, and evaluation caveats before using them in a consequential system.” 译文:除仓库另有说明,社区项目都是独立的。在把它们用于有后果的系统前,请阅读代码、许可、数据处理说明与评测注意事项。

“Independent community project. This repository is not affiliated with or endorsed by TypeSafe AI.” 译文:独立社区项目。本仓库与 TypeSafe AI 无隶属关系,也未获其背书。