Example use cases
TypeSafe AI 官方「用例地图」页(docs.typesafe.ai/concepts/use-case-map,网页版为 /docs/usecase)的来源摘要:官方把 Jev 的用法归纳为五大类、19 个行业用例与10 种判断形态。文末另附官方评测站 evals.typesafe.ai 上的 workflow evals 方法论(以最强模型为参考概率的评测方式)。原始语料见 processed/jev-原始资料/官方-网页/o03-docs-usecase.txt 与 官方-文档/concepts__use-case-map.md。
一句话摘要
官方给的不是「能干什么」的宣传清单,而是一张头脑风暴地图:按行业打开最接近的一栏、扫一遍示例决策、再改写成自己工作流里的文档与动作;其底层只有 10 种判断形态,全部服务于一个前提——代码掌握控制流,Jev 只做语义判断。
关键要点
一、官方划定的五大用例类别
官方原文(“Example use case categories”)逐条:
- AI 自动化软件(AI Automation Software):「把 AI 与可靠软件交错编排,使你能在无人副驾的情况下在后台跑一百万次。代码掌握控制流(而不是 markdown 文件),TypeSafe 处理语义决策与语言理解。」
- 实时应用(Real-time applications):「前沿智能跑在实时速度(150 ms)意味着 AI 能比人类感知更快地做决策。快到、聪明到足以被编程去打游戏,或嵌进 UI。」
- 大数据上的 AI Map Reduce(AI Map Reduce over Big Data):「便宜 100 倍意味着你能处理巨型数据集。在超大语料上搜相关信息、给巨型智能体轨迹分类、抽取特征以做预测。」
- 万能校验(Universal Verification):「校验任意其他 AI 的输入提示、抽取结果、推理轨迹、工具调用或输入。检测越狱、引用错误、幻觉、错误,或其他 AI/LLM 会犯的错误模式——成本只有那次实际 LLM 调用的一小部分。」
- 工程框架增强(Harness Engineering):「用 Jev 查询让你的**工程框架(Harness)**更聪明——模型路由、语义上下文检索、LLM 错误检测与护栏、光速级的推理轨迹分类,成本只是一小部分。」
二、全部行业用例(官方 19 个折叠项,逐条列出)
| # | 用例 | 官方列出的示例决策 |
|---|---|---|
| 1 | 搜索与检索(Search and retrieval) | 用语义搜索 / 打分 / 排序替代或补充 RAG 管线里的嵌入;给「查询—候选」相关性打分;用成对比较重排结果;对查询与候选做交叉编码(cross-encode)以提高精度;为下游 AI 工作流挑选有用上下文 |
| 2 | 科学发现(Scientific discovery) | 按纳入 / 排除标准筛论文做系统综述;按预设主题或类别给访谈转录、开放问卷、田野笔记打标签;核查被引段落是否支持文稿与生成摘要中的论断;标记缺失的方法学细节(对照组、数据集描述、实验设置);跨论文识别实体与关系以构建研究知识图谱 |
| 3 | 模型路由(Model routing) | 构建自定路由,决定每个提示交给哪个 LLM;为具体工作流设定路由规则与阈值;分类意图与领域;估计难度与风险;把需要更贵模型的请求升级出去 |
| 4 | LLM 护栏(LLM guardrails) | 在每一次 LLM 的输入、输出、工具调用上做语义检查,成本只是 LLM 调用的一小部分;检测越狱与提示注入;识别政策违规与敏感数据暴露;实时检测工具调用错误与回复质量失败;把结构化检查结果与概率记录下来,让 AI 系统与框架故障更容易追查 |
| 5 | 语义代码检查(Semantic code linting) | 给代码与写作加自动化的语义 lint;为团队的编码规范与写作准则定义检查;在 CI 里跑这些检查并标出违规供复核 |
| 6 | 预测建模的特征抽取(Feature extraction for predictive modeling) | 从自然语言数据里抽概率化特征;与结构化数据合并,去训练有真值结果的模型;用 autoresearch 工作流提出特征定义、并对着留出真值评估其预测价值 |
| 7 | 招聘(Recruiting) | 按明确的、与岗位相关的标准评估简历、申请与面试反馈;识别相关经验;为所需能力打分取证;把候选匹配到岗位;把候选路由给招聘经理或招聘专员;把不确定的案例升级给人工复核 |
| 8 | 线索生成(Lead generation) | 把公司简介、高管履历、来信匹配到理想客户画像;给行业契合度与公司成熟度打分;检测买家相关性、痛点与购买意图;给线索排优先级并路由 |
| 9 | 客户支持(Customer support) | 按问题、产品领域与客户意图给来信工单分类;处理通话转录,抽取客户问题、承诺事项与后续动作;检测紧迫性、挫败感、流失风险与退款请求;把案例路由给正确的团队、队列或自动化工作流;对照政策与客户请求校验支持回复 |
| 10 | 保险理赔(Insurance claims) | 给初次损失通知(FNOL)、理赔员笔记与支持性文档分类;检测理赔复杂度、缺失信息与潜在欺诈指标;为「直通处理」或专家复核排优先级;把不确定或高风险案例升级给人工理赔员 |
| 11 | 金融犯罪(Financial crime) | 就可疑特征评估交易叙述、KYC 文档与告警历史;在不一致的姓名、档案与记录之间匹配实体;按风险、相关性与证据质量给告警排优先级;把含糊案例路由给调查员复核 |
| 12 | 法律与合规(Legal and compliance) | 给合同、政策、监管申报与营销声明分类;检测缺失条款、禁止性声明与政策违规;对照明确的法律或合规要求校验文档;把高风险或不确定的发现升级给法务或合规团队 |
| 13 | 电商市场(E-commerce marketplaces) | 在不一致的卖家目录间给商品列表分类与归一;从标题与描述里抽取商品属性;检测违禁上架、仿冒信号、评论滥用与政策违规;给商品排序并把不确定的上架路由给人工复核 |
| 14 | 内容审核与信任安全(Moderation and trust and safety) | 用公司特有、细颗粒度的标准判定哪些帖子达到你的审核线;对社区、客户支持与 SDR 工作流中的用户内容与自动对话做审核;检测毒性、骚扰、垃圾信息、欺诈、不安全建议、个人数据暴露、退出(opt-out)请求与违规声明;把严重度与置信度结合,去「放行 / 警告 / 复核 / 封禁」内容 |
| 15 | 广告(Advertising) | 评估创意素材、广告文案、落地页与投放上下文;分类品牌安全与受众适配度;检查监管合规与禁止性声明;评估创意质量与广告—落地页一致性 |
| 16 | 游戏(Gaming) | 评估玩家举报、游戏内聊天、评论与支持对话;审核聊天并检测滥用、毒性或可疑行为;给内容做标注、给挫败感或投入度打分;检测流失信号并路由玩家支持请求 |
| 17 | 风险评估(Risk assessment) | 把事件报告、理赔笔记、交易描述、供应商评估转成概率化风险指标;在保险与核保工作流里使用这些指标;分类风险类型并检测可疑特征;给严重度打分并排定复核优先级;为更广的风险模型抽取特征 |
| 18 | 需求预测(Demand forecasting) | 用来自客户问询、销售笔记、商品评论、支持工单与市场报告的语义信号丰富预测模型;抽取购买意图、紧迫性与产品兴趣;检测供应担忧、竞争压力与新兴需求主题;把这些特征与历史时序数据一起喂给预测模型 |
| 19 | 图谱与知识图谱(Graphs and knowledge graphs) | 用带类型的语义决策为知识图谱做标注与校验;分类关系与实体类型;检测记录或主张之间的矛盾;支撑概率化遍历与层级分类 |
三、10 种判断形态(Decision shape)官方表
官方原表(“Example task categories”)逐行:
| 判断形态 | 什么时候用它 | 示例 |
|---|---|---|
| Classification(分类) | 有一个已知类别应当胜出 | 意图、主题、部门、风险类型、实体类型 |
| Detection(检测) | 你需要「某一个属性是否存在」的概率 | 垃圾信息、欺诈、紧迫性、越狱、敏感数据 |
| Scoring(打分) | 答案落在一条有序的量表上 | 严重度、相关性、质量、挫败感、适配度 |
| Routing(路由) | 某个类别决定下一条代码路径 | 工具使用、升级、模型路由、支持队列 |
| Search(搜索) | 需要找出匹配自然语言查询的条目 | 语义搜索、文档发现、候选生成 |
| Retrieval(检索) | 工作流需要最相关的上下文或记录 | RAG 上下文、证据检索、知识查找 |
| Ranking(排序) | 条目需要按语义相关性或质量排序 | 搜索结果、推荐、候选排优先级 |
| Verification(校验) | 某个产物必须针对特定失败模式被检查 | 引用支撑度、政策违规、工具调用错误、回复质量 |
| ML Feature Extraction(机器学习特征抽取) | 下游的传统机器学习模型需要语义信号 | 购买意图、产品兴趣、竞争压力、流失信号 |
| Structured Data Extraction(结构化数据抽取) | 已知字段需要从非结构化输入中被找回 | 候选属性、订单字段、文档标签 |
四、附:官方评测站 evals.typesafe.ai 的 workflow evals 方法
官方博客(Introducing System One Models & Jev)说明评测站的方法论,要点如下:
- 评测目标变了:不是量「模型在某个基准上的分类正确率」,而是「AI 嵌在代码里工作得有多好」。官方称这是一种新的评测类型。
- 不许改动:不优化 ground truth 分类,也不允许工程框架(Harness)与模型发生变化——官方的理由是这样会「通过**工程框架调优(harness engineering)**造成过拟合」。
- 以工作流为参照:假定存在一张正确的计算图(compute graph),即用代码写成的 workflow;用最大、最聪明、最贵的外部模型的预测作为参考概率(reference probabilities)。
- 同一工作流、公平对比:官方原话是「每个模型拿到同一个 workflow」,检验各模型与最聪明模型们的平均值有多接近(此处用的是 Astra 与 Fable 的平均)。
- 结果:官方称 「Jev is off the charts – owning the Pareto frontier for almost 2 orders of magnitude.」(Jev 冲出了图表——霸占帕累托前沿近两个数量级)。
- 对照组:也对比了「用一个生成式提示、把所有逻辑都放在思维链里做」的模型,官方称这种做显著更差。
- 代表生产负载:评测站里的调用比并排演示复杂得多,因为它们更能代表真正做业务自动化所需的生产负载;官方称 4 条 workflow 中「最简单的一条」展示在博客里。
- 官方总结的规律:最可靠的真实工作流,往往包含许多独立、被拆解的问题,其细颗粒度行为取决于「概率」而非「离散决策」;最终结果当然是离散分支,但「如何抵达最终答案」涉及大量必须高度一致执行的领域工程。
- 数值出处:官网首页的 193.6x faster / 444.6x cheaper 就来自这里,官方自认这属于真实世界增益的高位。
- 完整材料(示例、分歧、完整查询、每条 workflow)见官方评测站 evals.typesafe.ai。
重要引用
“Interleave AI with reliable software in a way where you can run it a million times in the background without a human co-pilot. Code owns control flow (not markdown files) while TypeSafe handles the semantic decisions and language understanding.”
把 AI 与可靠软件交错编排,使你能在无人副驾的情况下在后台跑一百万次。代码掌握控制流(而不是 markdown 文件),TypeSafe 处理语义决策与语言理解。
“Frontier intelligence at real-time speeds (150ms) means AI can make decisions faster than human perception.”
前沿智能跑在实时速度(150 ms),意味着 AI 能比人类感知更快地做决策。
“Verify the input prompt, extractions, reasoning traces, tool calls, or inputs of any other AI… at a fraction of the cost for the actual LLM call.”
校验任意其他 AI 的输入提示、抽取结果、推理轨迹、工具调用或输入……成本只有那次实际 LLM 调用的一小部分。
“We don’t optimize for a ground truth classification or allow the harness and model to change (potentially allowing for overfitting via harness engineering).”
我们不优化 ground truth 分类,也不允许工程框架与模型发生变化(否则可能通过工程框架调优造成过拟合)。
“The most reliable real-world workflows tend to have many independent, decomposed questions, with fine-grained behavior that’s dependent on probabilities instead of discrete decisions.”
最可靠的真实工作流,往往包含许多独立、被拆解的问题,其细颗粒度行为取决于概率而非离散决策。
相关页面
- Jev 知识——面向非技术读者的全貌综合页(第 3 部分即本页五大类的通俗版)
- Jev官方文档、TypeSafe发布博客SystemOne与Jev、Jev官方缺陷清单jaggedness
- Harness工程、Agent、上下文腐坏