AB
AiBoss
project

Jev - TypeSafe AI 推出的 AI 结构化决策模型

Jev 是 TypeSafe AI推出的 AI 结构化决策模型。模型不会聊天、写代码或生成任何文字,只做一件事:高频决策,输入非结构化信息,经一次并行计算,瞬间输出带...

Jev是什么

Jev 是 TypeSafe AI 推出的 AI 结构化决策模型。模型不会聊天、写代码或生成任何文字,只做一件事,高频决策,输入非结构化信息,经一次并行计算,瞬间输出带校准概率的结构化判断。延迟仅 70–500 毫秒、输入 0.042 美元/百万 token、输出免费,类型错误率为 0%。模型定位 Agent 系统的前置反射弧,承担路由、分类、风控初筛、内容过滤等高频判断,让前沿大模型专注复杂推理,一个拥有世界知识的超级决策器。

Jev的主要功能

  • 结构化决策输出:模型只返回预定义类型内的 Choice(选择)、Score(评分)、Noul(布尔判断),并附带校准概率。
  • 并行多路判断:一次调用可同时回答多个独立问题,延迟不随问题数量线性增加。
  • 置信度分级路由:按校准置信度自动分流——高置信度直接执行,中置信度交大模型复核,低置信度转人工。
  • Agent 前置过滤层:承接路由、分类、验证、状态检查等高频小决策,把贵的大模型调用压缩 90% 以上。
  • 零格式错误保障:输出严格锁定在预设 Schema 内,类型错误率数学上为 0%,可直接嵌入代码流水线。
  • 毫秒级实时判断:70–500 毫秒响应、单次决策约 $0.0004,让 AI 第一次能进入游戏操作、实时内容过滤、交易决策等延迟敏感场景。

Jev的技术原理

  • 砍掉自回归,改并行采样:传统 LLM 逐 Token 顺序生成,输出越长解码步数越多;Jev 用自研 parallel sampler 在一次前向计算中同时产出所有判断结果,无需逐字解码。
  • 限制输出空间:开发者预先定义 Schema(如 refund_risk={low, medium, high}),模型只在这些选项内分配概率,自由度换效率,输出永远可解析、可直接被代码消费,从机制上消灭了格式幻觉和类型错误。
  • RLCD 训练法:Reinforcement Learning for Calibrated Decisions:RLHF 优化人类偏好,RLVR 优化可验证答案,RLCD 则优化「判断对不对」和「模型自称的置信度是否诚实」,当模型对一批任务都报 90% 把握时,其中应约 90% 真的正确,这是自动化分流的数学前提。
  • 置信度即接口:每个输出都附带校准概率,软件按阈值路由:>0.90 自动执行,0.7–0.9 交大模型复核,<0.7 转人工——把不确定性显式暴露给系统。

如何使用Jev

  • 申请 Early Access:访问 TypeSafe AI官网 https://typesafe.ai/,加入 waitlist,通过后在 console.typesafe.ai 获取 API key。
  • Playground 试玩:在 Console 的 Playground 里配置问题、定义输出 Schema,直观看到带概率的决策结果。
  • 定义 Schema:用 JSON 预先声明要判断的问题及类型(Choice/Score/Noul 及其选项),这是调用前唯一必需的准备工作。
  • 调用 API:向 https://api.typesafe.ai/v1/systemone 发送 POST 请求,模型 ID 填 jev-latest,输入非结构化内容,返回结构化判断和校准概率。
  • 使用官方 SDK:Python 装 typesafe-sdk,JS/TS 装 @typesafe-ai/sdk,自动处理请求构造和类型校验。

Jev的核心优势

  • 极致延迟:70–500 毫秒的端到端响应,比前沿大模型快 40–200 倍,首次让 AI 判断进入实时场景。
  • 极低成本:输入 0.042 美元/百万 token、输出免费,单次决策约 $0.0004,最高比 GPT 便宜 444 倍。
  • 零格式错误:输出严格锁定预设 Schema,类型错误率数学上为 0%。
  • 置信度可校准:每个判断附带诚实概率(RLCD 训练),系统可按阈值自动分流,这是自动化落地的数学前提。
  • 并行多路判断:一次调用同时回答多个独立问题,延迟不随问题数量线性增长。
  • 保留通用语义能力:相比传统分类器,零样本即可处理新任务,无需为每类判断重新训练。

Jev的项目地址

  • 项目官网:https://typesafe.ai/blog/introducing-system-one-models-and-jev

Jev的同类竞品对比

维度 Jev Qwen 3.7 Flash
技术路线 非生成式,并行采样一次产出决策 自回归 LLM,逐 Token 生成
输出形式 Choice/Score/Noul + 校准概率,Schema 强约束 自然语言/JSON,需 Constrained Decoding 兜底
类型错误率 0%(数学保证) 低但非零,格式仍可能跑偏
延迟 70–500 毫秒 快于大模型,但仍受生成长度影响
成本 输入 $0.042/百万 token,输出免费 约为 Jev 的一半( cheapest )
小任务准确率 高(预筛测试第二准) 与 DeepSeek Flash 相当,偏弱
大批量/并行任务 最优(准确率、速度、成本综合第一) 正确率掉约 7 个点,不堪大用
置信度校准 RLCD 训练,概率可直接用于自动化分流 即使提示也偏过度自信,难用于阈值路由
语义通用性 保留零样本判断能力 更强,可生成文本、处理开放任务

Jev的应用场景

  • 内容过滤与推荐预筛:实时折叠信息流中的引战、广告内容,或为上万条爬取信息做 AI 相关性预筛,只把精筛留给贵模型。
  • 工单路由与客服分流:一封邮件同时判断分派部门、紧急程度、退款风险和是否需要人工介入,高置信度工单直接自动处理。
  • 风控与合规初筛:对交易、信贷、UGC 内容做风险分级并输出概率,高置信度自动放行,低置信度转人工或强模型复核。
  • Agent 流水线决策层:承担工具选择、结果排序、状态检查、是否终止等高频小判断,把昂贵的大模型调用量压缩 90% 以上。