Jev是一款由TypeSafe AI于2026年9月推出的AI 结构化决策模型,也是该公司首个 System One 模型,主要用于让软件与智能体直接获得类型化的判断结果,支持 Choice、Score、Noul 三类问题与经过校准的概率输出,适用于工具路由、工单分诊、内容审核与自动化质检等方向。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | AI 结构化决策模型(System One) |
| 出品方 | TypeSafe AI(美国) |
| 发布时间 | 2026年9月15日(开放早期访问) |
| 当前版本 | Jev 1.13(jev-1.13.0) |
| 接入方式 | HTTP API+Python/JS SDK |
| 问题类型 | Choice/Score/Noul 三类 |
| 上下文窗口 | 64k tokens/请求 |
| 计费方式 | 按输入 token 计费 |

Jev 的核心能力
Jev 的定位是把「机器可读的判断」从文本生成中独立出来:当一段代码需要的只是一个类别、一个分值或一个概率,而不是一段说明文字时,它可以直接给出类型化结果,省去生成与解析两道开销。
以类型化输出替代文本生成
大语言模型面向人类可读文本设计,软件消费其输出时往往要把生成的文本再解析成结构化数据。Jev 不生成自由文本,而是直接对输入状态打分并输出类型化结果,调用方拿到的是可直接使用的取值与概率分布,可据此分支、排序或路由,也不存在格式漂移与字段越界。在需要频繁做小幅判断的场景中,AI 智能体 的每一步执行都能借此省去一次完整的文本生成。
三种问题类型与校准概率
Jev 把判断拆成三类问题。Choice 在预设选项中选出一项并给出各自的概率,单项选项上限为 255;Score 依据评分标准对状态打出分值;Noul 则回答一个命题是否为真,返回 0 到 1 之间的概率。Choice 与 Score 同时返回置信度,调用方可据此决定直接采信、继续追问或转交人工。所有概率均经过校准,模型给出 0.9 把握时正确率应接近九成。
单次请求的并行评估
一次请求只提交一份状态,可附带多个相互独立的问题,模型对这些问题并行评估,而不是逐个生成答案。官方称增加问题几乎不改变响应时间,问题之间也不会相互干扰。代码因此可以把一个大判断拆解成若干原子问题,再在程序侧按自己的权重合并结果,既保持单项判断的可靠性,又避免把多个因素糅进同一次推理。这种拆分为原子问题、再用代码合并的思路,也是当前 AI 模型 面向工程化落地的一个方向。
面向校准决策的训练方法
Jev 不用客户数据做微调或 LoRA 适配,而是采用名为 RLCD(面向校准决策的强化学习)的方法训练,目标是让模型给出的概率与实际命中率吻合,而不是迎合人类对文字表达的偏好。相同权重服务所有账户,使用者通过请求中的状态、指令与判定标准把模型导向自己的领域。
统一接口与输入计费
Jev 通过统一的 HTTP 接口提供,模型字段用于选择具体版本,官方同时提供 Python 与 JavaScript 客户端,并在触发速率限制时按退避策略重试,便于直接接入现有服务。
Jev 与同类决策模型的对比
决策模型是 2026 年 9 月起快速成型的一类模型路线,Jev 之后相继有多款决策模型入场。下表从开发方、发布时间、架构特点、开源情况、输入模态、响应延迟、公开评测与获取方式八个维度进行对照。
| 对比维度 | Jev 1.13 | Cloudflare Clef | AWS Strands Decider 2B | StartLux-Decision 27B |
|---|---|---|---|---|
| 开发方 | TypeSafe AI(美国) | Cloudflare(美国) | AWS(美国) | 原点星辉 StartLux(上海) |
| 发布/开放时间 | 2026年9月15日(早期访问) | 2026年10月1日 | 2026年10月1日 | 2026年9月30日 |
| 架构特点 | 跳过自回归解码,直接对隐状态打分 | 非自回归、仅预填充打分 | Qwen3.5-2B 底座+指针打分头 | 自研,0.8B 至 27B 多档 |
| 开源与许可 | 闭源,仅提供托管 API | Apache 2.0(权重开放) | Apache 2.0(权重+训练代码) | Apache 2.0(含量化版) |
| 输入模态 | 仅文本 | 文本+图像 | 仅文本 | 仅文本 |
| 响应延迟 | 官方 70–500 ms | 中位 209.3 ms | RTX 3090 中位 106 ms | 4B 版单卡 H200 约 26 ms |
| 公开评测 | Decision Index 57.91 | Decision Index 61.2 | JevBench 准确率 72.3%(2B 档) | Decision Index 63.88 |
| 获取方式 | 按输入 token 计费,输出免费 | Workers AI 托管,权重可自部署 | 无托管 API,本地部署 | 开源权重,本地或量化部署 |
上表数据分列署名:Jev 一列取自 TypeSafe AI 官方文档与公开评测,Cloudflare Clef 一列取自 Cloudflare 官方博客,AWS Strands Decider 2B 一列取自 AWS Strands Labs 的官方发布,StartLux-Decision 一列取自原点星辉的公开材料。各家评测口径与测试条件并不统一,横向比较应以各自官方公布的指标与版本为准。选型上,需要图像或网页内容参与判断的场景可关注具备视觉能力的方案;预算敏感、具备自部署条件的团队可评估开源权重方案;对延迟与成本同时敏感的高频路由任务,则更适合按输入计费、输出免费的托管接口。
如果想了解决策模型在上层智能体产品中的实际形态,可以参考 Manus(通用 AI 智能体代表产品,擅长自主拆解并执行多步任务,与 Jev 所处的智能体执行链路直接衔接)。
Jev 的应用场景与适用人群
Jev 面向需要频繁做出小幅、可枚举判断的自动化环节,常见场景包括:
- 工具路由:智能体在每一步从候选工具中选择下一个动作,由模型给出各选项的概率与置信度。
- 工单分诊:判断客户消息的紧急程度与归属团队,依据概率阈值直接分流或转交人工。
- 内容审核:对文本是否命中某类违规命题做是非判断,输出 0 到 1 的概率供阈值决策。
- 数据质检:对结构化记录按评分标准逐项打分,替代人工抽检中的重复判断。
适用人群:构建智能体与自动化流程的开发者、需要批量处理分类与路由任务的工程与运营团队,以及希望在低延迟、低成本前提下引入模型判断的数据团队。对判定边界模糊的场景,建议先用少量标注数据验证校准表现,再确定自动处理与人工复核的阈值。
Jev 的使用方法
从申请访问到接入生产,可按以下步骤开始:
- 获取访问:通过 Jev 官网 申请早期访问,创建账户并获取 API Key。
- 准备状态:把需要判断的材料整理为文本形式的
state,非文本输入先转为文本或结构化字段。 - 定义问题:按需求选择 Choice、Score 或 Noul,在
instructions与criteria中写明判定标准。 - 发起调用:向
POST /v1/systemone提交状态与问题,模型字段可填jev-latest或具体版本号。 - 处理结果:依据返回的取值、概率与置信度在代码中分支,并按置信度阈值决定是否转交人工。
- 接入平台:借助官方提供的 Python 或 JavaScript SDK 接入现有流程,也可参考 Coze 一类的智能体开发平台组织多步任务。
落地时建议先以只读方式验证判断质量,用一小批样本测算命中率与校准偏差,再逐步放开写操作与自动执行,并对高影响动作保留人工确认与回滚机制。
Jev 的价格方案
Jev 按输入 token 计费,输出 token 免费,官方定价为每百万输入 token 0.042 美元(约合每十亿输入 token 42 美元)。成本因此只与送入模型的状态规模相关,多问几个问题不会带来额外费用,适合把大量轻量判断集中在一次请求中。Jev 为闭源模型,不提供权重下载,只能通过官方托管接口调用;企业客户可与官方沟通更高的速率限制与定制方案。对高频调用场景,建议先用真实状态样本估算 token 规模,再确定单次请求承载的问题数量。
Jev 的常见问题
Jev 和普通大语言模型有什么区别?
普通大语言模型通过生成文本作答,Jev 不生成自由文本,而是直接输出类型化的判断与概率,调用方无需解析即可使用,更适合需要大量小幅、可枚举判断的自动化场景。
Jev 支持哪些问题类型?
Jev 提供 Choice、Score 与 Noul 三类问题:Choice 从预设选项中选择并给出概率,Score 按标准打分,Noul 判断命题是否为真并返回 0 到 1 的概率,三类问题可以在一次请求中混合使用。
Jev 如何收费?
Jev 按输入 token 计费,输出 token 免费,官方定价为每百万输入 token 0.042 美元;模型为闭源,仅通过官方托管接口调用,企业客户可另行沟通速率限制与定制方案。

浙公网安备33010202004812号