跳到主要内容

Jev:用于分类、评分和自动化判断的 AI 模型

一篇文章已经有了摘要,接下来要决定它是否值得现在读;一张工单已经收进系统,接下来要决定交给哪个团队。这些问题需要理解语言,答案却可能只有几个选项。软件真正需要的是一个能用于排序或分流的判断。

Jev 就面向这类工作。它由 TypeSafe AI 推出,接收待判断的信息和事先定义的问题,返回选项、评分或概率,供程序继续处理。它不生成摘要、解释或代码,适合成为现有软件中的一个判断环节。

这篇文章介绍截至 2026 年 9 月 18 日的 Jev:怎样向它提问,怎样读懂结果,速度和成本有什么依据,以及在实际应用中应把哪些事情留给普通代码或人。

System One 指什么

TypeSafe 在 2026 年 9 月公开 Jev,把这一类模型称为 System One。名称借用了卡尼曼对快速直觉与缓慢推理的区分;Jev 则得名于经济学家 William Stanley Jevons。厂商希望,更便宜的判断能力能让更多自动化场景变得划算。发布说明同时介绍了并行采样与面向决策的训练方向。

“System One”在这里是产品及研究路线的名称。理解它时,可以先看任务形状:给出充分背景,让模型回答一个范围明确、能够迅速作出的判断。如果任务要求调查陌生问题、规划很长的行动链或写出完整论证,就需要另外组织检索、推理和生成过程。

TypeSafe 将训练方法称为 RLCD,即“面向校准决策的强化学习”。按其技术入门说明,训练目标是让决策附带可用的概率信息。公开材料说明了这一目标,但还不足以复现完整训练过程;本文不据此推测参数规模或内部网络结构。

一次判断需要提供什么

可以把请求理解为两部分:材料问题。接口分别称它们为 statequestions。前者放模型需要看到的信息,后者说明要判断什么、允许哪些答案。同一次请求可以包含多个问题,它们共享材料、独立评估。问题定义说明了这一组织方式。若后一个问题必须使用前一个答案,就需要由程序分步衔接。

以阅读推荐为例,材料可以是一段摘要加上读者当前关心的主题。问题则是“这份内容现在值得读吗”,并把答案规定为:

  • 现在读:直接帮助解决当前问题。
  • 留着:有背景价值,但当前不急。
  • 跳过:与当前关注点无关。
  • 拿不准:信息不足,无法作出可靠判断。

这些选项需要写清楚。“留着”和“现在读”如果都只解释成“有用”,模型就难以区分;缺少“拿不准”,也容易把信息不足挤进其他分类。

模型只能根据收到的材料判断。送进去的是标题,结论就只能针对标题;送进去的是摘要,它也没有因此读过全文。网页获取、字幕提取以及摘要是否忠实,仍由提供材料的程序负责。

三种输出,分别适合什么问题

类型回答什么结果怎样使用
Choice从事先列出的选项中选一个,最多 255 项返回选择、各选项概率及 confidence;适合分类与分流
Score在 2–10 个有顺序、带描述的等级中评分返回等级位置、分布及 confidence;适合按明确标准排序
Noul某个命题是否成立返回“是”的概率;适合判断条件是否满足

Score 的数值来自等级位置的概率加权。比如自定义“无关、背景相关、直接相关”三个等级后,小数表示模型在等级之间的判断位置。它没有天然的百分制含义,换一套等级描述,数值也就换了意义。

Noul 的低概率同样可能很有用。“材料是否缺少正文”得到 0.02,表达的是模型倾向认为正文并不缺少。把这个数理解成“模型只有 2% 的把握”,就把命题的概率和判断的不确定性混在了一起。

普通聊天中的“帮我打个分”通常省略了这些定义。Jev 要求应用先把评分标准写出来,这也迫使开发者回答一个更实际的问题:到底准备根据这个分数做什么?

概率、confidence 和正确率

一个 Choice 可以给“现在读”0.51、“留着”0.49;也可以给两者 0.97 和 0.03。两次的首选相同,但前一次几乎没有明显优势。只保留最终分类,就丢掉了这层区别。

TypeSafe 的 confidence 是根据 Choice 或 Score 的完整概率分布计算出的 0–1 统计量,用来概括分布的集中程度。它不是第二次独立判断,也不等于最高选项的概率。Noul 不另带这个字段。

因此,同时看到一个高概率和一个高 confidence,并没有得到两份相互独立的证据。它们描述的是同一个输出分布。显示到很多位小数,也不会增加事实依据。

“概率经过校准”则需要从许多有已知结果的预测来理解。例如,一批预测都给某事件约八成概率,良好校准意味着这批事件最终发生的比例也接近八成。单次输出无法证明这种性质。

阅读工具可以先把模型建议与人工选择并排保留,观察哪些材料容易被错分,再决定什么程度的明确性足以让它调整阅读顺序。误把值得读的材料排后面,与自动删除材料的后果不同;两种动作没有理由共用一个阈值。

同样,最高概率低于某个值时显示“拿不准”,只是应用设置的一条规则。阈值需要用实际材料来调,不能因为模型提供了概率,就把随手选的数字当成经过验证的标准。

“零幻觉”应当怎样理解

预先规定答案空间,能消除一类麻烦:程序要求返回某个现成选项,模型不能另外编造一篇回答。这让接口更容易检查,也让错误更容易定位。

但类型正确的答案仍然可以选错。一个分类器完全可能按照合法格式,把一封投诉分给错误的团队。格式约束解决了“结果是否符合接口”,业务还要判断“这个结果是否合理”。这也是工具契约与任务正确性的区别。

TypeSafe 自己的 Jev 1.13 已知弱点列出了数值、计数、日期比较、多跳理解、无关长上下文及对抗文本等问题;分别提问时,正反命题也不保证满足预想的概率恒等关系。

这直接影响使用方式。金额比较交给代码,正文相关性可以交给模型;读者提供的一句话不能变成模型改写分类规则的授权;需要解释一个结果时,也应回到输入证据,不能让另一个模型随意补出一段貌似合理的原因。

速度宣传背后的实验

TypeSafe 首页展示过快 193.6 倍、便宜 444.6 倍的对比。这样的数字需要和任务、对照方式一起看,不能直接换算成每个应用都会获得的收益。

工作流评估覆盖安全事件、智能体执行记录、发票和客服四类任务,等权汇总;参考答案来自 GPT-6 Astra 与 Claude Fable 5.1 的高推理配置所给判断的平均值。这属于厂商设计、以其他模型为参照的比较。

它能支持一个值得测试的方向:把复杂任务拆成明确判断,再由代码组合,可能比每一步都生成长篇回答更合适。但模型共识不自动成为现实真值;参考模型有共同偏差时,接近它们的答案也可能沿用相同偏差。

实际延迟还受网络距离、输入长度、网关、并发和客户端处理影响。对个人工具来说,最有意义的测量是点击后等多久;对批量系统来说,还要看持续处理能力、失败比例,以及那些最慢请求会让后续工作等多久。

价格、输入容量和中文能力

查询当日,Vercel 的公开模型目录给 Jev 的精确输入价格为每百万 token 0.042 美元,输出价格为零。模型展示页把输入价简写为 0.04 美元。Token 是模型处理文本的计量单位,不能直接当作汉字数。

一个纯算术例子:假设一万次请求实际合计使用两千万输入 token,按上述单价,模型输入费约为 0.84 美元。这只计算模型用量;额外请求、更长材料、基础设施和人工处理都会改变实际成本。便宜的单次判断,也可能因为调用数量很大而变成一笔持续开支。

TypeSafe 当前模型说明列出以下边界:

项目截至本文核对日的说明
原生版本jev-1.13.0
输入形式文本、JSON 对象或文本数组;不直接接收图像、音频、视频
单次容量总请求 64k tokens;state 加最长问题不超过 32k
语言英语是主要训练语言;中文等语言可以输入,但效果不与英语等同

有了足够大的窗口,也应只送判断所需的内容。冗长会议记录里夹着一句关键要求时,先定位相关段落往往比把所有内容都交给模型更便于检查。

中文使用尤其需要本地样本。它能读入中文、能给出看似合理的选项,只能说明接口和某个例子跑通。行业缩写、反讽、双重否定和缺省背景,都应出现在真正的验证材料里。

怎样接入现有软件

直连 TypeSafe 与通过网关访问,是两种不同的接入路径。下面讨论这次实际使用的 Vercel AI Gateway evaluation 接口:它要求 AI SDK 7,模型名为 typesafe-ai/jev,使用 experimental_evaluate。它不属于聊天生成接口,不能只替换聊天模型名称就期待相同的调用方式。

接口中可以定义 choicescoreboolean 问题;其中 boolean 用于表达是非判断。AI SDK 的 evaluation 文档提供了完整契约。通过 Gateway 读取 TypeSafe 的附加置信度时,位置是 providerMetadata.typesafe.confidence,应与 answers 中的概率分布区分。这个 API 仍带有实验性标记,升级依赖时应重新核对行为。

下面用一个虚构的阅读场景展示请求结构。密钥通过服务器环境中的 AI_GATEWAY_API_KEY 提供,示例开启禁止训练选项:

import { experimental_evaluate as evaluate } from 'ai';

const result = await evaluate({
model: 'typesafe-ai/jev',
state: {
interest: 'Local speech tools and privacy',
excerpt: 'A fictional offline speech tool caches audio locally.',
},
questions: {
reading: {
type: 'choice',
instructions: 'How relevant is this excerpt to the current interest?',
criteria: {
read: 'Directly useful now',
keep: 'Useful background for later',
skip: 'Unrelated',
unsure: 'Not enough information',
},
},
},
maxRetries: 0,
providerOptions: {
gateway: { disallowPromptTraining: true },
},
});

console.log(result.answers.reading);

应用拿到 reading 的答案后,可以直接显示建议,或者按概率调整阅读顺序。分类标准仍然是程序提供的;换一组关注主题,同一份材料就可能得到不同的结果。

禁止训练与零数据保留是两回事

网关、模型供应商和应用自身,都可能处理同一次请求。讨论隐私时,要分清具体要求落在哪一层。

Vercel 的 disallowPromptTraining要求请求只走满足禁止训练条件的供应商路由,面向所有套餐提供。它不承诺内容完全不被保留;自行提供供应商密钥的 BYOK 请求还有单独的适用规则。

zeroDataRetention进一步要求供应商零数据保留。目前 Vercel 的请求级 ZDR 面向 Pro 和 Enterprise 团队。模型存在于公开目录中,并不说明一个账号可以启用所有隐私选项。

把 Jev 用在阅读判断上

这次试用选了一段虚构的中文工具介绍,再给出与它相关的阅读主题,把输出限定为“现在读、留着、跳过、拿不准”。通过 Gateway 的普通模式发送后,Jev 选择“现在读”,给出的概率为 1.0。该次请求约 0.8 秒完成,包含网关调用和结果处理。

这个样例的主题很明确,结果符合预期。更直观的收获是看到了它在软件中的位置:材料交进去,一个带概率的选择出来,界面可以直接使用,无须从一大段解释中再提取分类。

接下来更值得观察的是那些难选的情况。主题相关但内容空泛,应该“现在读”还是“留着”?只有一个醒目的标题,能否稳当地选“拿不准”?可以用这些情形构造一组样例,再对照人工选择。中文判断是否稳定、概率是否有参考价值,需要从这样的比较中逐步看出来。

什么情况下值得采用

面前的问题优先考虑的办法
条件能够精确写成计算或规则普通代码,结果可重复且便于验证
需要从大量内容中找到候选材料搜索或检索,先缩小范围
材料已给出,需要按明确标准分类、评分或分流把 Jev 作为候选,用自己的样本比较
需要生成解释、文章、代码,或开展开放式调查生成式模型与相应工具

一个合适的起点,是从已有系统里选出一项高频、边界清楚、出错后可纠正的判断。先看它能否稳定减少人工处理,再决定是否扩大使用。与其让模型一句话决定整个工作流,不如把可以精确计算的部分留在程序里,让语言理解只承担确实需要它的那一步。

这种分工可以与智能体循环结合,也能帮助理解模型选择:选择模型时,输出要交给谁、错误会造成什么后果,往往比“它是不是最强模型”更能决定它是否适合这项工作。

探索关联打开关联网络