目录
2446 字
12 分钟
JEV 模型是什么:一个「不说话」、只输出带概率决策的 AI

引言:一个「不会说话」的模型,为什么火了#

2026 年 9 月 15 日,旧金山初创公司 TypeSafe AI 发布了旗下第一个模型 JEV(官方写法多为「Jev」)。

它最反直觉的地方在于:它不生成任何文本。你不能用它写文章、写代码、聊天,甚至问它「为什么」它也不回答。你给它一段材料,再列出一组问题(以及候选答案),它唯一做的事就是——做判断:选哪个、打多少分、把握有多大。

就是这么个「不爱说话」的模型,发布第二天就被 Vercel 接入了 AI Gateway,24 小时内覆盖了其付费团队近 13% 的调用量;随后 Netlify、LangChain、Cloudflare Workers AI、Langfuse 也陆续跟进集成。硅谷一度把它当作「AI 新赛道」来讨论。

而真正让它出圈的,是它的作者:Diogo Almeida——Google Brain 出身、在 OpenAI 深度参与了 InstructGPT、ChatGPT 和 GPT-4 的研发,也是 RLHF(基于人类反馈的强化学习)的共同发明人之一。一个亲手把「让模型好好说话」这件事做成范式的人,如今反过来推出一个「拒绝说话」的模型,这件事本身就值得一读。

名字里的两个梗#

理解 JEV 的定位,先看它的两个命名:

  • Jev 取自杰文斯悖论(Jevons Paradox):某项技术效率的提升,反而会让它的总需求量变大。放在这里,暗示的是「判断这件事太贵、太慢,以至于大家不敢多问;一旦变便宜变快,判断会被用得比现在多得多」。
  • System One Model 取自卡尼曼《思考,快与慢》里的**「系统 1」**——直觉式的、快速的、几乎无意识的判断。TypeSafe 官方给 JEV 的定位就是:一个面向「快思考」的模型。

官方对它的定义只有一句话,却很准:

前沿智能的函数调用(a frontier-intelligence function call):非结构化状态进,类型化的概率决策出。

也就是说,它把「智能」包装成一个有明确签名的函数,而不是一个对话框。

三种输出原语:Choice、Score、Noul#

JEV 的 API 极简——一整个请求里,你只能提三类问题,官方称之为输出原语(primitives):

原语你在问什么它返回什么
Choice从一组选项里挑一个(最多 255 个)每个选项的概率分布 + 最终选择
Score在某个有序等级或数值区间上打分一个连续数值 + 置信度
Noul一个预设的是非问题一个 0~1 之间的概率

「Noul」这个词本身就是一个小细节:它是 Number + boolean 的拼合,强调「不是硬 0/1,而是一个校准过的概率」。

举个客服场景的例子——把一段用户投诉丢进去,一次性问三类问题:

from jev import Jev
client = Jev(api_key="...")
decision = client.decide(
state=ticket_text,
questions={
"urgency": {"type": "score", "scale": [0, 4]},
"category": {"type": "choice", "options": ["账单", "故障", "咨询", "投诉"]},
"need_human": {"type": "noul"},
},
)

返回的结果大致是这样:

{
"urgency": { "value": 3.0, "confidence": 0.91 },
"category": { "choice": "故障", "distribution": { "账单": 0.02, "故障": 0.88, "咨询": 0.07, "投诉": 0.03 }, "confidence": 0.88 },
"need_human": { "probability": 0.62, "confidence": 0.79 },
"latency_ms": 118,
"model": "jev-1.13.0"
}

注意几点:

  1. 输出是「类型化」的。category 只可能是你给的 4 个选项之一,urgency 一定落在 0~4。这也是官方宣称「不会产生幻觉」的技术含义——见后文对这句话的辨析。
  2. 每个判断都带概率/置信度,调用方代码可以据此设阈值:比如 need_human > 0.5 就转人工。
  3. 一个问题请求里的所有问题是一次性并行算出来的(下一节展开),所以多问几个问题几乎不增加延迟。

技术原理:为什么不逐字生成,反而更快#

传统大模型是自回归的:一个 token 一个 token 往外吐,输出越长越慢。JEV 走的是完全不同的路子:

  • 输出空间是预先定义的。你的问题里已经给了所有可能答案(选项集、评分区间、是/否),模型不需要「逐字造句」,而可以在一次前向传播里并行采样出所有问题的全部答案。这就是它「多加问题也不怎么变慢」的原因。
  • 训练方法叫 RLCD——Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习),被明确拿来对标 RLHF 与 RLVR。
    • RLHF 奖励的是「人类觉得这个回答好」;
    • RLCD 奖励的是「你说的概率和实际命中率对得上」。

第二点是 JEV 最核心、也最容易被忽略的主张:它优化的是校准(calibration),而不是讨人喜欢。用官方的话说——如果它说 70% 或 95%,那这件事就应该恰好以 70% 或 95% 的频率发生。对需要拿去写进 if 语句的决策来说,一个诚实校准过的概率,比一句漂亮的自然语言解释有用得多。

性能与价格:官方数字与「真实收益」#

指标官方数据
端到端延迟70 ~ 500 ms
输入价格$0.042 / 百万 token
输出价格免费
上下文窗口32,000 token
对比前沿大模型声称快 193.6 倍、便宜 444.6 倍

这里必须补一句 TypeSafe 自己都承认的注脚:193.6× / 444.6× 是「理论上限」,基准也是内部自评。第三方实测给出的更保守结论大致是:快约 2~3.6 倍、便宜约 4.7~7.5 倍。

即便如此,「输出免费」这件事本身很有信息量——它等于把定价模型从「按生成量计费」改成「按判断请求计费」,因为判断的 token 成本本来就不该随输出长度走。

准确性上,TypeSafe 自己的评测里 JEV 约为 67.8%——和 GPT-5.6 Terra 打平,但落后于 GPT-5.6 Sol 和 Claude Opus 5。它赢的不是准确率,而是每单位成本与延迟下的准确率。

JEV 和大模型,是替代还是互补?#

结论很清楚:互补,不是替代。它们对应的是两种不同的活儿:

维度生成式大模型JEV
输出自然语言 / 代码,长度不定类型化判断(选择 / 分数 / 概率)
典型任务写作、规划、推理、生成代码分类、路由、打分、审批、动作判定
延迟秒级毫秒级
可解释性能给出推理过程只给数字,不给理由
成本敏感度高极低

合理的分工是:大模型负责「想清楚要问什么」,JEV 负责「高频、廉价地把大量判断做完」。典型场景包括:

  • 内容审核 / 垃圾识别(Choice:多分类)
  • 工单路由与优先级(Score + Choice)
  • 智能体的动作判定(Agent 里「这一步该调哪个工具」——本质就是 Choice)
  • 用户流失风险、情绪强度打分(Score)
  • 风控里一连串的是非门(Noul)

争议与需要留意的地方#

热度之外,几个批评值得认真对待:

  1. 「零幻觉」是一种文字游戏。它真正的含义只是「JEV 不可能吐出选项之外的类型」,但它完全可能自信地选中一个错误的合法选项。类型安全 ≠ 判断正确。
  2. 没有可解释性。它只给数字,不给理由。对需要审计、需要向人解释的决策链来说,这是个硬伤——你无法像读 CoT 那样复盘它为什么这么选。
  3. 校准必须按工作流单独验证。RLCD 保证了「训练分布上」的校准,但你的业务数据分布未必在训练分布里。上线前应自己在真实样本上回归一遍它的置信度。
  4. 它有自己的「锯齿」。TypeSafe 文档里明确承认模型在计数、算术、日期比较上不可靠,并建议:数学运算留在代码里,别交给模型。
  5. 要锁定版本。官方建议把版本号写死(如 jev-1.13.0),因为概率输出会随版本漂移,而概率一旦漂移,你的阈值逻辑就跟着漂。

结语#

JEV 真正有意思的地方,不在于它比大模型「强」——按准确率它并没有赢。它有意思在于把「智能」重新定义了一次:不是会说话,而是会把不确定的世界,压缩成一个可以写进代码的、校准过的概率。

过去两年,我们习惯把 LLM 当成一个无所不能的对话框,然后费尽力气在它外面套护栏、做解析、写重试。JEV 反过来问了一句:那么多真实场景里,我们要的其实从来不是一段文字,而就是一个「选 A 还是选 B、把握有多大」的判断。把这类判断单独抽出来,做成一个又快又便宜、还带概率的函数调用——这个想法,比它当下的成绩单更值得记住。

至于它最终是「新范式」还是「高级分类器」,答案可能两者都不是:它更像我说的那种基础设施——你不会天天谈论它,但一旦用上,就会开始把它塞进每一个原本用大模型硬扛的分类任务里。


参考来源:

  1. InfoQ. “TypeSafe AI Releases Jev: a Decision-Only Model That Returns Typed Probabilities Instead of Text.” 2026-10. https://www.infoq.com/news/2026/10/typesafe-ai-jev-released/
  2. 机器之心 / 腾讯新闻. “ChatGPT 早期研究者做了一个『不会说话』的 AI,Jev 真是新范式吗?” 2026-09-18. https://news.qq.com/rain/a/20260918A058BW00
  3. 阿里云开发者社区. “JEV 模型最新研讨:只下判断不说话,低延时才是被低估的变量.” https://developer.aliyun.com/article/1765496
  4. 七牛云新闻. “爆火的 Jev 是什么:前 OpenAI 研究员做的『不说话』模型,只输出带概率的结构化决策.” https://news.qiniu.com/archives/1789895633449
  5. OntiCards Blog. “Why Jev Refuses to Chat: Inside System One Models.” https://www.step2.com.cn/en/blog/jev-system-one-decision-models
JEV 模型是什么:一个「不说话」、只输出带概率决策的 AI
https://www.hehonglei.cn/posts/jev-decision-model-introduction/
作者
Honglei He
发布于
2026-10-09
许可协议
CC BY-NC-SA 4.0