目录
引言:一个「不会说话」的模型,为什么火了
2026 年 9 月 15 日,旧金山初创公司 TypeSafe AI 发布了旗下第一个模型 JEV(官方写法多为「Jev」)。
它最反直觉的地方在于:它不生成任何文本。你不能用它写文章、写代码、聊天,甚至问它「为什么」它也不回答。你给它一段材料,再列出一组问题(以及候选答案),它唯一做的事就是——做判断:选哪个、打多少分、把握有多大。
就是这么个「不爱说话」的模型,发布第二天就被 Vercel 接入了 AI Gateway,24 小时内覆盖了其付费团队近 13% 的调用量;随后 Netlify、LangChain、Cloudflare Workers AI、Langfuse 也陆续跟进集成。硅谷一度把它当作「AI 新赛道」来讨论。
而真正让它出圈的,是它的作者:Diogo Almeida——Google Brain 出身、在 OpenAI 深度参与了 InstructGPT、ChatGPT 和 GPT-4 的研发,也是 RLHF(基于人类反馈的强化学习)的共同发明人之一。一个亲手把「让模型好好说话」这件事做成范式的人,如今反过来推出一个「拒绝说话」的模型,这件事本身就值得一读。
名字里的两个梗
理解 JEV 的定位,先看它的两个命名:
- Jev 取自杰文斯悖论(Jevons Paradox):某项技术效率的提升,反而会让它的总需求量变大。放在这里,暗示的是「判断这件事太贵、太慢,以至于大家不敢多问;一旦变便宜变快,判断会被用得比现在多得多」。
- System One Model 取自卡尼曼《思考,快与慢》里的**「系统 1」**——直觉式的、快速的、几乎无意识的判断。TypeSafe 官方给 JEV 的定位就是:一个面向「快思考」的模型。
官方对它的定义只有一句话,却很准:
前沿智能的函数调用(a frontier-intelligence function call):非结构化状态进,类型化的概率决策出。
也就是说,它把「智能」包装成一个有明确签名的函数,而不是一个对话框。
三种输出原语:Choice、Score、Noul
JEV 的 API 极简——一整个请求里,你只能提三类问题,官方称之为输出原语(primitives):
| 原语 | 你在问什么 | 它返回什么 |
|---|---|---|
| Choice | 从一组选项里挑一个(最多 255 个) | 每个选项的概率分布 + 最终选择 |
| Score | 在某个有序等级或数值区间上打分 | 一个连续数值 + 置信度 |
| Noul | 一个预设的是非问题 | 一个 0~1 之间的概率 |
「Noul」这个词本身就是一个小细节:它是 Number + boolean 的拼合,强调「不是硬 0/1,而是一个校准过的概率」。
举个客服场景的例子——把一段用户投诉丢进去,一次性问三类问题:
from jev import Jev
client = Jev(api_key="...")
decision = client.decide( state=ticket_text, questions={ "urgency": {"type": "score", "scale": [0, 4]}, "category": {"type": "choice", "options": ["账单", "故障", "咨询", "投诉"]}, "need_human": {"type": "noul"}, },)返回的结果大致是这样:
{ "urgency": { "value": 3.0, "confidence": 0.91 }, "category": { "choice": "故障", "distribution": { "账单": 0.02, "故障": 0.88, "咨询": 0.07, "投诉": 0.03 }, "confidence": 0.88 }, "need_human": { "probability": 0.62, "confidence": 0.79 }, "latency_ms": 118, "model": "jev-1.13.0"}注意几点:
- 输出是「类型化」的。
category只可能是你给的 4 个选项之一,urgency一定落在 0~4。这也是官方宣称「不会产生幻觉」的技术含义——见后文对这句话的辨析。 - 每个判断都带概率/置信度,调用方代码可以据此设阈值:比如
need_human > 0.5就转人工。 - 一个问题请求里的所有问题是一次性并行算出来的(下一节展开),所以多问几个问题几乎不增加延迟。
技术原理:为什么不逐字生成,反而更快
传统大模型是自回归的:一个 token 一个 token 往外吐,输出越长越慢。JEV 走的是完全不同的路子:
- 输出空间是预先定义的。你的问题里已经给了所有可能答案(选项集、评分区间、是/否),模型不需要「逐字造句」,而可以在一次前向传播里并行采样出所有问题的全部答案。这就是它「多加问题也不怎么变慢」的原因。
- 训练方法叫 RLCD——Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习),被明确拿来对标 RLHF 与 RLVR。
- RLHF 奖励的是「人类觉得这个回答好」;
- RLCD 奖励的是「你说的概率和实际命中率对得上」。
第二点是 JEV 最核心、也最容易被忽略的主张:它优化的是校准(calibration),而不是讨人喜欢。用官方的话说——如果它说 70% 或 95%,那这件事就应该恰好以 70% 或 95% 的频率发生。对需要拿去写进 if 语句的决策来说,一个诚实校准过的概率,比一句漂亮的自然语言解释有用得多。
性能与价格:官方数字与「真实收益」
| 指标 | 官方数据 |
|---|---|
| 端到端延迟 | 70 ~ 500 ms |
| 输入价格 | $0.042 / 百万 token |
| 输出价格 | 免费 |
| 上下文窗口 | 32,000 token |
| 对比前沿大模型 | 声称快 193.6 倍、便宜 444.6 倍 |
这里必须补一句 TypeSafe 自己都承认的注脚:193.6× / 444.6× 是「理论上限」,基准也是内部自评。第三方实测给出的更保守结论大致是:快约 2~3.6 倍、便宜约 4.7~7.5 倍。
即便如此,「输出免费」这件事本身很有信息量——它等于把定价模型从「按生成量计费」改成「按判断请求计费」,因为判断的 token 成本本来就不该随输出长度走。
准确性上,TypeSafe 自己的评测里 JEV 约为 67.8%——和 GPT-5.6 Terra 打平,但落后于 GPT-5.6 Sol 和 Claude Opus 5。它赢的不是准确率,而是每单位成本与延迟下的准确率。
JEV 和大模型,是替代还是互补?
结论很清楚:互补,不是替代。它们对应的是两种不同的活儿:
| 维度 | 生成式大模型 | JEV |
|---|---|---|
| 输出 | 自然语言 / 代码,长度不定 | 类型化判断(选择 / 分数 / 概率) |
| 典型任务 | 写作、规划、推理、生成代码 | 分类、路由、打分、审批、动作判定 |
| 延迟 | 秒级 | 毫秒级 |
| 可解释性 | 能给出推理过程 | 只给数字,不给理由 |
| 成本敏感度 | 高 | 极低 |
合理的分工是:大模型负责「想清楚要问什么」,JEV 负责「高频、廉价地把大量判断做完」。典型场景包括:
- 内容审核 / 垃圾识别(Choice:多分类)
- 工单路由与优先级(Score + Choice)
- 智能体的动作判定(Agent 里「这一步该调哪个工具」——本质就是 Choice)
- 用户流失风险、情绪强度打分(Score)
- 风控里一连串的是非门(Noul)
争议与需要留意的地方
热度之外,几个批评值得认真对待:
- 「零幻觉」是一种文字游戏。它真正的含义只是「JEV 不可能吐出选项之外的类型」,但它完全可能自信地选中一个错误的合法选项。类型安全 ≠ 判断正确。
- 没有可解释性。它只给数字,不给理由。对需要审计、需要向人解释的决策链来说,这是个硬伤——你无法像读 CoT 那样复盘它为什么这么选。
- 校准必须按工作流单独验证。RLCD 保证了「训练分布上」的校准,但你的业务数据分布未必在训练分布里。上线前应自己在真实样本上回归一遍它的置信度。
- 它有自己的「锯齿」。TypeSafe 文档里明确承认模型在计数、算术、日期比较上不可靠,并建议:数学运算留在代码里,别交给模型。
- 要锁定版本。官方建议把版本号写死(如
jev-1.13.0),因为概率输出会随版本漂移,而概率一旦漂移,你的阈值逻辑就跟着漂。
结语
JEV 真正有意思的地方,不在于它比大模型「强」——按准确率它并没有赢。它有意思在于把「智能」重新定义了一次:不是会说话,而是会把不确定的世界,压缩成一个可以写进代码的、校准过的概率。
过去两年,我们习惯把 LLM 当成一个无所不能的对话框,然后费尽力气在它外面套护栏、做解析、写重试。JEV 反过来问了一句:那么多真实场景里,我们要的其实从来不是一段文字,而就是一个「选 A 还是选 B、把握有多大」的判断。把这类判断单独抽出来,做成一个又快又便宜、还带概率的函数调用——这个想法,比它当下的成绩单更值得记住。
至于它最终是「新范式」还是「高级分类器」,答案可能两者都不是:它更像我说的那种基础设施——你不会天天谈论它,但一旦用上,就会开始把它塞进每一个原本用大模型硬扛的分类任务里。
参考来源:
- InfoQ. “TypeSafe AI Releases Jev: a Decision-Only Model That Returns Typed Probabilities Instead of Text.” 2026-10. https://www.infoq.com/news/2026/10/typesafe-ai-jev-released/
- 机器之心 / 腾讯新闻. “ChatGPT 早期研究者做了一个『不会说话』的 AI,Jev 真是新范式吗?” 2026-09-18. https://news.qq.com/rain/a/20260918A058BW00
- 阿里云开发者社区. “JEV 模型最新研讨:只下判断不说话,低延时才是被低估的变量.” https://developer.aliyun.com/article/1765496
- 七牛云新闻. “爆火的 Jev 是什么:前 OpenAI 研究员做的『不说话』模型,只输出带概率的结构化决策.” https://news.qiniu.com/archives/1789895633449
- OntiCards Blog. “Why Jev Refuses to Chat: Inside System One Models.” https://www.step2.com.cn/en/blog/jev-system-one-decision-models