Jev:当模型不再生成文本,Agent 的决策成本被重新定价

Jev:当模型不再生成文本,Agent 的决策成本被重新定价

Jev 不是“另一个模型”,而是一次 AI 的物种分化:生成模型继续负责写作与规划,判断模型接管那些本该由程序做、却因缺乏语义理解而不得不塞给大模型的工作。


2026 年 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 发布了一个“不会说话”的模型。

Jev 不生成文本。它不会聊天、不会写代码、不会给你一段分析。你给它一段状态,它只做三件事:从预定义选项里选一个,在一个刻度上打分,或者回答一个是非问题。每个答案附带一个概率值Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]。

听起来像个高级分类器?如果仅此而已,它不可能在 48 小时内让 Vercel 的付费团队使用率从 0 冲到 13%——是 GPT-5.6 系列同期数据的两倍以上爆火一周后,Jev正式全面开放:一个“不会说话”的AI,为何风靡硅谷?[3]。也不可能有 14 万开发者涌入内测爆火一周后,Jev正式全面开放:一个“不会说话”的AI,为何风靡硅谷?[3]。

Jev 真正的价值不在“它是什么”,而在它把单次语义判断的成本压到了什么程度


一个被定价扭曲的架构问题

过去两年,Agent 开发者面临一个隐性成本:大量简单判断不得不调用昂贵的大模型

“这条客服消息该转给退款组还是技术组?”“这个工具调用的输出还需要保留在上下文里吗?”“Agent 这一步完成了吗?”——这些问题不需要生成能力,只需要一个判断。但传统 LLM 是自回归的:一个 token 一个 token 往外蹦。生成一段分析,就要跑几十次前向计算;输出越长,越慢越贵Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]。

更麻烦的是,LLM 输出的是文字。程序要拿它做决策,必须先解析。而模型可能返回 "我认为应该转给退款团队",也可能返回 "建议转交退款部门处理"——同一件事,两种措辞,代码得写正则去兼容。

Jev 换了一条路。它的输出空间是预先定义好的:选项就那么多,答案就是一个概率值。所以它可以并行采样——一次前向计算,全部答案同时出来Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]。

官方数据:端到端延迟 70 到 500 毫秒,输入每百万 token 0.042 美元输出免费Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]。

输出免费的底气也在这里:既然没有逐字生成的过程,就没有值得计费的输出。


三种原语:判断被拆到了原子级别

Jev 的 API 只接受三种问题类型Jev Tutorial - Make Your First Decision Call on OpenRouter[5]Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]Jev:当模型不再生成文本,Agent 的决策链会发生什么?[6]:

Choice:从最多 255 个预定义选项中选一个。该交给退款组还是物流组?该向上还是向下?

Score:在一个自定义刻度上打分。客户愤怒程度 1 到 4?这个输出质量打几分?

Noul:是非判断,返回 0 到 1 之间的概率。这条消息需要人工介入吗?

一次请求可以同时问多个问题,全部基于同一份状态。OpenRouter 的教程里展示了一个客服工单场景:同一个请求里同时问“这是 bug 吗”(Noul)、“该哪个团队负责”(Choice)、“紧急程度如何”(Score)Jev Tutorial - Make Your First Decision Call on OpenRouter[5]。

返回结果是结构化的,每个答案带概率。代码可以直接 if confidence > 0.8,不需要解析任何自然语言Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]。


RLCD:让概率“诚实”

Jev 的训练方法叫 RLCD——Reinforcement Learning for Calibrated Decisions(校准决策强化学习)Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]。

这个名字值得拆开看。

RLHF 奖励的是“人类看了觉得好”。它让 ChatGPT 变得好用,但也让模型在没有把握时表现得过于肯定。Almeida 对 RLHF 的反思很直接:让人满意的训练会毁掉校准,因为“犹豫”的回答不讨喜。对聊天这是优点,对自动化这是灾难——你没法拿一个假的 90% 去写门控Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]。

RLCD 奖励的是“你说的概率,得和实际命中率对上”。如果 Jev 说有 90% 的把握,它在数学验证上就应该有 90% 的时候是对的Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]。

这个校准为什么重要?因为置信度让降级策略变得可编程:

  • 80% 以上:自动处理
  • 50% 到 80%:转人工复核
  • 50% 以下:升级处理

OpenRouter 的对比文章中有一句话点明了这件事:Jev 让“置信度路由”成为可能——代码先问 Jev“用户想干什么”,检查它有多确定,只有在确定度足够高时才自动执行;不够高就交给大模型或人工Jev vs LLM: What Jev Is and When to Use It (Benchmarks) — OpenRouter Blog[7]。


实测:快 13 倍、便宜 22 倍,精度差 3.3 个点

TypeSafe 官方宣传的“快 193 倍、便宜 444 倍”是自家评测的上限。独立数据更值得看。

OpenRouter 用 3,080 条 Banking77 客服语料,对比 Jev 1.13 和 Claude Opus 5 做 77 类意图分类。结果Is Jev as Accurate as Frontier Models at Classification? — OpenRouter Blog[8]:

指标 Jev 1.13 Claude Opus 5
准确率 81.0% 84.4%
中位延迟 175 ms 2,266 ms
每千次成本 $0.11 $2.42

Jev 的精度落后 3.3 个百分点,但快 13 倍、便宜 22 倍。 两者的标签一致率达到 89.3%Is Jev as Accurate as Frontier Models at Classification? — OpenRouter Blog[8]。

LangChain 的 Agent 评测实验数据更极端:Jev 在 500 次判断中与人工标准完全一致,而 GPT-5.6 Luna 一致率 96.4%,Claude Sonnet 4.6 只有 80%。Jev 的分数方差比对照模型低 92 到 913 倍,平均每次判断耗时 0.44 秒、成本 0.00035 美元TypeSafe AI推出Jev模型:不做文本生成,主打判断与决策[9]爆火一周后,Jev正式全面开放:一个“不会说话”的AI,为何风靡硅谷?[3]。

但必须说清楚:Jev 的“不会产生非法输出”不等于“不会产生错误决策”。它不会返回选项之外的字符串,但仍然可能选错。在 Banking77 中,Opus 在 35 个类别上领先,Jev 在 15 个上领先,27 个打平Is Jev as Accurate as Frontier Models at Classification? — OpenRouter Blog[8]。


社区用它做了什么:从浏览器到 Minecraft

Jev 真正出圈靠的不是官方 Demo,而是开发者自己长出来的用法。

Browser Agent:Browser Use 做了 jev-ultrafast。系统读取网页上的按钮、输入框,整理成元素列表,Jev 在每一步判断“该点哪个”。在 Google Flights 上找到指定航班,全程 7.1 秒,成本约 0.0039 美元爆火一周后,Jev正式全面开放:一个“不会说话”的AI,为何风靡硅谷?[3]。

Minecraft Agent:GPT-6 Astra 当“指挥官”规划路线,Jev 当“手”判断眼下执行什么动作。从空背包开始,8 分 43 秒击杀末影龙,模型成本不到 1 美元爆火一周后,Jev正式全面开放:一个“不会说话”的AI,为何风靡硅谷?[3]。

上下文压缩fast-jev-compaction 插件把 Claude Code 的长工具输出交给 Jev 逐段判定相关性,压缩后再送回大模型Why Is Jev Viral? Former OpenAI Researcher's AI Tool Taking Over The Internet — Why Everyone Is Scrambling To Use It[10]。

广告分析:一个实验用 Jev 分析 37 个品牌的 724 条实时广告,生成 8,724 个判断,约 40 秒完成,token 成本约 9 美分,中位处理时间 216 毫秒Why Is Jev Viral? Former OpenAI Researcher's AI Tool Taking Over The Internet — Why Everyone Is Scrambling To Use It[10]。

这些用法的共同点是:开发者没有把 Jev 当聊天机器人,而是在代码原本需要做一次语义判断的地方,把它塞了进去。


边界在哪里

必须说清楚 Jev 不能做什么:

它不生成任何文本。不能聊天、不能写代码、不能解释理由。你问它“为什么不选这个”,它不回答Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]。

它不计数、不做算术、不比较日期。这些必须留在普通代码里Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]。

它的概率在困难任务上会系统偏低。独立测试发现,简单任务上概率饱和到 1.000,困难任务上又偏低;选项顺序改变时,二元判断零翻转,但三元选择每 100 次会变 5 到 7 次We Tested Jev on 100 Real Agent Calls. How Easy Is It To Beat a Constant?[11]。

官方宣传的“193 倍、444 倍”是上限数字。按同精度对照(和 GPT-5.6 Terra 持平),实际大约是 25 倍快、76 倍便宜[안광섭 AI 진테제] Jev, 역사상 가장 빠르게 사용량이 증가한 유료 모델。这个数字已经足够大了,但值得说清楚口径。


为什么这很重要

Jev 的名字来自杰文斯悖论:蒸汽机效率提高、每吨煤更便宜,煤炭的总消耗反而涨了,因为便宜的动力被用到了更多地方TypeSafe发布Jev模型 主打校准决策不走文本[12]Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]。

以前用不起 AI,是因为调一次大模型又贵又慢。为了一个芝麻大的判断去调一次,不划算。于是那些“这条日志要不要报警”“这条消息该给谁”“这个任务算完成了吗”的小决策,全部塞给了人和规则。

Jev 把单次判断压到了万分之一美元。于是那些以前舍不得用 AI 的地方,现在可以用了Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]。

这不是“另一个模型”。这是 AI 的一次物种分化:生成模型继续负责规划、写作、解释,判断模型接管那些本该由程序做、却因为缺乏语义理解能力而不得不塞给大模型的工作。

Almeida 说,据他所知,这是通往基于 AI 的经济革命的最短路径Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]。

我不确定这个判断对不对。但我确定一件事:当判断的成本趋近于零,被解锁的场景会比我们想象的更多。


  1. TypeSafe AI推出Jev模型:不做文本生成,主打判断与决策[9]
  2. Jev Tutorial - Make Your First Decision Call on OpenRouter[5]
  3. Jev 为什么突然火了?它想把 Agent 里的大量 LLM 调用干掉[1]
  4. Jev vs LLM: What Jev Is and When to Use It (Benchmarks) — OpenRouter Blog[7]
  5. A new kind of AI model from a ChatGPT inventor is thrilling developers | TechCrunch[13]
  6. TypeSafe发布Jev模型 主打校准决策不走文本[12]
  7. Jev 使用完整指南:从申请 API Key 到置信度路由,把 TypeSafe 决策模型接进自己的代码[2]
  8. Jev是什么?来自官网的解释告诉你_决策_模型_Diogo[4]
  9. Is Jev as Accurate as Frontier Models at Classification? — OpenRouter Blog[8]
  10. Why Is Jev Viral? Former OpenAI Researcher's AI Tool Taking Over The Internet — Why Everyone Is Scrambling To Use It[10]
  11. 聊聊最近爆火的Jev 模型,到底是个啥?_腾讯新闻[14]
  12. Jev:当模型不再生成文本,Agent 的决策链会发生什么?[6]
  13. TypeSafe AI presenta Jev: addio agli LLM per le decisioni?[15]
  14. [안광섭 AI 진테제] Jev, 역사상 가장 빠르게 사용량이 증가한 유료 모델
  15. We Tested Jev on 100 Real Agent Calls. How Easy Is It To Beat a Constant?[11]
  16. GitHub - AppitStudio/awesome-jev: Curated Jev resources and runnable examples for typed AI decisions. · GitHub[16]
  17. 爆火一周后,Jev正式全面开放:一个“不会说话”的AI,为何风靡硅谷?[3]
  18. How to Use Jev in Python: Choice, Noul, Score + OpenAI Comparison[17]
  19. 新興TypeSafe AIが放つ新AI「Jev」、ハルシネーションなしは本当か? | Forbes JAPAN 公式サイト(フォーブス ジャパン)[18]
  20. 爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策[19]

参考来源

[1] https://cloud.tencent.com.cn/developer/article/2748203?policyId=20240000&traceId=&frompage=homepage
[2] https://news.qiniu.com/archives/1789969178302
[3] https://m.163.com/dy/article/L7CDVJ2D05119734.html
[4] https://www.sohu.com/a/1079280701_100106801?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&spm=smpc.channel_248.block3_308_NDdFbm_1_fd.8.1790047189636El08WZk_324
[5] https://openrouter.ai/docs/guides/community/jev-tutorial
[6] https://developer.aliyun.com/article/1765719
[7] https://openrouter.ai/blog/tutorials/jev-vs-llm-when-to-use-each/
[8] https://openrouter.ai/blog/insights/jev-vs-claude-opus-5-classification/
[9] https://www.digitaltoday.co.kr/cn/view/106520/why-new-ai-model-jev-that-judges-and-decides-instead-of-chatting-is-drawing-attention
[10] https://eu.36kr.com/en/p/3991165197188099
[11] https://archestra.ai/blog/we-tested-jev-on-100-real-agent-calls
[12] https://www.itsdw.cn/news/25431.html
[13] https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/?utm_campaign=daily_linkedin&trk=article-ssr-frontend-pulse_little-text-block
[14] https://news.qq.com/rain/a/20260921A03YKX00
[15] https://www.tomshw.it/hardware/typesafe-ai-lancia-jev-per-le-decisioni-quando-sostituisce-i-llm
[16] https://github.com/AppitStudio/awesome-jev
[17] https://mljar.com/blog/jev-python/
[18] https://forbesjapan.com/articles/detail/105002?module=toppage_new
[19] https://news.qiniu.com/archives/1789895633449