当一个亲手教 ChatGPT “好好说话”的人,转头做了一个“一个字都不说”的模型,事情就不简单了。
一、一个反直觉的发布会
2026 年 9 月 15 日,硅谷的 AI 开发者圈层被一个消息刷屏。
没有发布会,没有长篇技术博客,创始人只是在社交媒体上连发了几条帖子。发布后 24 小时内,Vercel AI Gateway 上近 13% 的付费团队已经开始使用它——这是该平台历史上新模型采用速度最快的一次不会说话的Jev,为什么爆火?。36 小时内,14 万名开发者涌入内测不会说话的Jev,为什么爆火?。
这个模型叫 Jev。
它不能聊天,不能写代码,不能写文章,不能看图,也不能解释自己。你问它一个问题,它一个字的文字都不生成。
那它做什么?
它只做一件事:判断。
给它一段内容(一封客服邮件、一行日志、一个页面状态),再给它几个事先定义好的问题,它直接返回结构化的答案和概率——“紧急程度 96%”、“分类:账单问题”、“客户愤怒度 3.0/4”。
听起来像个高级分类器?如果只是这样,它不可能火成这样。
它的创始人 Diogo Almeida,是 OpenAI 前研究员,RLHF(让 ChatGPT 学会“好好说话”的核心训练方法)的主要作者之一。OpenAI 在 GPT-4 的贡献名单中将他列为“Foundational RLHF and InstructGPT work”的贡献者刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?。
一个亲手教 AI 说话的人,转头做了一个不说话的模型。
这个反差本身,就是整个故事最有意思的起点。
二、Jev 到底在解决什么问题
要理解 Jev,得先理解当前大语言模型在“干活”时的一个结构性浪费。
2.1 一个电商 Agent 的困惑
假设你有一个电商 Agent,它打开网页后需要判断:下一步点哪个按钮?
常见做法是把网页状态交给 GPT 或 Claude,模型理解页面后,一个 Token 接一个 Token 地生成答案:“根据当前页面,我应该点击右下角的 Checkout 按钮”。然后软件再从这段文字里把 “Checkout” 抠出来,调用浏览器工具完成点击。
但从软件系统的角度看,它真正需要的信息,可能只是“第三个按钮”刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?。
类似的情况大量存在于 Agent 内部:这个工单该交给销售还是售后?这笔交易风险高不高?搜索结果里哪条最相关?
这些任务都需要语义理解和判断能力,却没有多少开放式文本生成的必要。
2.2 “用大模型回答不需要它的问题”
Home Assistant 社区有一个真实案例。开发者写了一个叫 HA-Jev 的插件,逻辑极其简单:传感器读取洗衣机的功率变化和洗衣房门的状态,然后抛出一个问题——“洗衣机洗完了,衣服是不是被忘在里面了?”
模型不输出任何文字分析,只返回一个概率值。当置信度超过 0.8 时,手机弹出取衣提醒。
一次判断耗时几十毫秒,花费 0.000015 美元。
这位插件开发者在论坛里留下一句话,恰好刺中了当前生成式 AI 的痛处:
“我过去一直在用大语言模型回答根本不需要它的问题。衣服忘没忘拿是一个判断,不是一篇八股文。”Jev,让全球程序员玩疯了 | 极客公园
2.3 Jev 的定位
TypeSafe 把 Jev 定义为 “System One Model”(系统一模型)——名字来自丹尼尔·卡尼曼的《思考,快与慢》。系统一指的是快速、直觉式的判断;系统二则是慢速、逐步推理的思考Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?。
过去几年,整个行业把几乎所有的算力、资本和工程资源,都压在“教模型说出更流畅的人话”上。但软件里真正需要的判断,大多数是系统一。
Jev 的目标就是这一部分工作。
三、Jev 的三种“题”:Choice、Score、Noul
Jev 的 API 简单到令人发指——只有三种问题类型ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策。
3.1 Choice:选哪个
从预先定义的选项集合中选择一项,最多支持 255 个选项,返回各选项的概率分布和最终选择ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费。
适用场景:该交给哪个部门、该调用哪个模型、下一步执行哪个动作、屏幕上哪个按钮是提交。
3.2 Score:打多少分
在一个自定义的等级尺度上给出评分,返回连续值(可以是小数)和每个等级的概率ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费Decision Models | AI/ML API Documentation。
适用场景:用户有多生气、内容风险有多高、某个候选有多符合要求。
一个值得注意的设计是:Score 返回的是期望等级索引,可以是分数。这意味着它可以表达“介于 1 和 2 之间”这种细微判断,而不是被硬性卡在整数上。
3.3 Noul:是不是
针对是非问题返回一个 0 到 1 之间的概率值,以及置信度ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费。
适用场景:是不是广告、是否要求退款、是否存在安全风险、是否紧急。
3.4 关键:可以混着问,而且并行算
三种题型可以混在同一个请求里,而且是并行计算的。
官方称,问一个问题还是问四个问题,延迟几乎一样最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏。
这意味着,一封客服邮件可以在一次调用里同时完成:是否紧急(Noul)、该分给哪个部门(Choice)、客户愤怒程度(Score)、是否要求退款(Noul)——四个判断,一次返回。
3.5 一个完整的 API 示例
以下示例展示了如何用 Jev 处理一条客服消息Jev | AI/ML API Documentation:
{
"model": "typesafe/jev",
"state": "Help! My payments have been failing for 3 days and nobody answers support.",
"questions": {
"is_urgent": {
"type": "noul",
"instructions": "Does this convey urgency?"
},
"department": {
"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {
"billing": "Payments, invoicing, refunds",
"technical": "Bugs, outages, integrations",
"sales": "Pricing, upgrades, new accounts"
}
},
"frustration": {
"type": "score",
"instructions": "How frustrated is the customer?",
"criteria": ["Calm", "Frustrated", "Very angry"]
}
}
}
返回结果里,每个问题都有一个类型化答案 + 概率 + 置信度。软件拿到这些结果后,用普通代码就能决定:紧急度 > 0.8 且愤怒度 >= 2 的,直接转人工。
四、为什么能这么快、这么便宜
Jev 最引人注目的两个数字:速度最快提升 193.6 倍,成本最低降低 444.6 倍ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费。
但这不只是“优化”的结果,而是架构上的根本改变。
4.1 传统大模型:一个 Token 一个 Token 地“写”
普通大模型是自回归的:生成 100 个 Token,就要跑 100 次前向计算。输出越长,越慢越贵。
哪怕你只需要一个“A”,它也可能先写一段“根据你的描述,我认为最合适的选择是 A,因为……”——大量 Token 花在了“解释答案”上输出token永久免费!Jev爆火后,开源版也跟着火了。
4.2 Jev:跳过整个生成过程
Jev 不走这条路。
它的输出空间是预先定义好的——选项就那么多,答案就是一个概率值。所以它可以并行采样,一次前向计算全部搞定最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏不会说话的Jev,为什么爆火?。
官方公布的数字ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏:
| 指标 | 数值 |
|---|---|
| 端到端延迟 | 70-500 毫秒 |
| 输入价格 | 每百万 Token 0.042 美元 |
| 输出价格 | 免费 |
输出免费的底气:“既然没有逐字生成的过程,那就没有值得计费的输出。”官方博客里的原话更直接——“便宜到根本不值得计费”不会说话的Jev,为什么爆火?。
4.3 RLCD:让“置信度”变得诚实
Jev 用的是RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习),而不是 RLHFChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策。
三者的区别输出token永久免费!Jev爆火后,开源版也跟着火了:
| 方法 | 优化目标 |
|---|---|
| RLHF | 人类看了觉得“好” |
| RLVR | 程序能验证“对错” |
| RLCD | 模型说的概率,和实际命中率对上 |
这意味着:如果 Jev 说有 70% 的把握,那在数学验证上,大约 70% 的情况下它是对的最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏。
这个“校准”是 Jev 真正的技术核心。因为如果置信度是靠谱的,程序就可以根据置信度来做决策:90% 以上自动执行,60%-90% 继续确认,60% 以下转人工Jev 入门:ChatGPT 研究员做了个“不会聊天、不写代码”的 AI 模型,但速度快200倍、成本低400倍 - 小众软件。
4.4 独立测试的验证
挪威开发者 Emil Lindfors 在 2026 年 9 月 18 日发布了一份独立测试报告,是目前少数非官方数据爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策。
Jev 的概率校准方向全部正确:在立场判断中,概率落在 0.9 到 1.0 区间的 43 次,参考标签为“是”的比例为 98%;落在 0.0 到 0.1 区间的 14 次,比例为 0%。
对照 DeepSeek V4.1 Flash 开启推理时的自述置信度 0.7 到 0.9 的判断,参考只同意 48%爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策。
但准确率并没有碾压。在 24 份挪威语样本下,Jev 与 DeepSeek 在立场与论点判定上统计上无差别。开推理只多换来 2 个标签,代价是十倍延迟爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策。
另一份更广泛的独立测试来自 JevBench,覆盖 242 道决策题,六个家族:请求路由、答案充分性判断、策略是非检查、意图分类、等级严重性评分、枚举提取GitHub - fstandhartinger/jevbench: JevBench v1 - a benchmark for Jev-class typed decision models: smart, cheap, fast, reliable, open. · GitHub。Jev 在速度、成本、可靠性上表现突出,但能力上并非全面领先。
五、Jev 到底能用在哪些场景
Jev 爆火后,社区在几天内砸出了近 500 个开源项目Jev,让全球程序员玩疯了 | 极客公园。这些项目揭示了一个事实:Agent 内部的“小判断”需求,远比人们意识到的多。
5.1 Agent 的“神经元”:上下文过滤
一个开发者写了一个 Jev 插件,用来压缩 Claude Code 的上下文。它不做任何归纳总结,而是逐条给历史工具调用的相关性打分,分值低于阈值的直接剔除Jev,让全球程序员玩疯了 | 极客公园。
结果:接近 100 万 Token 的臃肿上下文,在 1 秒钟内被精简到 8.6 万,模型没有敲下一个字符Jev,让全球程序员玩疯了 | 极客公园。
这里的洞察非常朴素:摘要是昂贵的生成行为,但过滤只是一次冷酷的判断。
5.2 移动端自动化:21 秒完成 9 步操作
Droidrun 团队做了一个叫 mobile-jev 的手机操作代理。在一段演示中,它控制真实 Android 手机打开 Uber,输入起点和终点,一路精准点击直至付款界面,全程 9 个操作步骤仅耗时 21 秒Jev,让全球程序员玩疯了 | 极客公园。
整个流程没有调用过任何传统的文字生成大模型。文字输入是直接从用户指令中截取的纯文本片段,而每一个界面的下一步该点哪里,全部交给 Jev 做极速概率匹配Jev,让全球程序员玩疯了 | 极客公园。
5.3 浏览器自动化:离线、零成本、数据不出本机
中国 AI 企业 APUS 在 9 月 19 日公布了全球最早一批针对 Jev 的开源复现,命名为 fast-browser-use,以 MIT 协议开放Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现APUS开源Jev跨平台复现:国产模型实现秒级决策。
它的核心逻辑Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现:
- 将页面上真实可见、可交互的元素整理为带编号的候选动作集合
- 由本地运行的模型(Qwen3.5-9B)通过单次前向计算直接完成“点哪里、选哪个”的决策
- 从机制上消除了模型生成错误选择器或格式幻觉的可能
实测数据:在 Apple M2 Pro 消费级笔记本上,全程离线完成真实维基百科检索任务的中位耗时约 18 秒,表单填报、站内导航等任务耗时仅 3 秒左右,单任务模型打分次数仅 4 次,全程零云端调用、零 API 费用,用户数据不出本机Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现。
5.4 微信:治好了“低情商”
Jev 爆火后,社区拿它用得最多的场景之一,是作为微信的插件最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏。
微信最难的地方在于精准触达对方的想法。比如经典的“你看着办”——到底是该怎么办?是小改一下?是放着不管?还是大刀阔斧?
Jev 的 Noul 和 Choice 能力恰好能处理这类模糊判断。把消息丢给 Jev,它返回概率化的判断结果,程序据此决定下一步动作。
5.5 数据库:自然语言行级过滤
GitHub 上涌现出 pg-jev 和 duckdb-jev,开发者开始用自然语言直接对数据库的行数据进行实时概率过滤和排序Jev,让全球程序员玩疯了 | 极客公园。
5.6 游戏:每秒 10 次决策
TypeSafe 官方发布了一段 Jev 玩《毁灭战士》的视频,其调用频率约为每秒 10 次,每小时游戏费用约 7 美元ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费。
游戏需要的是几十毫秒内的操作决断,以往的大模型连第一帧的思路都还没理顺,游戏角色早就阵亡了Jev,让全球程序员玩疯了 | 极客公园。
5.7 给大模型当“验收员”
一类特别有价值的用法是:用 Jev 检查大模型的行为。
开发者 Elvis Saravia 把 Jev 接进自己的 Agent 框架,构建了自定义验证器:在 Agent 宣称任务完成后再检查一遍输出token永久免费!Jev爆火后,开源版也跟着火了。
这样验证成本足够低,且目标结果可信度高。系统一负责快速筛查,系统二负责深度推理——这是 Jev 与生成式大模型最自然的协作方式。
5.8 文档字段比对:99% 的精确匹配率
日本 Classmethod 的开发者用 Jev 做了一组发票/文档字段比对测试,107 个案例【TypeSafe】Jev で書類項目の突合はどこまでできるか?精度・速度・コストを測ってみた | DevelopersIO:
- 精确匹配:106/107(99.1%)
- 语义匹配:96/106(90.6%)
- 平均延迟:702 毫秒
- 总成本:0.002289 美元(107 个案例)
薄弱环节集中在 “缺失字段”判断(43%)和日期比对(83%)【TypeSafe】Jev で書類項目の突合はどこまでできるか?精度・速度・コストを測ってみた | DevelopersIO。这说明 Jev 在“从有到有”的选择上很强,但在“判断有没有”这类需要细粒度语义理解的任务上仍有局限。
六、Jev 不能做什么(以及它“零幻觉”的真相)
6.1 它不能做的
Jev 完全不能GitHub - OmarMujahid/jev-decision-bench · GitHub实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩:
- 写文本
- 调用工具
- 解释答案
- 看图、听音频、看视频(仅支持文本输入,32K 上下文)Jev | AI/ML API Documentation
如果你问它“为什么不选 B”,它不回答,它只给数最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏。
6.2 “零幻觉”的真实含义
官方描述 Jev 是“零幻觉”,但这有些夸大输出token永久免费!Jev爆火后,开源版也跟着火了。
Jev 保证的是模式匹配:你给它 A、B、C 三个选项,它绝不会自作主张编出一个 D 输出。它也不会把本该是数字的结果写成一段文字实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩。
但“类型正确”不等于“事实正确”。
正确答案明明是 A,它照样可能选成 B输出token永久免费!Jev爆火后,开源版也跟着火了。
虎嗅的实测显示,Jev 在 50 道中文客服题上的完整准确率约 64%-65%,并没有碾压同级小模型不会说话的Jev,为什么爆火?。
6.3 已知的弱点
官方已知弱点页和独立测试揭示了几个问题爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策GitHub - OmarMujahid/jev-decision-bench · GitHub:
- 对措辞敏感:把问题写得越谨慎、越间接,一致率越低。模型“按字面读指令”
- 非英语准确率不一:官方称“擅长英语,其他语言准确率不一”。挪威语测试中,每 Token 约 2.06 字符,32K 状态上限只能装约 6.4 万字符
- 计数能力弱:在计数任务上得分 0.87,对照模型 0.99
- 超大选项集退化:77 个选项的 Banking77 任务上,Jev 0.81,对照模型 0.87
- 否定句一致性差:一个问题及其否定形式,概率平均相差 0.32
七、Jev 的真正意义:AI 的“物种分化”
7.1 一个被忽视的架构问题
过去四年,整个行业把几乎所有的算力、资本和工程资源,都压在“教模型说出更流畅的人话”上。
大家习惯了用百亿甚至千亿参数的庞然大物,先吐出一长串思考过程,再包装成礼貌体贴的自然语言,最后让开发者用复杂的正则表达式把需要的答案抠出来Jev,让全球程序员玩疯了 | 极客公园。
但软件系统真正需要的,往往只是一个数字、一个标签、一个概率。
7.2 “快慢分工”的验证
Jev 验证了 Agent 架构的 “快慢分工” 路线Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现APUS开源Jev跨平台复现:国产模型实现秒级决策:
- 昂贵的大模型负责规划等“慢思考”
- 高频、原子化的“快判断” 交给 轻量决策模型完成
负责组装与调度这套分工的工程层,在业界被称为 HarnessJev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现。
Jev 不是要取代大模型,而是要成为大模型身边的“神经元”——那些廉价、反应灵敏、数量庞大的判断节点Jev,让全球程序员玩疯了 | 极客公园。
7.3 杰文斯悖论
Jev 这个名字来自 19 世纪经济学家 杰文斯,暗合“杰文斯悖论”:蒸汽机效率提高、每吨煤更便宜,煤炭的总消耗反而涨了,因为便宜的动力被用到了更多地方Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏。
TypeSafe 希望同样的事情发生在 AI 上:让“智能判断”足够便宜之后,它会被大规模嵌入软件刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?。
7.4 但需要冷静看待
Jev 的爆火有真实的工程价值,但也有需要审视的地方爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策:
- 基准不独立:所有官方分数来自内部评测,参考答案由其他模型取平均
- 商业模式待验证:输出免费、输入每 Token 0.042 美元被质疑以融资补贴价格
- 准确率与前沿大模型大致持平,优势在速度和成本,不在“更聪明”
Almeida 在博客中的回应是:“非凡的主张需要非凡的证据”,并公开了四个评测工作流供复现。他说:“我们喜欢怀疑者,我们自己也是怀疑者。”爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策
八、对你 WeClaw 的可能价值
Jev 的定位——Agent 运行中的高频小判断——和 WeClaw 的架构有天然的契合点。
你目前可能用 Gemini 意图代理在做的判断,有一部分可以换成 Jev 或它的开源复现:
| WeClaw 场景 | Jev 能做什么 |
|---|---|
| 意图路由 | 用户消息该走 chat / search / publish / image? |
| 消息过滤 | 这条消息是广告、闲聊还是真实指令? |
| 模型路由 | 这个请求该交给便宜模型还是强模型? |
| 输出检查 | 某个 agent 的回复是否安全/合规? |
| 上下文压缩 | 哪些历史工具调用值得保留? |
这些判断的共同点是:选项有限、答案明确、需要快速返回。用生成式模型做这些,是在用“写作文”的能力做“答选择题”的事。
Jev 的价值不在“更聪明”,而在“同样的判断,快 10 倍、便宜 10 倍”。
一个可以关注的路线
Jev 目前尚未向中国大陆开放Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现。但 APUS 的开源复现(fast-browser-use)已经证明:用本地开源模型(Qwen3.5-9B)在端侧实现 Jev 的决策范式,在工程上是可行的Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现APUS开源Jev跨平台复现:国产模型实现秒级决策。
而且这个路线有一个 Jev 官方 API 没有的优势:数据不出本机。对于你的个人知识库场景,这一点可能比速度更重要。
Jev 的爆火,本质上是一个被长期忽视的需求终于被看见了:
Agent 不需要每一步都“说话”。它需要的是,在正确的地方,快速、便宜、可靠地做出判断。
而“判断”这件事,值得一个专门的模型。
- Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现
- ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费
- 爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策
- Jev,让全球程序员玩疯了 | 极客公园
- APUS开源Jev跨平台复现:国产模型实现秒级决策
- SystemOne - OpenRouter | Documentation
- GitHub - fstandhartinger/jevbench: JevBench v1 - a benchmark for Jev-class typed decision models: smart, cheap, fast, reliable, open. · GitHub
- 最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏
- 输出token永久免费!Jev爆火后,开源版也跟着火了
- Jev | AI/ML API Documentation
- 刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?
- 【TypeSafe】Jev で書類項目の突合はどこまでできるか?精度・速度・コストを測ってみた | DevelopersIO
- 不会说话的Jev,为什么爆火?
- Pourquoi Jev fait parler de lui : cette IA annonce être bien plus rapide et bien moins chère que les grands modèles
- Decision Models | AI/ML API Documentation
- systemone
- Jev 入门:ChatGPT 研究员做了个“不会聊天、不写代码”的 AI 模型,但速度快200倍、成本低400倍 - 小众软件
- GitHub - OmarMujahid/jev-decision-bench · GitHub
- 实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩