兰 亭 墨 苑
期货 · 量化 · AI · 终身学习
首页
归档
编辑文章
标题 *
URL 别名 *
内容 *
(支持 Markdown 格式)
> 当一个亲手教 ChatGPT “好好说话”的人,转头做了一个“一个字都不说”的模型,事情就不简单了。 ## 一、一个反直觉的发布会 2026 年 9 月 15 日,硅谷的 AI 开发者圈层被一个消息刷屏。 没有发布会,没有长篇技术博客,创始人只是在社交媒体上连发了几条帖子。发布后 **24 小时内,Vercel AI Gateway 上近 13% 的付费团队已经开始使用它**——这是该平台历史上新模型采用速度最快的一次[不会说话的Jev,为什么爆火?](https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746)。**36 小时内,14 万名开发者涌入内测**[不会说话的Jev,为什么爆火?](https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746)。 这个模型叫 **Jev**。 它不能聊天,不能写代码,不能写文章,不能看图,也不能解释自己。你问它一个问题,它**一个字的文字都不生成**。 那它做什么? 它只做一件事:**判断**。 给它一段内容(一封客服邮件、一行日志、一个页面状态),再给它几个事先定义好的问题,它直接返回结构化的答案和概率——“紧急程度 96%”、“分类:账单问题”、“客户愤怒度 3.0/4”。 听起来像个高级分类器?如果只是这样,它不可能火成这样。 它的创始人 **Diogo Almeida**,是 OpenAI 前研究员,**RLHF(让 ChatGPT 学会“好好说话”的核心训练方法)的主要作者之一**。OpenAI 在 GPT-4 的贡献名单中将他列为“Foundational RLHF and InstructGPT work”的贡献者[刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?](https://eu.36kr.com/zh/p/3988164509711361)。 **一个亲手教 AI 说话的人,转头做了一个不说话的模型。** 这个反差本身,就是整个故事最有意思的起点。 ## 二、Jev 到底在解决什么问题 要理解 Jev,得先理解当前大语言模型在“干活”时的一个结构性浪费。 ### 2.1 一个电商 Agent 的困惑 假设你有一个电商 Agent,它打开网页后需要判断:下一步点哪个按钮? 常见做法是把网页状态交给 GPT 或 Claude,模型理解页面后,**一个 Token 接一个 Token 地生成答案**:“根据当前页面,我应该点击右下角的 Checkout 按钮”。然后软件再从这段文字里把 “Checkout” 抠出来,调用浏览器工具完成点击。 但从软件系统的角度看,它真正需要的信息,**可能只是“第三个按钮”**[刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?](https://eu.36kr.com/zh/p/3988164509711361)。 类似的情况大量存在于 Agent 内部:这个工单该交给销售还是售后?这笔交易风险高不高?搜索结果里哪条最相关? 这些任务都需要**语义理解和判断能力**,却没有多少**开放式文本生成**的必要。 ### 2.2 “用大模型回答不需要它的问题” Home Assistant 社区有一个真实案例。开发者写了一个叫 HA-Jev 的插件,逻辑极其简单:传感器读取洗衣机的功率变化和洗衣房门的状态,然后抛出一个问题——“洗衣机洗完了,衣服是不是被忘在里面了?” 模型**不输出任何文字分析,只返回一个概率值**。当置信度超过 0.8 时,手机弹出取衣提醒。 一次判断耗时**几十毫秒,花费 0.000015 美元**。 这位插件开发者在论坛里留下一句话,恰好刺中了当前生成式 AI 的痛处: > **“我过去一直在用大语言模型回答根本不需要它的问题。衣服忘没忘拿是一个判断,不是一篇八股文。”**[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment) ### 2.3 Jev 的定位 TypeSafe 把 Jev 定义为 **“System One Model”(系统一模型)**——名字来自丹尼尔·卡尼曼的《思考,快与慢》。系统一指的是**快速、直觉式的判断**;系统二则是慢速、逐步推理的思考[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)[刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?](https://eu.36kr.com/zh/p/3988164509711361)。 过去几年,整个行业把几乎所有的算力、资本和工程资源,都压在“教模型说出更流畅的人话”上。**但软件里真正需要的判断,大多数是系统一。** Jev 的目标就是这一部分工作。 ## 三、Jev 的三种“题”:Choice、Score、Noul Jev 的 API 简单到令人发指——**只有三种问题类型**[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449)。 ### 3.1 Choice:选哪个 从**预先定义的选项集合**中选择一项,最多支持 **255 个选项**,返回各选项的概率分布和最终选择[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)。 适用场景:该交给哪个部门、该调用哪个模型、下一步执行哪个动作、屏幕上哪个按钮是提交。 ### 3.2 Score:打多少分 在一个**自定义的等级尺度**上给出评分,返回连续值(可以是小数)和每个等级的概率[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)[Decision Models | AI/ML API Documentation](https://docs.aimlapi.com/api-references/decision-models)。 适用场景:用户有多生气、内容风险有多高、某个候选有多符合要求。 一个值得注意的设计是:Score 返回的是**期望等级索引**,可以是分数。这意味着它可以表达“介于 1 和 2 之间”这种细微判断,而不是被硬性卡在整数上。 ### 3.3 Noul:是不是 针对**是非问题**返回一个 **0 到 1 之间的概率值**,以及置信度[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)。 适用场景:是不是广告、是否要求退款、是否存在安全风险、是否紧急。 ### 3.4 关键:可以混着问,而且并行算 三种题型可以**混在同一个请求里**,而且是**并行计算**的。 官方称,**问一个问题还是问四个问题,延迟几乎一样**[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html)。 这意味着,一封客服邮件可以在**一次调用**里同时完成:是否紧急(Noul)、该分给哪个部门(Choice)、客户愤怒程度(Score)、是否要求退款(Noul)——四个判断,一次返回。 ### 3.5 一个完整的 API 示例 以下示例展示了如何用 Jev 处理一条客服消息[Jev | AI/ML API Documentation](https://docs.aimlapi.com/api-references/decision-models/typesafe/jev): ```json { "model": "typesafe/jev", "state": "Help! My payments have been failing for 3 days and nobody answers support.", "questions": { "is_urgent": { "type": "noul", "instructions": "Does this convey urgency?" }, "department": { "type": "choice", "instructions": "Which team should handle this?", "criteria": { "billing": "Payments, invoicing, refunds", "technical": "Bugs, outages, integrations", "sales": "Pricing, upgrades, new accounts" } }, "frustration": { "type": "score", "instructions": "How frustrated is the customer?", "criteria": ["Calm", "Frustrated", "Very angry"] } } } ``` 返回结果里,每个问题都有一个**类型化答案 + 概率 + 置信度**。软件拿到这些结果后,用普通代码就能决定:紧急度 > 0.8 且愤怒度 >= 2 的,直接转人工。 ## 四、为什么能这么快、这么便宜 Jev 最引人注目的两个数字:**速度最快提升 193.6 倍,成本最低降低 444.6 倍**[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)。 但这不只是“优化”的结果,而是**架构上的根本改变**。 ### 4.1 传统大模型:一个 Token 一个 Token 地“写” 普通大模型是**自回归**的:生成 100 个 Token,就要跑 100 次前向计算。输出越长,越慢越贵。 哪怕你只需要一个“A”,它也可能先写一段“根据你的描述,我认为最合适的选择是 A,因为……”——**大量 Token 花在了“解释答案”上**[输出token永久免费!Jev爆火后,开源版也跟着火了](https://hub-assets-cache.baai.ac.cn/view/58152)。 ### 4.2 Jev:跳过整个生成过程 Jev **不走这条路**。 它的输出空间是**预先定义好的**——选项就那么多,答案就是一个概率值。所以它可以**并行采样,一次前向计算全部搞定**[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html)[不会说话的Jev,为什么爆火?](https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746)。 官方公布的数字[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html): | 指标 | 数值 | |------|------| | 端到端延迟 | **70-500 毫秒** | | 输入价格 | 每百万 Token **0.042 美元** | | 输出价格 | **免费** | **输出免费的底气**:“既然没有逐字生成的过程,那就没有值得计费的输出。”官方博客里的原话更直接——“**便宜到根本不值得计费**”[不会说话的Jev,为什么爆火?](https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746)。 ### 4.3 RLCD:让“置信度”变得诚实 Jev 用的是**RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)**,而不是 RLHF[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449)。 三者的区别[输出token永久免费!Jev爆火后,开源版也跟着火了](https://hub-assets-cache.baai.ac.cn/view/58152): | 方法 | 优化目标 | |------|---------| | RLHF | 人类看了觉得“好” | | RLVR | 程序能验证“对错” | | **RLCD** | **模型说的概率,和实际命中率对上** | 这意味着:如果 Jev 说有 **70% 的把握**,那在数学验证上,**大约 70% 的情况下它是对的**[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html)。 **这个“校准”是 Jev 真正的技术核心**。因为如果置信度是靠谱的,程序就可以根据置信度来做决策:90% 以上自动执行,60%-90% 继续确认,60% 以下转人工[Jev 入门:ChatGPT 研究员做了个“不会聊天、不写代码”的 AI 模型,但速度快200倍、成本低400倍 - 小众软件](https://www.appinn.com/jev-getting-started/)。 ### 4.4 独立测试的验证 挪威开发者 Emil Lindfors 在 2026 年 9 月 18 日发布了一份独立测试报告,是目前少数非官方数据[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449)。 **Jev 的概率校准方向全部正确**:在立场判断中,概率落在 0.9 到 1.0 区间的 43 次,参考标签为“是”的比例为 **98%**;落在 0.0 到 0.1 区间的 14 次,比例为 **0%**。 对照 DeepSeek V4.1 Flash 开启推理时的自述置信度 0.7 到 0.9 的判断,参考只同意 **48%**[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449)。 **但准确率并没有碾压**。在 24 份挪威语样本下,Jev 与 DeepSeek 在立场与论点判定上**统计上无差别**。开推理只多换来 2 个标签,代价是十倍延迟[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449)。 另一份更广泛的独立测试来自 JevBench,覆盖 242 道决策题,六个家族:**请求路由、答案充分性判断、策略是非检查、意图分类、等级严重性评分、枚举提取**[GitHub - fstandhartinger/jevbench: JevBench v1 - a benchmark for Jev-class typed decision models: smart, cheap, fast, reliable, open. · GitHub](https://github.com/fstandhartinger/jevbench)。Jev 在速度、成本、可靠性上表现突出,但**能力上并非全面领先**。 ## 五、Jev 到底能用在哪些场景 Jev 爆火后,社区在几天内砸出了**近 500 个开源项目**[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。这些项目揭示了一个事实:**Agent 内部的“小判断”需求,远比人们意识到的多。** ### 5.1 Agent 的“神经元”:上下文过滤 一个开发者写了一个 Jev 插件,用来**压缩 Claude Code 的上下文**。它不做任何归纳总结,而是**逐条给历史工具调用的相关性打分**,分值低于阈值的直接剔除[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 结果:**接近 100 万 Token 的臃肿上下文,在 1 秒钟内被精简到 8.6 万**,模型没有敲下一个字符[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 **这里的洞察非常朴素**:摘要是昂贵的生成行为,但**过滤只是一次冷酷的判断**。 ### 5.2 移动端自动化:21 秒完成 9 步操作 Droidrun 团队做了一个叫 **mobile-jev** 的手机操作代理。在一段演示中,它控制真实 Android 手机打开 Uber,输入起点和终点,一路精准点击直至付款界面,**全程 9 个操作步骤仅耗时 21 秒**[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 整个流程没有调用过任何传统的文字生成大模型。文字输入是直接从用户指令中截取的纯文本片段,而**每一个界面的下一步该点哪里,全部交给 Jev 做极速概率匹配**[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 ### 5.3 浏览器自动化:离线、零成本、数据不出本机 中国 AI 企业 APUS 在 9 月 19 日公布了全球最早一批针对 Jev 的开源复现,命名为 **fast-browser-use**,以 MIT 协议开放[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)[APUS开源Jev跨平台复现:国产模型实现秒级决策](http://www.news.cn/tech/20260921/8f1c9bd6a9254e629383f1ac51e0d27d/c.html)。 它的核心逻辑[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml): - 将页面上真实可见、可交互的元素整理为**带编号的候选动作集合** - 由本地运行的模型(Qwen3.5-9B)通过**单次前向计算**直接完成“点哪里、选哪个”的决策 - **从机制上消除了模型生成错误选择器或格式幻觉的可能** 实测数据:在 Apple M2 Pro 消费级笔记本上,全程离线完成真实维基百科检索任务的中位耗时约 **18 秒**,表单填报、站内导航等任务耗时仅 **3 秒左右**,单任务模型打分次数仅 **4 次**,**全程零云端调用、零 API 费用,用户数据不出本机**[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)。 ### 5.4 微信:治好了“低情商” Jev 爆火后,社区拿它用得最多的场景之一,是**作为微信的插件**[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html)。 微信最难的地方在于**精准触达对方的想法**。比如经典的“你看着办”——到底是该怎么办?是小改一下?是放着不管?还是大刀阔斧? Jev 的 Noul 和 Choice 能力恰好能处理这类模糊判断。把消息丢给 Jev,它返回概率化的判断结果,程序据此决定下一步动作。 ### 5.5 数据库:自然语言行级过滤 GitHub 上涌现出 **pg-jev** 和 **duckdb-jev**,开发者开始用自然语言**直接对数据库的行数据进行实时概率过滤和排序**[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 ### 5.6 游戏:每秒 10 次决策 TypeSafe 官方发布了一段 Jev 玩《毁灭战士》的视频,其调用频率约为**每秒 10 次**,每小时游戏费用约 **7 美元**[ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm)。 游戏需要的是几十毫秒内的操作决断,**以往的大模型连第一帧的思路都还没理顺,游戏角色早就阵亡了**[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 ### 5.7 给大模型当“验收员” 一类特别有价值的用法是:**用 Jev 检查大模型的行为**。 开发者 Elvis Saravia 把 Jev 接进自己的 Agent 框架,构建了自定义验证器:**在 Agent 宣称任务完成后再检查一遍**[输出token永久免费!Jev爆火后,开源版也跟着火了](https://hub-assets-cache.baai.ac.cn/view/58152)。 这样验证成本足够低,且目标结果可信度高。**系统一负责快速筛查,系统二负责深度推理**——这是 Jev 与生成式大模型最自然的协作方式。 ### 5.8 文档字段比对:99% 的精确匹配率 日本 Classmethod 的开发者用 Jev 做了一组**发票/文档字段比对测试**,107 个案例[【TypeSafe】Jev で書類項目の突合はどこまでできるか?精度・速度・コストを測ってみた | DevelopersIO](https://dev.classmethod.jp/articles/typesafe-jev-cross-match/): - **精确匹配**:106/107(**99.1%**) - **语义匹配**:96/106(90.6%) - **平均延迟**:702 毫秒 - **总成本**:**0.002289 美元**(107 个案例) 薄弱环节集中在 **“缺失字段”判断**(43%)和**日期比对**(83%)[【TypeSafe】Jev で書類項目の突合はどこまでできるか?精度・速度・コストを測ってみた | DevelopersIO](https://dev.classmethod.jp/articles/typesafe-jev-cross-match/)。这说明 Jev 在“从有到有”的选择上很强,但在“判断有没有”这类需要细粒度语义理解的任务上仍有局限。 ## 六、Jev 不能做什么(以及它“零幻觉”的真相) ### 6.1 它不能做的 Jev **完全不能**[GitHub - OmarMujahid/jev-decision-bench · GitHub](https://github.com/OmarMujahid/jev-decision-bench)[实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩](https://www.pingwest.com/a/317597): - 写文本 - 调用工具 - 解释答案 - 看图、听音频、看视频(**仅支持文本输入**,32K 上下文)[Jev | AI/ML API Documentation](https://docs.aimlapi.com/api-references/decision-models/typesafe/jev) 如果你问它“为什么不选 B”,它**不回答**,它只给数[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html)。 ### 6.2 “零幻觉”的真实含义 官方描述 Jev 是“**零幻觉**”,但这**有些夸大**[输出token永久免费!Jev爆火后,开源版也跟着火了](https://hub-assets-cache.baai.ac.cn/view/58152)。 Jev 保证的是**模式匹配**:你给它 A、B、C 三个选项,它**绝不会自作主张编出一个 D 输出**。它也不会把本该是数字的结果写成一段文字[实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩](https://www.pingwest.com/a/317597)。 **但“类型正确”不等于“事实正确”。** 正确答案明明是 A,它**照样可能选成 B**[输出token永久免费!Jev爆火后,开源版也跟着火了](https://hub-assets-cache.baai.ac.cn/view/58152)。 虎嗅的实测显示,Jev 在 50 道中文客服题上的**完整准确率约 64%-65%**,并没有碾压同级小模型[不会说话的Jev,为什么爆火?](https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746)。 ### 6.3 已知的弱点 官方已知弱点页和独立测试揭示了几个问题[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449)[GitHub - OmarMujahid/jev-decision-bench · GitHub](https://github.com/OmarMujahid/jev-decision-bench): - **对措辞敏感**:把问题写得越谨慎、越间接,一致率越低。模型“按字面读指令” - **非英语准确率不一**:官方称“擅长英语,其他语言准确率不一”。挪威语测试中,每 Token 约 2.06 字符,32K 状态上限只能装约 6.4 万字符 - **计数能力弱**:在计数任务上得分 0.87,对照模型 0.99 - **超大选项集退化**:77 个选项的 Banking77 任务上,Jev 0.81,对照模型 0.87 - **否定句一致性差**:一个问题及其否定形式,概率平均相差 0.32 ## 七、Jev 的真正意义:AI 的“物种分化” ### 7.1 一个被忽视的架构问题 过去四年,整个行业把几乎所有的算力、资本和工程资源,都压在“**教模型说出更流畅的人话**”上。 大家习惯了用百亿甚至千亿参数的庞然大物,**先吐出一长串思考过程,再包装成礼貌体贴的自然语言**,最后让开发者用复杂的正则表达式把需要的答案抠出来[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 **但软件系统真正需要的,往往只是一个数字、一个标签、一个概率。** ### 7.2 “快慢分工”的验证 Jev 验证了 Agent 架构的 **“快慢分工”** 路线[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)[APUS开源Jev跨平台复现:国产模型实现秒级决策](http://www.news.cn/tech/20260921/8f1c9bd6a9254e629383f1ac51e0d27d/c.html): - **昂贵的大模型**负责规划等“**慢思考**” - **高频、原子化的“快判断”** 交给 **轻量决策模型**完成 负责组装与调度这套分工的工程层,在业界被称为 **Harness**[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)。 **Jev 不是要取代大模型,而是要成为大模型身边的“神经元”**——那些廉价、反应灵敏、数量庞大的判断节点[Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment)。 ### 7.3 杰文斯悖论 Jev 这个名字来自 19 世纪经济学家 **杰文斯**,暗合“**杰文斯悖论**”:蒸汽机效率提高、每吨煤更便宜,**煤炭的总消耗反而涨了**,因为便宜的动力被用到了更多地方[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)[最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html)。 TypeSafe 希望同样的事情发生在 AI 上:**让“智能判断”足够便宜之后,它会被大规模嵌入软件**[刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?](https://eu.36kr.com/zh/p/3988164509711361)。 ### 7.4 但需要冷静看待 Jev 的爆火有真实的工程价值,但也有**需要审视的地方**[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449): - **基准不独立**:所有官方分数来自内部评测,参考答案由其他模型取平均 - **商业模式待验证**:输出免费、输入每 Token 0.042 美元被质疑以融资补贴价格 - **准确率与前沿大模型大致持平**,优势在速度和成本,不在“更聪明” Almeida 在博客中的回应是:“**非凡的主张需要非凡的证据**”,并公开了四个评测工作流供复现。他说:“**我们喜欢怀疑者,我们自己也是怀疑者**。”[爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449) ## 八、对你 WeClaw 的可能价值 Jev 的定位——**Agent 运行中的高频小判断**——和 WeClaw 的架构有天然的契合点。 你目前可能用 Gemini 意图代理在做的判断,**有一部分可以换成 Jev 或它的开源复现**: | WeClaw 场景 | Jev 能做什么 | |-------------|-------------| | **意图路由** | 用户消息该走 chat / search / publish / image? | | **消息过滤** | 这条消息是广告、闲聊还是真实指令? | | **模型路由** | 这个请求该交给便宜模型还是强模型? | | **输出检查** | 某个 agent 的回复是否安全/合规? | | **上下文压缩** | 哪些历史工具调用值得保留? | 这些判断的共同点是:**选项有限、答案明确、需要快速返回**。用生成式模型做这些,是在用“写作文”的能力做“答选择题”的事。 **Jev 的价值不在“更聪明”,而在“同样的判断,快 10 倍、便宜 10 倍”。** ### 一个可以关注的路线 Jev 目前**尚未向中国大陆开放**[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)。但 APUS 的开源复现(fast-browser-use)已经证明:**用本地开源模型(Qwen3.5-9B)在端侧实现 Jev 的决策范式,在工程上是可行的**[Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml)[APUS开源Jev跨平台复现:国产模型实现秒级决策](http://www.news.cn/tech/20260921/8f1c9bd6a9254e629383f1ac51e0d27d/c.html)。 而且这个路线有一个 Jev 官方 API 没有的优势:**数据不出本机**。对于你的个人知识库场景,这一点可能比速度更重要。 --- **Jev 的爆火,本质上是一个被长期忽视的需求终于被看见了:** **Agent 不需要每一步都“说话”。它需要的是,在正确的地方,快速、便宜、可靠地做出判断。** 而“判断”这件事,值得一个专门的模型。 --- 1. [Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现](https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml) 2. [ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费](https://m.ithome.com/html/1003584.htm) 3. [爆火的Jev 是什么:前 OpenAI 研究员做的"不说话"模型,只输出带概率的结构化决策](https://news.qiniu.com/archives/1789895633449) 4. [Jev,让全球程序员玩疯了 | 极客公园](https://w.geekpark.net/news/370758#comment) 5. [APUS开源Jev跨平台复现:国产模型实现秒级决策](http://www.news.cn/tech/20260921/8f1c9bd6a9254e629383f1ac51e0d27d/c.html) 6. [SystemOne - OpenRouter | Documentation](https://openrouter.ai/docs/client-sdks/go/sdks/systemone/README) 7. [GitHub - fstandhartinger/jevbench: JevBench v1 - a benchmark for Jev-class typed decision models: smart, cheap, fast, reliable, open. · GitHub](https://github.com/fstandhartinger/jevbench) 8. [最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏](https://www.donews.com/article/detail/6885/107606.html) 9. [输出token永久免费!Jev爆火后,开源版也跟着火了](https://hub-assets-cache.baai.ac.cn/view/58152) 10. [Jev | AI/ML API Documentation](https://docs.aimlapi.com/api-references/decision-models/typesafe/jev) 11. [刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?](https://eu.36kr.com/zh/p/3988164509711361) 12. [【TypeSafe】Jev で書類項目の突合はどこまでできるか?精度・速度・コストを測ってみた | DevelopersIO](https://dev.classmethod.jp/articles/typesafe-jev-cross-match/) 13. [不会说话的Jev,为什么爆火?](https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746) 14. [Pourquoi Jev fait parler de lui : cette IA annonce être bien plus rapide et bien moins chère que les grands modèles](https://www.futura-sciences.com/tech/actualites/intelligence-artificielle-jev-fait-parler-lui-cette-ia-annonce-etre-bien-plus-rapide-bien-moins-chere-grands-modeles-137822/#xtor%3DRSS-8) 15. [Decision Models | AI/ML API Documentation](https://docs.aimlapi.com/api-references/decision-models) 16. [systemone](https://pkg.go.dev/chainguard.dev/driftlessaf/agents/executor/systemone) 17. [Jev 入门:ChatGPT 研究员做了个“不会聊天、不写代码”的 AI 模型,但速度快200倍、成本低400倍 - 小众软件](https://www.appinn.com/jev-getting-started/) 18. [GitHub - OmarMujahid/jev-decision-bench · GitHub](https://github.com/OmarMujahid/jev-decision-bench) 19. [实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩](https://www.pingwest.com/a/317597)
配图 (可多选)
选择新图片文件或拖拽到此处
标签
更新文章
删除文章