兰 亭 墨 苑
期货 · 量化 · AI · 终身学习
首页
归档
编辑文章
标题 *
URL 别名 *
内容 *
(支持 Markdown 格式)
# Jev:一个不会"说话"的模型,正在拆掉 Agent 最贵的一环 > 2026 年 9 月 15 日,一个不生成任何文字的模型发布。24 小时内,Vercel 上近 13% 的付费团队开始用它——平台历史上最快的采用纪录。 ## 一、一个"哑巴"为什么能搅动行业 2026 年 9 月 15 日,硅谷没有发布会。 Diogo Almeida 只是在社交媒体上发了几条帖子,语气平淡得像在说"我把一个内部工具开放了"。他是 OpenAI 前研究员,**RLHF 的主要作者之一**——那项技术让 ChatGPT 学会了"好好说话",可能是当前 AI 时代最重要的训练方法。 然后数据开始动了。 Vercel AI Gateway 的后台曲线率先跳起来。上线 12 小时,Jev 超越了所有同期发布的模型。24 小时后,**近 13% 的付费团队已经在使用它**。36 小时内,**14 万名开发者**挤进了内测等待列表。 一个不生成任何文字的模型,凭什么? 先说一件看起来不相关的事。 过去几年,我在自己的数据管道里做过大量"胶水代码"——让上游模型的输出能被下游系统安全消费的那些琐碎环节:解析 JSON、校验字段、处理"模型说了句废话导致整条流水线崩掉"的异常。 某次做一个分类 demo,提示词写了四十多行,反复叮嘱"只输出一个词"。结果十次里有三次,它回复:“好的,根据内容分析,答案应该是正面。”——整条脚本因为多了一个句号就挂了。 **那是“最会说话的模型”最荒谬的时刻。它把智力浪费在了社交礼仪上。** Jev 做的事情完全不同。你不给它写提示词,你给它写**问题**: - **Choice**:从十二个工具里选一个 - **Score**:这条客服消息的紧急度打几分 - **Noul**:当前这一步是否满足终止条件 它不输出“好的,我来帮你判断”,它直接返回一个浮点数和选项编号。**你拿到的东西不需要解析,因为它从来就不是“生成”出来的——它是算出来的。** 官方给的延迟是 **70 到 500 毫秒**,对比前沿大模型动辄 3 到 329 秒的响应时间。输入成本每百万 token **0.042 美元,输出免费**。拿它跑一个命令安全审查分类器,速度提升 5 到 18 倍,准确率还更高。 但真正让架构师们兴奋的,不是“快”,也不是“便宜”。 **是它输出的“概率”是校准的。** 传统大模型输出的“概率”是 token 层面的——它告诉你“正面”这个词出现的可能性是 87%,但这个数字跟“它判断对了吗”几乎没有关系。 Jev 的概率是**校准的**。TypeSafe 用了一套叫 **RLCD(Reinforcement Learning for Calibrated Decisions)** 的训练方法,奖励的不是“人类觉得这个回答好”,而是“**你说的概率得和实际命中率对上**”。 80% 置信度意味着:在一百次给出 80% 的预测里,大约八十次是对的。 **这不是语气问题,这是统计契约。** ## 二、七成开销花在“犹豫”上 Jev 的工程学意义,要放到 Agent 循环里才看得清。 先说一个我亲身踩过的坑。 2026 年春天,我用自研的网关搭了一条自动化写作流水线:让大模型读完一份中报,判断“毛利率是升是降”,再决定下一段写什么。单次调用约 1.8 秒,成本约 0.004 美元。听起来不贵。 但流水线跑起来后,每一步都在问大模型:这条命令危不危险?这个子任务派给谁?输出是否满足格式要求?测试失败了该重试还是换思路? **一天跑下来,真正用于“生成”的调用不到三成,剩下七成全是判断。** 七成开销花在“犹豫”上,而不是“干活”上。 这不是我一个人的问题。传统 Agent 循环的结构性浪费,恰恰藏在每一次“犹豫”里。你让大模型做一次完整的自回归解码,只为回答“这个子任务该派给谁”,它消耗的算力与写一篇八百字分析几乎相同。 贵、慢,而且格式易崩——它可能给你返回一句“我认为应该派给……”而不是一个可路由的标签。于是你加正则、加重试、加解析层,系统越来越脆。 **Jev 的工程学意义,就是把这类“犹豫”从生成任务里彻底剥离出去**:跳过自回归解码,隐状态直接打分,单次前向计算完成全部判断。 但“快”只是表象。真正值得说的是另一个数字:**结构化输出错误率 0%**。 传统大模型做判断时,即使你给了严格的 JSON schema,它仍可能吐出一个不存在的选项、一段无法解析的文本、或者一个格式对但语义荒谬的答案。这叫“格式幻觉”。 Jev 从根上消除了它——**不是判断不出错,而是不会给你一个不存在的选项**。输出空间被预先约束为带类型的集合,模型只在这个集合上打分。 这就像给一个话痨配了一把只能按固定键位的键盘,他再想跑题也跑不出去。 于是 Agent 架构里一条被忽视的分工线浮出水面: > **昂贵的大模型负责“慢思考”——规划、生成、推理;轻量决策模型负责“快判断”——分类、选择、评分;Harness 层负责组装与调度。** 我把它叫做“快慢分工”。 假设你是某电商平台的客服 Agent 负责人,每天要处理 50 万条用户消息。每一条都需要判断:紧急度、分类、是否转人工。用大模型做,单条成本约 0.0008 美元,50 万条就是 400 美元,延迟还让用户体验打折。换成 Jev 类决策模型,单条成本降到约 0.000002 美元,50 万条不到 1 美元,延迟从秒级压到百毫秒级。 **省下的钱不是重点,重点是整个系统的吞吐量上了一个数量级。** > **一个反直觉的事实**:限制 Agent 能力的,从来不是最慢的那一步,而是最快的那一步被重复了太多次。优化一个高频小判断的收益,可能远大于优化一次低频大生成。 ## 三、三盆冷水:Jev 能做什么,不能做什么 这一节,我要用真实的数据把上一节的热情拆开。 ### 3.1 它做对了什么 2026 年 9 月 20 日,有团队用 **190 次中国财经判断任务**实测了 Jev。材料取自监管部门和各公司中报原始公告,每道题反复问三到五遍。 - **宏观政策与行业事件判断**,18 次全对。“两新”政策、降准降息、煤炭供应冲击、汽车芯片短缺、光伏过剩、生猪周期,全部命中。 - **公司中报基本面定性**,32 次全对。宁德时代、比亚迪、万科、腾讯、茅台、美团、京东、泡泡玛特、安踏,九家公司的半年报,它读完能做方向判断。 - 有一道题很有意思:青岛啤酒的材料里,单季和半年利润方向相反,问它半年累计是什么方向。**5 次全对**。这意味着它能处理材料内部的冲突信号,不是简单做关键词匹配。 - 最让人意外的是“**信息不足**”那组。材料缺失关键数据,或者材料与问题无关时,**20 次它都选了“信息不足”**。 这个能力听起来普通,但对一个只做选择的模型来说,**知道“我不知道”是一种被训练过的克制**。 ### 3.2 它做错了什么 然后看错题。 **贴线计算,是它最明确的短板。** 宁德时代、金山办公、茅台,用两年收入和成本判断毛利率方向。三家公司共 15 次测试,**只对了 4 次**。 美的营业成本增速是否达到 17%,实际 16.83%。含新旧口径版本 5 次全错,只留两个数的版本 5 次全错。**十次全错,而且每次报出的把握都很高。** 这里出现了一个模式:把每道题的计算结果与最近的选项分界线做对比—— - 金山办公毛利率,离分界线 **0.06 个百分点**,5 次全错 - 宁德时代毛利率,离分界线 **0.10 个百分点**,5 次全错 - 伊利收入增速,离分界线 **0.13 个百分点**,5 次全对 **离分界线越近,它越容易算错,但把握度并不跟着降。** 这比“算错”更麻烦。**算错可以兜底,算错但自信,兜底的人不知道该不该信它。** ### 3.3 准确率的硬数字 官方对比中,Jev 综合准确率 **67.8%**,对照模型 **74.1%**。差了 6 个百分点以上。 Sonnet 5 也是 67.8%,和 Jev 打平,但 Sonnet 5 每万次判断的成本是 **1174 美元**,Jev 是 **4 美元**。 **更快更便宜是真的,更准不是。** 中文场景的另一组数据:50 条中文客服消息,Jev 完整准确率约 **64% 到 65.2%**,排在便宜小模型组第二。50 题成本约 **0.002 美元**,平均每题 0.73 秒,两项都是测试里最低的。 紧急度和分类基本可用,但**严重度评分与实际人工标注存在偏差**。有一道题它给出的严重度是 1.99,而人工介入阈值是 2.00。差了 0.01,规则判定为“不需要转人工”,但实际业务里这个单子应该转。 **模型返回了精确的概率,不代表这个概率在业务阈值附近是可靠的。** ### 3.4 所以“零幻觉”到底保证了什么 - 保证答案落在你给的选项里 - 保证不会吐出一个不存在的类别 - 保证不会格式崩溃 它**不保证**选中的那个是对的,不保证概率数字在阈值附近可信,不保证中文场景和英文场景一样好。 > **一个值得记住的判断**:大模型的错误是“散”的——这次格式崩,下次语义偏;Jev 的错误是“聚”的——集中在那几个贴线计算上。**一个错误模式可预测的模型,比一个错误模式随机的模型,在生产环境里更可管理,哪怕前者的准确率低几个百分点。** ## 四、生态爆发:从 Jev 到 JevBench Jev 发布后第四天,一个叫 **APUS** 的中国团队在 GitHub 上扔出了 MIT 协议的代码。 它选择的验证场景很刁钻——**浏览器自动化**,这是 Agent 跑任务时最容易翻车的地方。任何用过 Claude Code 的人都知道,让模型去点一个按钮,它有三成概率给你写出一个不存在的 CSS 选择器,然后整条链路崩溃重试。 APUS 的做法是把页面上所有可交互元素抓出来,编号,A、B、C、D,让 **Qwen3.5-9B 单次前向计算直接打分,选字母就行**。 模型永远看不到“点击那个蓝色按钮”这种自由发挥的机会。它只能从给定选项里挑。选错了是智力问题;选不出来?不存在的,每个选项都对应一个 token 的 logit,概率归一化之后总有一个 argmax。 实测数据:Apple M2 Pro,32GB 统一内存,Qwen3.5-9B 的 4-bit 量化版本,内存占用约 5.95GB。维基百科端到端导航,**中位耗时 18 到 30 秒**。表单填报、站内导航这类更简单的任务,**3 到 12 秒**。单任务模型打分次数**只有 4 次**——从最初自回归方案动辄 14 次推理调用砍下来的。 **这不是性能碾压,是架构选择带来的数量级差异。** ### 4.1 JevBench:第一个针对决策模型的评测榜 JevBench v1.2 出现的时候,标题很朴素:“第一个针对 Jev 类模型的评测榜”。 **21 个系统,534 道决策题,220 道 hard 档。** 总分由**智力、校准、速度、成本**四项几何平均合成——几何平均的意思很简单:任何一项趋近于零,总分就被拽到零附近。 - 你用 GPT-5.6 Luna 拿到 96.8 的智力分,但成本分只有 28.2,**排名第十二** - DeepSeek V4.1 Flash 智力 96.1、校准 96.7,成本分 17.1,**排第十六** 榜单在用数学语言说一件很残酷的事:**在决策模型这个品类里,“聪明”只是入场券,不是竞争优势。** **榜首不是官方 Jev**——是 classifier.dev 的 fast tier,84.8 分。它后端跑的就是 Jev,智力分 90.1 对官方 Jev 的 90.4 基本持平,但 p50 延迟 0.39 秒对 0.65 秒,成本每千次 0.0033 美元对 0.041 美元。 **同一颗大脑,套了一层更薄的壳,排名就换了位置。** 紧随其后的是 SemIf(Qwen3.5-4B,没有任何微调,只是读取选项 token 的概率分布),74.6 分。第四名 djev 用的是 diffusion-gemma 架构。 **五天内,官方 Jev 从“唯一”变成了“之一”。** ### 4.2 一个细节值得盯着看 JevBench 有一个细节:open-alternative-jev 在 yes/no 判定题上,把选项顺序从“A. yes, B. no”改成“A. no, B. yes”,**正确率从 72% 掉到 21%**。 51 个百分点的差距,只因为两个选项换了位置。 这说明 4B 级别的小模型在“理解选项语义”这件事上仍然脆弱,它的判断在相当程度上依赖于 token 位置和训练数据里的先验分布。 **如果你打算在生产环境用任何一个 Jev 类模型,选项顺序的鲁棒性必须纳入你自己的评测清单。** ### 4.3 校准,是这一层的入场券 JevBench 的 Calibration 项衡量的是一件事:**模型说“80% 有把握”的时候,实际命中率是不是真的接近 80%。** 这改变的是模型在系统里的定位。一个校准良好的决策模型可以这样用: - **置信度 > 0.9**:自动执行 - **0.6 到 0.9 之间**:丢给大模型复核 - **低于 0.6**:直接转人工 程序不需要理解判断的内容,只需要读一个浮点数。 **这就是“置信度路由”**——它让决策模型变成了一个可以装配的零件,而不是一个需要被信任的智能体。 我在自己的网关里试过类似的逻辑,用 DeepSeek 做消息路由,判断一条微信消息该走哪个 agent 处理。但 DeepSeek 给的是文本回答,我还得写正则去解析。Jev 的 Noul 原语直接返回一个 0 到 1 之间的数,代码里写一个 if 就完事了。 **省掉的不是那几行正则,是“解析失败”这个故障模式本身。** ## 五、冲击波之后:决策层分化的长期含义 Jev 发布后的第三周,我在自己的 NAS 上跑了一次对照实验。 同一套 Agent 循环,同一批任务——从网页抓取、表单填报到本地文件归档——唯一的变量是决策节点。**A 组**用完整 LLM 调用完成每一次“重试还是换路”“这条命令危不危险”的判断,**B 组**换成本地小模型做单次前向打分。 结果不出意料:B 组端到端耗时降了六成,API 账单从每天四美元掉到不足一毛。 但真正让我愣住的不是数字,是**失败模式的变化**。 - A 组的错误往往是“格式崩了”——模型输出了一段无法解析的文字,整个循环卡死 - B 组的错误则是“判断偏了”——分数打高了,选错了分支,但系统本身纹丝不动,继续往下跑 **前者是工程事故,后者是决策偏差。前者让你熬夜修管道,后者让你白天改规则。** ### 5.1 模型物种分化不是修辞,是架构事实 过去我们习惯用“大模型 vs 小模型”来讨论 AI,仿佛它们在同一条赛道上比谁跑得快。但 Jev 类决策模型的出现,让这条赛道**裂成了两条**。 一条追求“**更会生成**”——写代码、写文章、写方案,参数越大越好,推理越深越好,System Two 的慢思考是它的命脉。 另一条追求“**更快更准判断**”——选哪个、打多少分、是不是,单次前向,隐状态直接映射到结构化输出,System One 的快反射是它的全部。 **两者不是替代关系。你不会用 Jev 去写一封邮件,也不会用 GPT-5 去判断一条命令是否危险——那就像用计算器去写诗,用诗人去算账。** 未来的 Agent 架构将默认包含两层:**慢脑**负责规划、生成、推理,**快脑**负责分类、选择、评分。Harness 层夹在中间,像神经系统的丘脑,决定哪些信号上行到皮层,哪些下行到脊髓。 **这不是设计选择,是成本结构的必然。** > **一个值得记住的细节**:有天深夜,我的知识管道在剪贴板里捕获了一段模糊的截图文字,本地小模型判定“信息不足,转人工”,而云端大模型在同一位置给出了一个看似合理实则编造的摘要。那一刻我意识到,**快脑的真正优势不是便宜,是它被设计成“允许说不”**。生成模型的本能是填满空格,决策模型的本能是承认边界。前者是才华,后者是诚实。 ### 5.2 对个人开发者的意义 这对个人开发者的意义,怎么强调都不过分。 假设你是独立开发者,手头只有一台 M2 Pro 笔记本和一个 Go 二进制文件。过去你要构建一个能自主判断的 Agent,必须把每一次“该不该重试”“这条命令危不危险”都发给云端 API,延迟、费用、隐私三重压力让你只能做 demo,做不了日常工具。 现在,决策层轻量化之后,**一个本地小模型就能接管全部高频判断**,云端大模型只在真正需要“慢思考”时才被唤醒。一台消费级笔记本、一个本地模型、一个编排层,就能跑完过去需要大量云端调用才能完成的 Agent 判断循环。 **“个人智能操作系统”的最后一环,正在补齐。** 过去几年我们有了记忆层、执行层、连接层,但**决策层一直悬在空中**——要么依赖云端 API,要么靠硬编码规则。Jev 类模型的出现,让决策层可以像其他层一样,跑在本地、跑在离线、跑在一个 Go 二进制文件里。 这意味着什么? - 意味着你的个人 AI 系统可以在飞机上、在断网的咖啡馆、在没有 API key 的深夜,继续做判断 - 意味着你的数据不出机器,判断也不出机器 - 意味着“个人智能操作系统”不再是一个需要持续付费的订阅服务,而是一个**可以随身携带的软件资产** ### 5.3 冲击波尚未抵达的地方 但边界同样值得标记。 - **Jev 目前仅接受文本**。图片要转文本,音频要转文本,视频更是要转文本。这意味着在视觉和听觉场景里,决策层仍然是瘸的。 - **中文准确率待验证**。官方对比中 67.8% 的准确率低于对照模型的 74.1%,中文 CJK 语言的表现可能更低。 - **置信度校准在业务分布外是否可靠,仍是开放问题**。你在财经判断上校准到 80% 的置信度,换到医疗问诊场景可能完全失准。 **方向已经清晰,但路径仍需要每个人自己走一遍。** ## 六、写在最后 不是所有智能都需要“说出来”。有些智能只需要“判断对”。 这句话听起来简单,但它拆掉的是一整个时代的默认假设——**我们曾以为,AI 越像人越好,越能说会道越强**。 Jev 的冲击波告诉我们:在 Agent 的世界里,**一个不会说话的判断者,可能比最会说话的生成者更有用**。 因为 Agent 不需要诗人。 **Agent 需要一个能在十字路口果断打灯的人。**
配图 (可多选)
选择新图片文件或拖拽到此处
标签
更新文章
删除文章