兰 亭 墨 苑
期货 · 量化 · AI · 终身学习
首页
归档
编辑文章
标题 *
URL 别名 *
内容 *
(支持 Markdown 格式)
# Jev 模型的革命性何在 **核心判断:Jev 的革命性不在“它更强”,而在“它重新定义了模型该输出什么”。它把 AI 从“生成文本”拉回到“做判断”这个更原始的命题上。** ## 一、先搞清楚它是什么 Jev 是前 OpenAI 研究员 Diogo Almeida(参与过 InstructGPT 和 RLHF)创办的 TypeSafe AI 发布的模型[1]。2026 年 9 月 15 日上线,没有发布会,创始人只是在 X 上发了几条帖子[2]。 **它不生成文本。** 你给它一段状态(state),它只回答三种类型的问题[2][3]: - **Choice**:从最多 255 个选项里选一个 - **Score**:在自定义刻度上打分 - **Noul**:是非判断,返回 0 到 1 的概率 每个答案附带概率分布和置信度。没有解释,没有推理链,没有“我觉得”[4]。 **听起来像个高级分类器?** 区别在于:传统分类器每换一个任务就得重新标注数据、重新训练。而 Jev 跟大模型一样,**具备零样本泛化能力**——你告诉它判断标准,它立刻就能用[2]。 ## 二、革命性之一:输出空间从“无限”收窄到“有限” 传统大模型是**自回归**的:一个 token 一个 token 往外蹦,生成 100 个 token 就要跑 100 次前向计算。输出越长,越慢越贵[2]。 Jev 走的是另一条路。它的输出空间是**预先定义好的**——选项就那么多,答案就是一个概率值。所以它可以**并行采样**,一次前向计算全部搞定[2]。 结果是什么? | 指标 | 传统大模型 | Jev | |---|---|---| | 输出方式 | 逐 token 生成 | 一次并行运算 | | 答案格式 | 自由文本 | 预定义的类型化概率 | | 延迟 | 3–329 秒 | 70–500 毫秒 | | 输出价格 | 约输入价 5 倍 | **免费** | 来源:[2][4] 官方宣传是“最快 194 倍、最便宜 445 倍”[2]。但更值得看的不是这个数字,而是**它为什么能这么便宜**: > 既然没有逐字生成的过程,那就没有值得计费的输出。 这句话背后是一个判断:**文本生成本身,就是成本的大头。** Jev 把这块砍掉了。 ## 三、革命性之二:训练目标从“让人满意”变成“让概率诚实” 这是 Jev 最被低估的一点。 它用的不是 RLHF,是 **RLCD——Reinforcement Learning for Calibrated Decisions(校准决策强化学习)**[2][1]。 **RLHF 奖励的是“人类看了觉得好”。** 这让 ChatGPT 变得好用,但也让模型**在没有把握时表现得过于肯定**——因为“犹豫”的回答不讨喜。 **RLCD 奖励的是“你说的概率,得和你的实际命中率对上”。** 如果 Jev 说有 90% 的把握,它在数学验证上就应该有 90% 的时候是对的[2]。 Diogo Almeida 对 RLHF 的反思很直接: > 让人满意的训练会毁掉校准,因为“犹豫”的回答不讨喜。对聊天这是优点,对自动化这是灾难——**你没法拿一个假的 90% 去写门控。** 这个校准为什么重要?因为置信度让**降级策略**变得可编程: ``` 80% 以上 → 自动处理 50%–80% → 转人工复核 50% 以下 → 升级处理 ``` 来源:[5][6] **没有校准,这套路由就不成立。** 而 LLM 的概率,从来不是校准过的。 ## 四、革命性之三:它验证了 Agent 架构的“快慢分工” 业内对 Jev 最一致的判断是:它验证了 Agent 架构的**快慢分工**[7][8]。 - **昂贵的大模型**负责规划、推理、生成——“慢思考” - **高频、原子化的判断**交给轻量决策模型——“快判断” LangChain 的分析文章里有一段话点明了这件事: > Agent 的循环是:LLM 决定做什么,工具执行,模型评估结果,然后继续循环。**每一步决策都要求一次模型调用。** 这很慢,也很贵。[9] Jev 把“评估结果”“决定下一步”“判断是否完成”这些**高频判断**,从 LLM 手里接了过来。 APUS 的实测数据很具体:在一台 Apple M2 Pro 上,用本地模型复现 Jev 的决策范式,全程离线完成维基百科检索任务的中位耗时约 **18 秒**,表单填报、站内导航约 **3 秒**,单任务模型打分次数仅 **4 次**,**全程零云端调用、零 API 费用**[7][8]。 **这不是“又便宜又快”,这是让一些原本不经济的 Agent 场景,变得经济了。** ## 五、革命性之四:它把“判断”从“生成”里剥离出来 Jev 最根本的革命性,可以用一句话概括: > **它证明了“判断”不需要“生成”。** 过去我们让大模型做判断,总是要先让它写一段分析,再从里面提取结论。这就像**让一个作家去当裁判**——他能说出很多话,但你要的只是“犯规还是没犯规”。 Jev 把这个过程拆开了。**判断就是判断,不需要理由。** 理由由需要理由的人(或模型)去生成。 LangChain 用 Jev 做 Agent 评测的实验数据很说明问题:**500 次判断中,Jev 与人工标准完全一致**,分数方差比 GPT-5.6 Luna 低 **433 倍**,比 Claude Sonnet 4.6 低 **92 倍**[10][11]。 **低方差意味着可重复。** 而可重复,是自动化系统的第一要求。 ## 六、但必须说清楚它不能做什么 Jev 的边界非常清晰[1][3]: - **不能聊天、不能写代码、不能解释理由** - **不支持图片、音频、视频输入** - **答案永远锁定在预定义选项内,无法跳出框架** - **校准分数是批量统计意义上的准确,不保证单次必对** - **目前尚未向中国大陆地区开放**[7] The Register 的评论点出了一个关键: > 拿“无幻觉”与 LLM 比较并不公平。结构化输出与自然语言本就是两套体系,**没有幻觉空间 ≠ 模型更聪明**。[1] ## 七、所以,革命性到底在哪 把上面四点收束一下: **Jev 的革命性,是它把 AI 的“输出”从“无限可能”收窄到“有限判断”,并证明这条路可以更快、更便宜、更可校准。** 它不是在“做得更好”,而是在“做得更少”。而正因为做得更少,它才能把“更少”这件事,做到极致。 它真正验证的,是 Agent 时代的一条分工原则: > **贵的模型负责“想”,便宜的模型负责“判断”。** 而“判断”这个环节,在过去的 Agent 循环里,一直被 LLM 垄断着——不是因为 LLM 最适合做判断,而是因为没有别的选择。 Jev 给了这个选择。 ## 附:和你 PAOS 体系的关系 你已经在用 DSH,而 DSH 生态里已经有多个 Jev 插件: - `dsh-jev-tools`:精简工具输出、注入筛查、完成闸门[12] - `dsh-jev-adapter`:用任意 OpenAI 兼容端点复现 Jev 范式[6] - `jevcore-mcp`:Jev 的 MCP 封装[13] **这意味着:你不需要等 TypeSafe 开放中国区,就能在 DSH 里用上“判断模型”这个范式。** 你之前的 `dsh-jev-guardrails` 思路,正好和 `dsh-jev-tools` 的注入筛查、完成闸门是同一个方向——**用便宜的判断模型,给贵的生成模型当护栏。** 这大概就是 Jev 革命性最落地的意义:**它让“判断”这件事,第一次变得便宜到可以到处用。** --- 1. [2] 2. [7] 3. [14] 4. [13] 5. [5] 6. [15] 7. [12] 8. [1] 9. [8] 10. [10] 11. [16] 12. [6] 13. [11] 14. [3] 15. [9] 16. [17] 17. [18] 18. [4] ## 参考来源 [1] ChatGPT元老新模型Jev,快200倍、便宜400倍的“系统一”AI — https://www.aitop100.cn/infomation/details/34732.html [2] 不会说话的Jev,为什么爆火? — https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746 [3] Jev 入门:ChatGPT 研究员做了个“不会聊天、不写代码”的 AI 模型,但速度快200倍、成本低400倍 - 小众软件 — https://www.appinn.com/jev-getting-started/ [4] 最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透! — https://developer.aliyun.com/article/1765623 [5] Jev vs LLM: What Jev Is and When to Use It (Benchmarks) — OpenRouter Blog — https://openrouter.ai/blog/tutorials/jev-vs-llm-when-to-use-each/ [6] GitHub - BetterZflyee/dsh-jev-adapter: Use the Jev (System One) decision-model paradigm with any OpenAI-compatible LLM — no TypeSafe key required. A jev_decide tool for DeepSeek Harness (dsh). · GitHub — https://github.com/BetterZflyee/dsh-jev-adapter [7] Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现 — https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml [8] APUS开源Jev跨平台复现:国产模型实现秒级决策 — http://www.news.cn/tech/20260921/8f1c9bd6a9254e629383f1ac51e0d27d/c.html [9] What Is Jev? A Guide to TypeSafe AI’s System One Model — https://www.langchain.com/blog/building-a-harness-with-jev [10] Why AI model Jev that judges and decides instead of chatting is drawing attention — https://www.digitaltoday.co.kr/en/view/106516/why-new-ai-model-jev-that-judges-and-decides-instead-of-chatting-is-drawing-attention [11] GitHub - danielgshea/jev-as-a-judge: Using Jev as an evaluator. · GitHub — https://github.com/danielgshea/jev-as-a-judge [12] GitHub - HorusJiang/dsh-jev-tools: Jev judgment, not generation: prune long tool output, screen fetched pages for injected instructions, and gate completion claims inside DeepSeek Harness. · GitHub — https://github.com/HorusJiang/dsh-jev-tools [13] jevcore-mcp — https://www.npmjs.com/package/jevcore-mcp [14] Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding — https://arxiv.org/abs/2609.27678v1 [15] JEV-Star: Fast, Low-Cost StarCraft II Control with Language-Model Planning — https://arxiv.org/abs/2609.27331 [16] Mechanical models of pattern and form in biological tissues: the role of stress-strain constitutive equations - Jeffrey model. — https://arxiv.org/html/2009.10953v6#2 [17] Gradient dynamics models for liquid films with soluble surfactant - and the interfacial velocity — https://arxiv.org/html/1609.00946v1#4 [18] GitHub - RaulLazaro/dsh-jev-plugin: Ask Jev (TypeSafe System One) typed questions from DeepSeek Harness: batch judgements with probabilities, configured per user in Settings. · GitHub — https://github.com/RaulLazaro/dsh-jev-plugin
配图 (可多选)
选择新图片文件或拖拽到此处
标签
更新文章
删除文章