Jev 深度解析:一个不会“说话”的 AI,为什么让全球程序员玩疯了
2026 年 9 月 15 日,硅谷 AI 开发者社区被一个消息刷屏。
一个名叫 Jev 的新模型发布了。它不能写文章,不能写代码,不能陪你聊天,甚至连一句完整的话都生成不出来。你给它输入一段文字,它只会回给你几个数字和标签——“96%紧急”、“分类:账单问题”、“愤怒程度:3.0/4”。
听起来像个高级版分类器?如果只是这样,它不可能火成这样。
上线 24 小时内,Vercel AI Gateway 上近 13% 的付费团队已经开始使用它,是平台历史上采用最快的一次模型发布不会说话的Jev,为什么爆火?[1]教ChatGPT说话的人 推出「哑巴」AI模型[2]。36 小时内,14 万名开发者涌入内测不会说话的Jev,为什么爆火?[1]。Vercel、LangChain、Cloudflare——几乎你能叫得出名字的 AI 基础设施平台,全都在第一时间把它集成进去了不会说话的Jev,为什么爆火?[1]。
Jev 的真正意义,藏在一个被长期忽视的工程问题里:Agent 内部的绝大多数模型调用,根本不需要“说话”,只需要“判断”。
一、一个“哑巴模型”的诞生
1.1 教 ChatGPT 说话的人,做了一个不说话的模型
Jev 的创始人 Diogo Almeida,是 OpenAI 前研究员,也是 RLHF(基于人类反馈的强化学习)的主要作者之一——这项技术让 ChatGPT 学会了“好好说话”,可能是当前 AI 时代最重要的训练方法教ChatGPT说话的人 推出「哑巴」AI模型[2]前OpenAI研究员推出首款“System One”模型引爆AI圈:不生成文本,专为机器做快速决策[3]。
但 Almeida 对这件事越来越怀疑。
“我们手握瓶中闪电,但它却没什么用处,”他对 TechCrunch 表示。“从那时起我就一直在解决这个问题。我花了很长时间才得出结论:问题在于我们一直在为人类语言做优化……过去四年我们在人类语言方面做得非常出色,但这对自动化没有用处,因为计算机说的是另一种语言。”ChatGPT发明者打造新型AI模型引发开发者热潮[4]
两年前,Almeida 离开 OpenAI,和 Erik Gafni、Sasha Sheng 一起创办了 TypeSafe AI。公司隐身研发了两年,出来时带着 DCVC 领投的 4000 万美元种子轮融资,估值约 2 亿美元刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?[5]。
2026 年 9 月 15 日,TypeSafe 发布了他们的第一个模型——Jev。
1.2 名字来自“杰文斯悖论”
Jev 这个名字来自 19 世纪经济学家 William Stanley Jevons,暗合“杰文斯悖论”:蒸汽机效率提高、每吨煤更便宜,煤炭的总消耗反而涨了,因为便宜的动力被用到了更多地方Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]不会说话的Jev,为什么爆火?[1]。
TypeSafe 希望同样的事情发生在 AI 上:让“智能判断”足够便宜之后,它会被大规模嵌入软件。
二、Jev 到底是个什么东西
2.1 三种“题”,就是它的全部
Jev 的 API 简单到令人发指——只有三种问题类型不会说话的Jev,为什么爆火?[1]最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏[7]:
Choice(选择题):从预先定义的选项集合中选择一项,最多支持 255 个选项,返回各选项的概率分布和最终选择。适用场景:该交给哪个部门、该调用哪个模型、下一步执行哪个动作。
Score(打分题):在一个自定义的等级尺度上给出评分,返回连续值和每个等级的概率。适用场景:用户有多生气、内容风险有多高、某个候选有多符合要求。
Noul(判断题):针对是非问题返回一个 0 到 1 之间的概率值。适用场景:是不是广告、是否要求退款、是否存在安全风险。
三种题型可以混在同一个请求里,而且是并行计算的。官方称,问一个问题还是问四个问题,延迟几乎一样最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏[7]。
一封客服邮件可以在一次调用里同时完成:是否紧急(Noul)、该分给哪个部门(Choice)、客户愤怒程度(Score)、是否要求退款(Noul)——四个判断,一次返回。
2.2 和传统大模型的根本区别
用一个比喻就能说清楚:
ChatGPT 给人写答案,Jev 给程序做判断。
普通大模型是自回归的:生成 100 个 Token,就要跑 100 次前向计算。哪怕你只需要一个“A”,它也可能先写一段“根据你的描述,我认为最合适的选择是 A,因为……”——大量 Token 花在了“解释答案”上刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?[5]教ChatGPT说话的人 推出「哑巴」AI模型[2]。
Jev 不走这条路。它的输出空间是预先定义好的——选项就那么多,答案就是一个概率值。所以它可以并行采样,一次前向计算全部搞定刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?[5]。
2.3 一个真实的对比场景
在 TypeSafe 的官方演示中,同一个客服消息判断任务:
- Jev:0.114 秒返回全部结构化判断
- 传统大模型:8.566 秒,还在逐字生成文本Silent AI Takes Social Media by Storm: Is Jev Truly a Groundbreaking New Paradigm Redefining AI Technology?[8]
Jev 的端到端延迟是 70-500 毫秒,而现有大语言模型的响应时间是 3 到 329 秒前OpenAI研究员推出首款“System One”模型引爆AI圈:不生成文本,专为机器做快速决策[3]。
三、为什么能这么快、这么便宜
3.1 架构上的根本改变
传统大模型的输出空间是开放的——理论上可以生成任何文本。所以必须逐 Token 生成,每生成一个 Token 都要跑一次完整的前向计算。
Jev 的输出空间是封闭的——选项数量有限,答案就是一个概率值。所以它可以:
- 把整个上下文做一次 prefill,得到 KV Cache
- 把 KV Cache 广播成多份,给每个字段附加不同的 suffix
- 一次 batched forward,所有问题同时求值Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]
3.2 官方公布的数字
| 指标 | 数值 |
|---|---|
| 端到端延迟 | 70-500 毫秒 |
| 输入价格 | 每百万 Token 0.042 美元 |
| 输出价格 | 免费 |
| 速度提升 | 最高 193.6 倍 |
| 成本降低 | 最高 444.6 倍 |
输出免费的底气:“既然没有逐字生成的过程,那就没有值得计费的输出。”官方博客里的原话更直接——“便宜到根本不值得计费”不会说话的Jev,为什么爆火?[1]。
3.3 RLCD:让“置信度”变得诚实
Jev 用的不是 RLHF,是 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。
三者的区别不会说话的Jev,为什么爆火?[1]最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏[7]:
| 方法 | 优化目标 |
|---|---|
| RLHF | 人类看了觉得“好” |
| RLVR | 程序能验证“对错” |
| RLCD | 模型说的概率,和实际命中率对上 |
这意味着:如果 Jev 说有 70% 的把握,那在数学验证上,大约 70% 的情况下它是对的最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏[7]。
这个“校准”是 Jev 真正的技术核心。因为如果置信度是靠谱的,程序就可以根据置信度来做决策:90% 以上自动执行,60%-90% 继续确认,60% 以下转人工。
四、Jev 到底能用在哪些场景
Jev 爆火后,社区在几天内砸出了近 500 个开源项目Jev,让全球程序员玩疯了 | 极客公园[9]。这些项目揭示了一个事实:Agent 内部的“小判断”需求,远比人们意识到的多。
4.1 Agent 的“神经元”:上下文过滤
一个开发者写了一个 Jev 插件,用来压缩 Claude Code 的上下文。它不做任何归纳总结,而是逐条给历史工具调用的相关性打分,分值低于阈值的直接剔除。
结果:接近 100 万 Token 的臃肿上下文,在 1 秒钟内被精简到 8.6 万,模型没有敲下一个字符Jev,让全球程序员玩疯了 | 极客公园[9]。
这里的洞察非常朴素:摘要是昂贵的生成行为,但过滤只是一次冷酷的判断。
4.2 移动端自动化:21 秒完成 9 步操作
Droidrun 团队做了一个叫 mobile-jev 的手机操作代理。在一段演示中,它控制真实 Android 手机打开 Uber,输入起点和终点,一路精准点击直至付款界面,全程 9 个操作步骤仅耗时 21 秒Jev,让全球程序员玩疯了 | 极客公园[9]。
整个流程没有调用过任何传统的文字生成大模型。文字输入是直接从用户指令中截取的纯文本片段,而每一个界面的下一步该点哪里,全部交给 Jev 做极速概率匹配。
4.3 浏览器自动化:离线、零成本、数据不出本机
中国 AI 企业 APUS 在 9 月 19 日公布了全球最早一批针对 Jev 的开源复现,命名为 fast-browser-use,以 MIT 协议开放Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]APUS开源Jev跨平台复现:国产模型实现秒级决策[10]。
它的核心逻辑:
- 将页面上真实可见、可交互的元素整理为带编号的候选动作集合
- 由本地运行的模型(Qwen3.5-9B)通过单次前向计算直接完成“点哪里、选哪个”的决策
- 从机制上消除了模型生成错误选择器或格式幻觉的可能
实测数据:在 Apple M2 Pro 消费级笔记本上,全程离线完成真实维基百科检索任务的中位耗时约 18 秒,表单填报、站内导航等任务耗时仅 3 秒左右,单任务模型打分次数仅 4 次,全程零云端调用、零 API 费用,用户数据不出本机Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]APUS开源Jev跨平台复现:国产模型实现秒级决策[10]。
4.4 数据库:自然语言行级过滤
GitHub 上涌现出 pg-jev 和 duckdb-jev,开发者开始用自然语言直接对数据库的行数据进行实时概率过滤和排序Jev,让全球程序员玩疯了 | 极客公园[9]。
4.5 游戏:每秒 10 次决策
TypeSafe 官方发布了一段 Jev 玩《毁灭战士》的视频,其调用频率约为每秒 10 次,每小时游戏费用约 7 美元教ChatGPT说话的人 推出「哑巴」AI模型[2]。
游戏需要的是几十毫秒内的操作决断,以往的大模型连第一帧的思路都还没理顺,游戏角色早就阵亡了。
在 Ably Pong 演示中,Jev 在 12 秒内做出了 47 次操作决策,而 Gemini、Claude 和 GPT 在同样时间里只做出两三次刷屏全球AI新顶流Jev全攻略 零语言交互玩法深度解析[11]。
4.6 给大模型当“验收员”
一类特别有价值的用法是:用 Jev 检查大模型的行为。
开发者 Elvis Saravia 把 Jev 接进自己的 Agent 框架,构建了自定义验证器:在 Agent 宣称任务完成后再检查一遍Jev,让全球程序员玩疯了 | 极客公园[9]。
这样验证成本足够低,且目标结果可信度高。系统一负责快速筛查,系统二负责深度推理——这是 Jev 与生成式大模型最自然的协作方式。
4.7 加密货币情绪分析
GitHub 上的 Jev-X-Sentiment-Analysis 项目用 Jev 做加密货币市场情报终端:搜索任意加密货币,分析 50 到 1000 条推文,基于实时市场数据和社交情绪,即时返回“买入/卖出/持有/止盈”的决策,附带置信度百分比和入场范围、止损、目标价位GitHub - brainstormity/Jev-X-Sentiment-Analysis · GitHub[12]。
五、Jev 不能做什么
5.1 它完全不能做的
Jev 完全不能:写文本、调用工具、解释答案、看图听音频看视频(仅支持文本输入,32K 上下文)不会说话的Jev,为什么爆火?[1]。
如果你问它“为什么不选 B”,它不回答,它只给数。
5.2 “零幻觉”的真实含义
官方描述 Jev 是“零幻觉”,但这有些夸大。
Jev 保证的是模式匹配:你给它 A、B、C 三个选项,它绝不会自作主张编出一个 D 输出。它也不会把本该是数字的结果写成一段文字不会说话的Jev,为什么爆火?[1]实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩[13]。
但“类型正确”不等于“事实正确”。 正确答案明明是 A,它照样可能选成 B。
TypeSafe 自己承认:“零幻觉”指的是不会跳出预设选项范围乱答,但选项范围之内答错依然是可能的实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩[13]Silent AI Takes Social Media by Storm: Is Jev Truly a Groundbreaking New Paradigm Redefining AI Technology?[8]。
5.3 已知的弱点
独立测试揭示了几个问题:
- 对措辞敏感:把问题写得越谨慎、越间接,一致率越低
- 非英语准确率不一:官方称“擅长英语,其他语言准确率不一”
- 超大选项集退化:77 个选项的任务上,Jev 0.81,对照模型 0.87
六、Jev 的真正意义:AI 的“物种分化”
6.1 一个被忽视的架构问题
过去四年,整个行业把几乎所有的算力、资本和工程资源,都压在“教模型说出更流畅的人话”上。
大家习惯了用百亿甚至千亿参数的庞然大物,先吐出一长串思考过程,再包装成礼貌体贴的自然语言,最后让开发者用复杂的正则表达式把需要的答案抠出来Jev,让全球程序员玩疯了 | 极客公园[9]。
但软件系统真正需要的,往往只是一个数字、一个标签、一个概率。
6.2 “快慢分工”的验证
Jev 验证了 Agent 架构的 “快慢分工” 路线:
- 昂贵的大模型负责规划等“慢思考”
- 高频、原子化的“快判断” 交给 轻量决策模型完成
负责组装与调度这套分工的工程层,在业界被称为 HarnessJev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]。
Jev 不是要取代大模型,而是要成为大模型身边的“神经元”——那些廉价、反应灵敏、数量庞大的判断节点。
6.3 但需要冷静看待
Jev 的爆火有真实的工程价值,但也有需要审视的地方:
- 基准不独立:所有官方分数来自内部评测,参考答案由其他模型取平均前OpenAI研究员推出首款“System One”模型引爆AI圈:不生成文本,专为机器做快速决策[3]
- 商业模式待验证:输出免费、输入每百万 Token 0.042 美元被质疑以融资补贴价格
- 准确率与前沿大模型大致持平,优势在速度和成本,不在“更聪明”
Almeida 在博客中的回应是:“非凡的主张需要非凡的证据”,并公开了四个评测工作流供复现。他说:“我们喜欢怀疑者,我们自己也是怀疑者。”前OpenAI研究员推出首款“System One”模型引爆AI圈:不生成文本,专为机器做快速决策[3]
七、对你 WeClaw 的可能价值
Jev 的定位——Agent 运行中的高频小判断——和 WeClaw 的架构有天然的契合点。
你目前可能用 Gemini 意图代理在做的判断,有一部分可以换成 Jev 或它的开源复现:
| WeClaw 场景 | Jev 能做什么 |
|---|---|
| 意图路由 | 用户消息该走 chat / search / publish / image? |
| 消息过滤 | 这条消息是广告、闲聊还是真实指令? |
| 模型路由 | 这个请求该交给便宜模型还是强模型? |
| 输出检查 | 某个 agent 的回复是否安全/合规? |
| 上下文压缩 | 哪些历史工具调用值得保留? |
这些判断的共同点是:选项有限、答案明确、需要快速返回。用生成式模型做这些,是在用“写作文”的能力做“答选择题”的事。
Jev 的价值不在“更聪明”,而在“同样的判断,快 10 倍、便宜 10 倍”。
一个可以关注的路线
Jev 目前尚未向中国大陆开放Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]。但 APUS 的开源复现(fast-browser-use)已经证明:用本地开源模型(Qwen3.5-9B)在端侧实现 Jev 的决策范式,在工程上是可行的APUS开源Jev跨平台复现:国产模型实现秒级决策[10]。
而且这个路线有一个 Jev 官方 API 没有的优势:数据不出本机。对于你的个人知识库场景,这一点可能比速度更重要。
Jev 的爆火,本质上是一个被长期忽视的需求终于被看见了:
Agent 不需要每一步都“说话”。它需要的是,在正确的地方,快速、便宜、可靠地做出判断。
而“判断”这件事,值得一个专门的模型。
- Jev模型是什么?TypeSafe“决策模型”爆火后,APUS交出全球首批跨平台开源复现[6]
- Jev,让全球程序员玩疯了 | 极客公园[9]
- GitHub - socai-io/jev-social: Jev-powered Instagram, TikTok, and LinkedIn research: typed routing, real browser evidence, streamed post cards, video capture, and cited socai reports. · GitHub[14]
- 刷屏爆火的“不说话”AI Jev 真的是AI新范式吗?[5]
- 不会说话的Jev,为什么爆火?[1]
- 教ChatGPT说话的人 推出「哑巴」AI模型[2]
- 最火哑巴模型Jev加上微信,直接治好了我的低情商- DoNews专栏[7]
- Meet Jev, the new AI model built to make decisions instead of generating text[15]
- 开源一个jev playground,集成了官方的演示案例,也可自定义 - 资源 - 大佬说[16]
- APUS开源Jev跨平台复现:国产模型实现秒级决策[10]
- ChatGPT发明者打造新型AI模型引发开发者热潮[4]
- Najboj razširjene arhitekture VJM-jev so le-kodirmik (_angl[17]
- 前OpenAI研究员推出首款“System One”模型引爆AI圈:不生成文本,专为机器做快速决策[3]
- 实测Jev:没那么强,但足够给有些乏味的AI圈带来新刺激-品玩[13]
- The Expert Who Trained ChatGPT to Speak Developed a New "Mute" AI Model[18]
- GitHub - brainstormity/Jev-X-Sentiment-Analysis · GitHub[12]
- Silent AI Takes Social Media by Storm: Is Jev Truly a Groundbreaking New Paradigm Redefining AI Technology?[8]
- 刷屏全球AI新顶流Jev全攻略 零语言交互玩法深度解析[11]
参考来源
[1] https://www.sohu.com/a/1079005971_120603108?scm=10001.7746_13-119000.0.0-0-0-0-0.0&spm=smpc.channel_354.block3_32_P7Ovbu_1_fd.16.1789976013663fHhff1x_7746
[2] https://eu.36kr.com/zh/p/3988372551990276
[3] https://m.thepaper.cn/detail/34108537
[4] https://www.zhiding.cn/models/2026/0920/3199944.shtml
[5] https://eu.36kr.com/zh/p/3988164509711361
[6] https://tech.cnr.cn/techph/20260920/t20260920_527819594.shtml
[7] https://www.donews.com/article/detail/6885/107606.html
[8] https://eu.36kr.com/en/p/3988164509711361
[9] https://w.geekpark.net/news/370758#comment
[10] http://www.news.cn/tech/20260921/8f1c9bd6a9254e629383f1ac51e0d27d/c.html
[11] https://eu.36kr.com/zh/p/3991613388241920
[12] https://github.com/brainstormity/Jev-X-Sentiment-Analysis
[13] https://www.pingwest.com/a/317597
[14] https://github.com/socai-io/jev-social
[15] https://indianexpress.com/article/technology/artificial-intelligence/meet-jev-new-ai-model-from-chatgpt-inventor-10887591/
[16] https://locdd.com/t/topic/93129
[17] https://repozitorij.uni-lj.si:443/Dokument.php?id=212549&lang=slv#10#4
[18] https://eu.36kr.com/en/p/3988372551990276