0.8元的牛模王:GLM-5.3-Flash 如何改写大模型效率竞赛

本文复盘 GLM-5.3-Flash 从 Ox-Alpha 匿名爆红到官宣开源的全过程,揭示其以低价、多模态、国产算力和工程优化重塑大模型竞争规则。


破晓:GLM-5.3-Flash 如何重写AI竞赛规则

副书名:国产大模型效率革命与算力突围全记录



前言 从「牛来」到「牛模王」——一场精心策划的沉默突袭

一头没有名字的牛,替一家公司回答了一个几乎所有人仍在回避的问题:当聪明不再稀缺,稀缺的是什么?

——题记

一、一头无名之牛的六天

2026 年 8 月 20 日深夜,聚合全球大模型流量的调用平台 OpenRouter 上,悄然多出一个此前从未存在的条目:stealth/ox-alpha。没有厂商徽标,没有技术文档,没有定价页,甚至连一句自我介绍都没有。任何人都可以免费接入,唯一的条件是——别问它从哪里来。

此后的六个昼夜,注定要被行业反复讲述。上线首日,这个无名模型径直登顶平台使用量榜首,把 OpenRouter 有史以来的单日 token 纪录抬高了约四倍;紧接着它又在编程评测榜 OpenCode 上掀翻了看似固若金汤的秩序,终结 DeepSeek 连续五十六天的霸榜。匿名期内,累计超过五十万亿 token 的流量从这个代号奔涌而过,单日峰值约 62T,高峰时段的使用量一度达到排名第二的 DeepSeek 的两倍以上。承载这一切的,是一个没有品牌、没有发布会、没有任何营销投放的对象——严格说来,它甚至从未承认过自己是「一件商品」。

8 月 26 日晚间,谜底揭晓。智谱确认 Ox-Alpha 正是其 GLM 系列的新一代原生多模态模型,随即开放权重下载(MIT 协议)、上架 HuggingFace,公布了模型架构、部署细节,以及那份真正震住所有人的价格表:每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。此时的综合评测结果也一并落地:Artificial Analysis Intelligence Index 给出 57 分,与海外的标杆产品 Claude Opus 4.8 持平——而这个分数对应的账单,约为对方公开价格的四十分之一。次日上午开盘,港股智谱跳空高开逾 8%、盘中一度涨超 10%,上证科创板芯片设计指数收涨 5.57%,存储与 AI 芯片板块领涨,资本市场的红色箭头为这场沉默突袭补上了最后的注脚。

回头看,这六天里最反常的一幕莫过于:一家公司把自己最重要的新品悄悄摆上货架,一言不发,然后看着全世界把它抢购一空——而抢购者中的绝大多数,事先并不知道卖东西的是谁。这一幕能够成立,靠的不是运气的眷顾,而是一套精密到近乎冷酷的发布策略。它的学名,叫匿名测试;它的通俗版本,叫隐身上线。

潮流可以被制造,但只有足够克制的人才能控制它的流向。这是这次事件给出的第一个启示。

二、「牛来」之名:一场全网参与的侦探剧

面对一个拒绝自报家门却强得离谱的模型,社区的第一个反应朴素而热烈:给它起名字。Ox 意为公牛,恰逢同名题材电影《牛来》正在国内热映,中文开发者几乎不需要商量就完成了命名——先是「牛来」,随后在梗图与段子的助推下晋级为更具江湖气的「牛模王」;海外的 Discord 社区则称它 Bull King。后来有一位网友的总结广为流传:今年春天那匹马甲叫 Pony(马),这一顶着牛角现身,「无论从分类学还是从『牛马』的隐喻来看,都很合理」。

比起名更有看头的,是一场自下而上组织起来的侦探战。既然官方沉默,社区便决定亲手揭开面纱:有人比对分词器处理生僻字符串时的切词癖好,有人构造针尖一般的探针问题,试图撬出训练数据的口音,还有人整理它在特定题型上的错误风格。8 月下旬,独立研究员发布了基于分词器指纹与探针测试的技术报告,给出「99% 把握」指向智谱的判断;预测市场上,超过九成的筹码押在了同一家公司身上;X 平台上有知名爆料账号宣称自己早已知道答案却拒绝揭晓,「你们都会非常兴奋——它不是你们想的那样」;与此同时,也有海外科技媒体依据分词器特征提出了另一个方向的推断,认为它或许出自微软的 MAI 系列。真伪莫辨的线索满天飞,每一份新证据都能收割一轮转发与争吵。这场没有奖金的全民柯南大赛,参与热情却始终居高不下——因为在开源与闭源缠斗不休、真假消息彼此污染的年代,猜中一头牛的主人,本身就是一种社区荣誉。

8 月 26 日夜,侦探剧散场。指纹报告得到了官宣盖章,预测市场等来了兑现,五十六天的旧王朝目送新王顶着一张牛头面具完成加冕。

悬念是注意力时代最廉价也最昂贵的资源。通常它需要靠营销预算一层层堆出来;这一次,它由产品实力自己挣了出来。

三、为什么选择沉默:匿名测试策略解密

为什么是隐身上线,而不是锣鼓喧天的高调发布?要理解这个选择,得先看懂传统发布剧本的裂缝在哪里。

标准流程人人都熟悉:提前一周放出预热海报,发布日高管登台亮相,逐页演示跑分图表,媒体通稿整齐划一出街。这套仪式的代价不在预算,而在失真——围观者的判断先于体验抵达,好奇心在产品被验证之前就已透支。轮到用户真正开口时,公共讨论早已被站队与互喷填满,那些朴实的使用感受反倒没有了位置。预告越隆重,落差风险越高;发布会越密集,可信度越稀薄。这是过去几年里一再上演的循环。

匿名上线把这组顺序彻底倒转过来。摘掉名牌,等于摘掉滤镜:盲测状态下,每一次调用都来自真实需求,每一句好评都无法被归因于品牌偏爱,口碑由此获得了难得的纯度。免费敞开供应,等于把压力测试拉到极限:全球开发者抱着白嫖的心态往死里锤它,速度、稳定性、上下文极限、报错姿态,短短几天内在生产环境的探照灯下无所遁形——任何在发布会上藏得住的毛病,在这里都藏不住。等到谜底揭晓、价签亮出的那一刻,先前所有免费攒下的信任瞬间折算为性价比的铁证:先证明值钱,再证明便宜;倘若颠倒为先喊便宜再求认可,效果便会一泻千里。

对智谱而言,这不是即兴发挥,而是第二次操盘。今年春节前夕,代号 Pony Alpha 的匿名模型低调现身,五天后揭晓身份为 GLM-5,那是这家公司第一次吃这只螃蟹;半年后的这一次,从登场时机的挑选、匿名期的流量节奏,到揭晓时刻的落子拿捏,整套装束明显更为老练。北京大学特聘研究员张有鱼后来将其提炼为一套完整的方法论:让真实负载先行完成产品的终极验证,再让市场投票替代媒体定调。

硬币自然还有背面。当每一家公司都学会戴着面具登场,悬念本身也会迎来通货膨胀——就在揭晓日之后,《有头有脸的大模型公司,集体搞起「匿名公测」》之类的标题开始密集刷屏。匿名一旦常态,用户迟早不再为未知兴奋,转而为已知的安全感支付溢价;今天的奇袭战术,可能就是明天的红海内卷。窗口期红利永远属于先行者:属于那个赶在所有人都戴上面具之前,先把脸露出来的玩家。

沉默不是缺席,而是把话语权暂时抵押给了产品本身——抵押到期那天,连本带利一起兑付。

四、核心命题:当效率成为新的护城河

把这场喧嚣拧干到只剩一句话,便是贯穿全书的命题:大模型竞赛的评价标尺,正在从「谁更聪明」切换到「谁更便宜地聪明」。

这并非对性能的否定。Artificial Analysis Intelligence Index 综合评分 57 分,与 Claude Opus 4.8 持平,超出自家上代旗舰 GLM-5.2 与 DeepSeek V4 Pro 正式版的 53 分——在最硬核的能力坐标系里,这款以 Flash 命名的模型稳稳站上了前沿的及格线,还顺带纠正了一个流行误会:Flash 的语义是「又快又便宜」的全新产品线,而非旗舰的缩水阉割版,它是一具为效率重新打造的基座。真正的变化发生在坐标系的另一根轴上:同等智能水位之下,它的输入价格只有对位王牌的四十分之一;同样的吞吐承诺背后,承载全部推理流量的,是十万张以上的国产芯片集群——据《晚点 LatePost》报道,供应商传为华为昇腾、摩尔线程与海光三家,智谱对此未予置评——并且端到端服务性能较初始基线提升了整整三倍。跑分之外有价格,价格之外还有五天五十万亿 token 的真实生产流量,这三重证据彼此咬合,构成了难以辩驳的完整链条。

由此引出全书的关键概念之一:斩杀线。当一个新模型把价格压到某个临界点之下,此前世代的竞品会在一夜之间失去性价比——价格本身升格为武器,再华丽的参数表也拦不住客户迁移的脚步。0.8 元这道价签,就是画在本轮牌局桌面上的一条刻痕,它强迫在场的每一位玩家直面同一道题:你的单位智能成本,撑得住你的商业模式吗?

这条效率曲线的另一端,拴着更深的地缘变量。大洋彼岸,OpenAI 在 Hot Chips 上公示了自研推理芯片 Jalapeño 的实测成绩:运行多个主流开源模型时,每瓦吞吐可达英伟达新一代 GPU 的约 1.5 至 1.9 倍——头部实验室的降本决心一目了然。而此岸,GLM-5.3-Flash 以十万张国产芯片扛住全球真实负载的验证,让中国算力自主路线第一次通过了商业闭环的自证。SemiAnalysis 的评语因此被广泛引用:硬件效率与单 token 成本可比英伟达 GPU,CUDA 护城河再受考验。架构的原创性之争、芯片的自主性之争、定价的攻防战,三条战线在同一款产品身上交汇——如此密集的事件叠合,在过去几年的行业史上并不多见。

聪明的价格全面跳水之日,便是竞争力的定义被改写之时。旧地图上依然标着性能的海拔,新大陆上的人们已经开始丈量成本的河道。

五、全景预览与全书结构

为了让这场复盘有迹可循,本书搭起了三层脚手架:技术与架构层,关心一台效率机器是如何被设计出来的;产业与算力层,关心它凭什么能在国产芯片集群上稳定运转;商业与格局层,关心价格背后的经济学、市场的连锁反应与竞赛规则的重写。三层各有主线,彼此咬合,共同回答同一个疑问:为什么偏偏是这一次发布,让许许多多的从业者产生了「规则变了」的体感。

全书九章的展开顺序如下。第一章回望发布之前的棋局,拆解集体涨价潮留下的需求真空,以及春节档 Pony Alpha 首演攒下的战术经验;第二章进入引擎室,拆解 320B 总参数搭配 18B 激活的 MoE 架构、从九十二层减至四十五层的瘦身哲学与三十万亿 token 多模态语料的训练逻辑;第三章逐日复盘 Ox-Alpha 匿名测试的完整时间线,还原流量狂飙、指纹猎捕与预测市场押注的全过程;第四章钻进机房,检视十万张国产芯片承载的生产验证与自研推理引擎的接力优化;第五章摊开账本,计算 0.8 元定价背后的经济学,分辨屠夫刀法与自然成本之间的分界;第六章追踪余波,串联港股盘面、科创芯片指数、开发者社群与海外舆论的多重回响;第七章抬升视角,论证行业竞赛如何从性能叙事换轨至效率叙事;第八章走进千行百业,推演创业团队的真实成本账与大模型公共基础设施化的现实路径;第九章聚焦智谱自身,解剖从清华系基因、内部决策博弈到「先做后说」的组织哲学。结语收束全局,并附上作者对写作过程本身的坦诚反思;书末附录提供技术参数、匿名测试时间线、性能对比、API 定价横向对比四类速查数据与术语索引,供随手检索。

最后交代几句体例。书中凡属未能二次核实的信息,一律冠以「据报道」「有分析认为」之类的限定词;所有叙述与判断截止于 2026 年 8 月 27 日,这一天之后的任何进展都不在本书范围内。此外,本书无意复述任何口号,只打算老老实实回答两个问题:这件事为什么会发生,以及它究竟改变了什么。

现在,请随我们回到 8 月 20 日的深夜——那一刻,牛刚刚到场,还没有人认识它。

第一章 暗流涌动——发布前的 AI 格局与智谱的伏笔

2026 年 8 月 26 日之前,大模型行业正处在一种奇特的紧绷状态里。

如果你只看新闻标题,会觉得这是个烈火烹油的好光景。Anthropic 的 Claude Opus 4.8 刚在 5 月底发布,基准测试全面超越上一代,常规模式定价一分没涨——每百万输入 token 5 美元、输出 25 美元,快速模式还降到了此前的三分之一[15]。OpenAI 的 GPT-5.5 依然是闭源世界的天花板,至少纸面上看如此。智谱自己呢?截至 2026 年一季度,其 API 调用定价累计提升约 83%,调用量反而增长约 400%——按照华尔街见闻等媒体的报道口径,量价齐升,怎么看都是个好生意[1]。

但水面之下,暗流正在转向。

这场转向从 2025 年春节 DeepSeek R1 横空出世就埋下了伏笔。那个性能比肩 OpenAI o1、价格只有后者三十分之一的模型,像一把刀架在了所有做 B 端私有化部署的公司脖子上。智谱做商业交付的员工那年春节没一天安生,一天接五六个客户的电话,大部分是来问能不能部署 DeepSeek[1]。将近三成客户流失,就是这么来的。

你很难说这完全是坏事。真正的转折点发生在 2025 年 5 月——智谱开了一场紧急战略会,核心议题只有一个:下一阶段的模型往哪个方向走。当时在场的知情者后来对媒体回忆,那个会几乎决定了智谱接下来的命运[1]。清华系出身的团队赌了一条当时看起来并不性感的路线——Coding。后来的事我们都知道了:GLM-4.5 在 7 月底上线,Coding 能力意外爆发;GLM-5.2 拿下全球开源模型 SOTA;据公开报道,智谱的 ARR 冲到 10 亿美元量级,港股上市后市值的报道口径一度摸到 1.3 万亿港元[1]。烧钱换份额的阶段显然还没结束——按其披露材料的模糊口径,这家公司的研发投入强度达到营收的四倍以上——但故事的主线已经换了。

把镜头拉远一点,会发现这种紧绷感来自一种集体性的错位:大厂在用补贴换场景,创业公司在用融资料养模型,腰部服务商在用定制项目填补毛利——三层人各自精明,合起来却在同一条死胡同里排队。所有人都在等一个信号,证明这门生意除了「继续烧钱」之外还有第二种活法。信号没来之前,任何一条融资传闻都能搅动情绪;信号来之后,过去两年积欠的所有旧账都会被重新翻出来算。

一、2025 年国内大模型竞赛复盘:从 GLM-4.5 到 GLM-5.2 的演进路径

要理解 2026 年 8 月那场反转的结构,得先把时间拨回 2025 年春天。

DeepSeek R1 的杀伤力在哪里?不在跑分,而在它的开源属性。权重开放意味着任何一家企业都能把「接近 o1 的能力」下载到自己机房里,配上打折的服务器就开工。对甲方来说,这天然是一枚谈判筹码——无论最后买谁家的服务,先拿 R1 的报价把价格打下来再说。于是智谱的交付团队接到的那通电话,本质上是每次竞价都输给了一个不要钱的对手。流失的三成客户,买的从来不只是模型,还有「不被卡脖子」的心理安全。

2025 年 5 月的战略会之所以关键,是因为它逼出了一个残酷的选择题:跟着价格战往死里卷成本,还是换一条赛道重新定义胜负手。智谱选择了后者。这套判断的逻辑其实朴素得近乎笨拙——既然拼单价必输,那就拼别人做不到的任务复杂度。代码是这个选择的天然落点:它有客观的对错,能被编译器和测试套件无情地验证;它足够难,能把模型的真实工程能力与「背答案」区分开;它又恰好站在企业付费意愿最强的象限里,一套能替人写系统、改遗留代码的模型,客户愿意为它付真金白银。

这个赌注的兑现速度超出了所有人的预期。7 月 28 日晚间,智谱发布新一代旗舰模型 GLM-4.5,在 HuggingFace 与 ModelScope 平台同步开源,权重遵循 MIT 协议,官方定位是「专为智能体应用打造的基础模型」[4]。参数规模 355B 总参、激活 32B,共 92 层。在包含推理、代码、智能体的综合能力上,官方宣布达到开源 SOTA,真实代码智能体的人工对比评测实测国内最佳[4]。发布第二天,用户涌入太多,智谱清言、z.ai 和开放平台不同程度地出现了速度变慢、任务中止的情况,团队不得不连夜发了一篇《关于机房 GPU「冒烟」的一些声明》[5]——这份狼狈,恰恰是 Coding 这条路走通了的第一份实证。

值得记一笔的还有 GLM-4.5 的定位措辞:「专为智能体应用打造」——推理、代码、工具调用被当作同一件事来做,而不是三个头的缝合。这为后来 5.x 时代的路线定下了基调:先押应用形态,再反推架构。当彼时不少团队还在把通用问答当唯一主战场时,智谱已经把资源挪进了那条别人看不上、企业却最肯花钱的窄门。窄门的另一面是不够性感——2025 年下半年的媒体叙事里,Coding 听起来远不如视频生成炫目,代码评测也不如文生图容易刷屏。冷板凳坐得住,后来才有资格谈爆发。

再往下,这条线越走越清楚。当年下半年到年底之间,GLM-4.7 系列登场,并且第一次出现了带 Flash 后缀的型号——「又快又便宜」的产品线语义,此时已经在智谱的产品字典里悄然建档。2026 年 2 月 11 日深夜,被开发者追踪数日的匿名模型 Pony Alpha 揭晓身份,就是新一代旗舰 GLM-5:总参数 745B,78 层,256 个专家中每次激活 8 个;在 Coding 与 Agent 能力上拿下开源 SOTA,真实编程场景的使用体感逼近 Claude Opus 4.5,擅长复杂系统工程与长程 Agent 任务[7][8]。年中,GLM-5.2 上线并开源,方向进一步收敛到 Coding 与长程任务,上下文窗口拓展至百万 token 一级,在 Artificial Analysis 综合榜单上与 Anthropic、OpenAI 同列全球前三,坐稳开源模型头把交椅[6];在全球百万用户参与盲测的前端开发评估系统 Code Arena 上,它的得分同样名列前茅。版本号跳动的节奏本身也在说话:从 4.5 到 5.2,大版本的间隔被压缩进半年量级,且每一次迭代都带着清晰的靶心——没有一次是为发而发的例行刷新。

时点 型号 关键规格 标志性意义
2025 年 7 月 28 日 GLM-4.5 355B 总参/32B 激活/92 层 战略转向后的首个兑现,「机房冒烟」式出圈
2025 年下半年 GLM-4.7/4.7-Flash 未公开细分 Flash 命名第一次进入产品序列
2026 年 2 月 11 日 GLM-5 745B 总参/78 层/256 选 8 专家 以 Pony Alpha 之身揭晓,Coding 与 Agent 开源 SOTA
2026 年上半年 GLM-5.2 百万 token 上下文 专注 Coding 与长程任务,开源阵营登顶
2026 年 8 月 14 日 GLM-5.3 744B 总参/40B 激活(纯文本旗舰) 「Scaling post-training is all we did」
2026 年 8 月 26 日 GLM-5.3-Flash 320B 总参/18B 激活/45 层 隐身模型 Ox-Alpha 认领并开源,本书记主角

回看这条演进路径,两条线索始终并行:明线是性能节节攀升——参数更大、层数更多、榜单名次更好;暗线则是效率约束一步步收紧——MoE 的稀疏化比例越来越激进,Flash 型号从陪跑走向独立叙事。很多评论者只看见了明线的风光,却低估了暗线的耐心。

单看跑分轨迹还不够,须配上采纳证据才有意义——这也是全书衡量任何榜单的一把尺子。GLM-4.5 时期,「开源综合第一」更多被视作学术圈的好消息,圈内叫好、产业观望;到 GLM-5 揭晓,风向变了,媒体的参照物从开源同行换成 Claude Opus 4.5 这样的闭源旗舰,评价维度也从「分数追平」推进到「复杂系统工程与长程 Agent 任务的体感能否对标」[7];再到 GLM-5.2,据第三方评测转述,它在多个长程编码基准上压制 GPT-5.5,而成本只相当于对方的六分之一左右——具体倍数各家口径不一,趋势却高度一致:国产模型的每一次名次跃迁,几乎都伴随一次真实场景的能力外溢,而不只是在榜单右上角添一个孤零零的新点。能力曲线与成本曲线之间的这道剪刀差,正是后来 Flash 阵地战得以展开的物理前提。

复盘至此,答案其实已经写在墙上了:这不是一家公司在追热点,而是一支团队在同一张地图上提前画好了两个终点——一个用来立威,一个用来收割全行业最普遍的需求。

二、集体涨价潮解析

如果说 2025 年的关键词是「闪击」,那 2025 年下半年到 2026 年夏天的关键词,就是「回调」。

回调不是从 2026 年才开始的。早在 2025 年 2 月 9 日,DeepSeek 就结束了 V3 接口的优惠体验期,把免费午餐收回到了正常价格——那是国内 API 价格的第一次试探性松绑,市场的注意力却被 R1 的热度盖了过去。真正意义上的转折发生在 2025 年 8 月下旬:8 月 21 日 DeepSeek 发布 V3.1,同时宣布自 9 月 6 日起调整 API 定价并取消夜间优惠,推理与非推理模型统一定价,输出价格调整为每百万 token 12 元,最低档价格较过去上升约 50%[11]。紧接着的行业统计给出了一个几乎颠覆直觉的画面:有深扒 17 家厂商最新定价的分析发现,超过七成厂商处于涨价通道,当年被视为红海的国内 API 市场,输出均价也从约 12 元一路抬升到约 22 元的档位[7][12]。

把这两年多的关键节点排成一张表,转向的轨迹一目了然:

时间 事件 含义
2025 年 2 月 9 日 DeepSeek 结束 V3 接口优惠体验期 第一次试探性松绑,价格战尚未终结
2025 年 9 月 6 日 V3.1 新价生效,取消夜间优惠 统一定价登场,错峰逻辑浮出水面
2026 年 7 月 16 日 Kimi K3 发布,输出定价 100 元 开源阵营第一次按「智能密度」自信报价
2026 年 8 月 4 日 V4 Flash 正式版登顶,「斩杀线」冲上热搜 最低价与最强性价比短暂合一
2026 年 8 月 6 日 DeepSeek 公告将整体上调 API 定价 九天倒计时启动
2026 年 8 月 15 日 V4-Flash 新价落地,闲时输入 1.5 元、输出 4.5 元 划线者亲手抬高了那条线

烧了两年的价格战,为什么会突然熄火?

第一层原因是物理账。2025 年下半年以来,云端 GPU 租金上涨,高端芯片供给收缩,而 Agent 类应用的爆发让单次任务的 token 消耗较传统问答放大了几十倍——一个自动化任务动辄就是几十轮工具调用、上百页上下文来回搬运。MoE 架构再怎么省算力,当请求量以万亿级别涌入的时候,瓶颈就不再是算法问题,而是物理问题:你需要更多的机器,而机器要花钱。连一贯抠门的 DeepSeek 都躲不开这道算术。有行业媒体算了笔账:V4 Flash 0731 Max 虽然聪明,却是个实打实的「话痨」,别的模型几千万到 1 亿 token 能完成的测试,它要烧掉约 2.1 亿 token[14]。有传闻说 DeepSeek 的定价哲学是「十个月收回基础设施成本」[2],这个逻辑在调用量暴增面前,本身就是一种自我实现的预言。

分时计价则是这道算术里最诚实的设计。DeepSeek 官方的解释是用市场化价格引导任务错峰、平抑白天工作时段的算力负载,逻辑上无懈可击——训练集群的成本是刚性的,让深夜闲置的电力去消化不那么着急的任务,是任何机房运营者的本能。麻烦在于,Agent 类工作负载几乎全是「人来疯」:上班族白天触发自动化流程,黄金时段扎堆跑批,夜里的闲时折扣无人问津。于是精心设计的错峰机制滑向单边涨价,闲时之外的档位成倍上调,普通开发者看到的只是一张一夜之间变得难看的价目表。供给刚性如石,需求又软不下来,价格只能向上找平衡。

第二层原因是结构性的:开源没有护城河,性能才是定价权的唯一来源。Kimi K3 是最好的注脚。2026 年 7 月 16 日,月之暗面发布拥有 2.8 万亿参数的 Kimi K3,规模一举刷新全球开源模型的纪录,原生上下文做到了百万 token 一级;它的 API 定价则直接跳到输入 20 元、输出 100 元(缓存命中时输入 2 元),分别约为上一代 K2.6 的 2.1 倍和 2.7 倍,输出价格直逼海外旗舰[13]。有意思的是,市场并没有用脚投票:发布三天后请求量居高不下,据当时报道,C 端新用户订阅一度被迫暂停;据媒体转述,摩根士丹利的研报也没有把高定价视为竞争短板[13]。涨价潮的本质在这里露出了底牌——行业不再比谁更便宜,而是比谁的单位智能更值得买。

第三层原因是资本市场要求的收入证明。涨价这件事,从来不只是算一笔成本账,它同时是在讲一个收入故事——给正在推进的融资、给已经上市或即将上市的股价、给持币观望的投资人看「这门生意能赚钱」。当一家家的估值都建立在「scaling 曲线还很陡」的前提上,API 价目表就成了最直接的信任状。

但故事很快出现了戏剧性的翻转。2026 年 8 月 4 日,「DeepSeek 斩杀线」上了微博热搜。V4 Flash 正式版在 Artificial Analysis 那张著名的「成本-性能」散点图上站到了最优位置——比它贵的没它强,比它弱的没它便宜;据钛媒体的拆解,它以约 0.027 美元的单任务成本,把全球近七成「能力不及它、价格却比它贵」的模型压在了生死线下[2]。调用量随之登顶 OpenRouter,8 月 1 日单日在 OpenCode 上处理了 8 万亿 token,超过了该平台全部 400 多款模型的日均总量[2]。彼时它的报价还是缓存未命中输入 1 元、输出 2 元——同一张价目表上,Kimi K3 写着输入 20 元、输出 100 元。开发者沸腾了,社区把这条定价线叫做「斩杀线」,听起来像是 DeepSeek 给全行业划下的生死状。

然后,反转来了。8 月 6 日,DeepSeek 在后台发了条简短公告:计划整体上调 API 定价,涨幅较大,请合理安排使用[2]。仅仅九天之后,新价格落地——V4-Flash 闲时价涨到输入 1.5 元、输出 4.5 元,高峰时段还要更高[2]。调用量登顶的荣耀背后,据每日经济新闻援引 OpenRouter 数据的测算,那是全球模型每周 75.3 万亿 token 盘子里的第一名,也是最贵的电力账单[12]。提价之后,有运营侧的开发者笔记观察到其用量出现明显回落,个别渠道甚至流传着「腰斩」的说法——不过这类数字出自第三方测算而非平台披露,姑且听之。

行业刚刚为「斩杀线」欢呼过,转头就看见划线的人自己把线往上挪了。至于其他玩家的跟注——比如外界风闻百川可能将 Baichuan-5-Turbo 限时调降至更低输入价位——在本书完稿的时点上仍属盘口上的传闻与情景推演,只能留给下一个交易日去验证。可以确定的只有一件事:当所有玩家都在往上挪线的时候,那条旧线与新线之间的空隙,就成了 2026 年夏天最诱人的猎场。

三、海外巨头的傲慢与盲区

就在国产模型集体向上调价的同一个窗口期,海外巨头做了一个方向相反的动作:降价。

OpenAI 对主力系列的主动下调,发生在这场涨潮的正中间——两家头部厂商的价目表一上一下,把「定价权到底归谁」这个问题摆上了台面[13]。表面上看,这是两种商业模式的分歧:一边靠 API 走量盈利,一边靠订阅和企业合同锁定现金流。但深层处是一个共同的盲区——无论是降价的 OpenAI 还是涨价的 Anthropic,都没有认真对待人民币 5 元以下的那个价格带。

以 Claude Opus 4.8 为例:每百万输入 token 5 美元、输出 25 美元,折合人民币输出近 170 元。它在基准测试上赢了 GPT-5.5,却当众被人拆过台——5 月底发布现场,DHH 和 Redis 之父这类资深工程师当场演示:跑分确实是赢的,编码王座却不稳了[15]。这句话的价值不在于嘲讽,而在于它揭示了海外巨头的共同姿态:把实验室指标当成产品力的充分条件,默认市场的评价体系与自己相同。他们盯住的是愿意为一分差距支付十倍溢价的高端客户,并对长尾开发者、中小代理和个人玩家的价格敏感度视而不见——这个群体没有预算买 170 元的输出,却有无限的想象力把 4.5 元的能力用到极致。

价格敏感人群恰恰是中国工程师浓度最高的地方。过去两年,正是这群人把 DeepSeek、把各家开源模型捧成了全球流量明星——他们不签年度合同,不用采购流程,看到好东西当天就接入生产环境,第二天就写出布道帖。OpenRouter 上那些横扫千军的调用量奇迹,几乎每一个都始于此。全世界最饥渴的需求和全世界最擅长做「便宜」的供给侧,就这样隔着一个太平洋互相看不见。

海外巨头并非看不见这片空白,而是看见了也下不去脚。第一重障碍是成本结构:硅谷的推理账单里嵌着当地的人力、电力与合规开销,盈亏平衡点天然悬在比人民币几块钱高一整档的位置,向下补位近乎自杀式竞争。第二重是组织形态:经营长尾开发者生意,需要全天候的社区运营、即充即用的本地支付通道,以及能随意抛出中文梗的品牌人格——这些能力在跨国公司的预算科目里根本没有对应栏目。第三重才是根子上的傲慢:评估体系的傲慢。榜单上一个身位的领先,在他们眼里足以覆盖十倍的价格差距,于是国内市场的一切激烈竞争都被归因为「局部内卷」,不值得亲自下场。

更耐人寻味的是双轨并存的内在合理性。OpenAI 向下降价、Anthropic 原地坚守,方向相反,判断却是同一个:美元区的每一分钱都必须花在守住技术代差上。代差是全部溢价的地基,地基一旦松动,再高的价签都会失去意义;而在他们的视野里,人民币价格带上的绞杀与代差攻防无关,属于另一个次元的战争。这种隔离心态过去确实成立——直到有人跑到他们的主场、按英文社区的用法、把他们最引以为傲的开发生态流量整片抢走,隔离才骤然变成失守。

颇具讽刺意味的是,「轻量廉价」的产品哲学并不是没有人懂。谷歌早已用 Gemini 的 Flash 后缀证明,小杯型号同样能撑起惊人的调用量;只是这套哲学走到定价环节便悄然打折——美元体系里的 Flash 报价,依然是绝大多数中国长尾用户望而却步的数字。会做 Flash 与敢打斩杀线之间,隔着的从来不是技术鸿沟,而是愿不愿意纵身跳进绞肉机的决心。

至于某电商巨头据传追加订购 200 万块英伟达 GPU 的背景消息,也只是这轮军备竞赛式供给焦虑中的一枚注脚。最终谁能同时看清这片空白、又有产能把它填满,谁就握住了下一阶段的入场券。

四、智谱的伏笔:Pony Alpha 经验复用

要读懂智谱为什么敢在 2026 年 8 月出手,必须先回到半年前的第一场演习——Pony Alpha。

2026 年 2 月 6 日,正当马年春节前夕,OpenRouter 上突然出现了一个名叫「Pony Alpha」的匿名模型。制造商一栏留空,没有发布会,没有论文,免费提供 200K 上下文和 131K 最大输出[8]。开发者社区立刻炸了——这模型的编码和 Agent 能力接近 Claude Opus 4.5 水平。有人修改 system prompt 问「你是谁」,模型答了一句「I'm GLM」。分词器测试与 GLM 系完全一致。GitHub 上 vLLM 推理框架的一处 PR 更是把架构细节暴露了个干净:总参数量 745B,MoE 架构 256 个专家,每次激活 8 个[8]。

全网猜谜持续了五天。2 月 11 日深夜,智谱官宣认领:Pony Alpha 就是 GLM-5,当晚同步放出与 Opus 4.5 掰手腕的成绩单[7]。市场的反应立竿见影——据当时的媒体报道,相关消息曝光后智谱概念热度飙升,有报道称其股价两日累计大涨六成[9]。南方都市报记者随后从智谱方面获得确认,这场「霸屏海外的马甲戏法」就此载入国产模型的传播史册[8]。

这套打法后来被业界反复拆解,提炼成了一个方法论:先用匿名身份让产品力本身说话,避开「跑分高但体验差」的质疑;等社区的真实评价跑出来了,再用揭晓动作收割一轮口碑爆发[8]。整个周期就五天,推广成本几乎为零,曝光量以千万计[9]。

这场演习能够成立,仰仗三个缺一不可的前提。其一,底子必须真的硬——匿名期的每一次翻车都会被无限放大,马甲挡不住烂产品,反而替它递刀。其二,平台生态要足够开放而聚合,像 OpenRouter 这样的中转站天然聚拢了全世界最爱较真的工程师,等于免费搭起一座带裁判席的竞技场。其三,揭晓动作要有戏剧张力——悬念发酵五天,恰好卡在社区心理阈值之内:再久会泄气,再短攒不够声量。三个条件齐备,「零推广费撬动千万级曝光」才从一次运气沉淀为一套工艺。

这套工艺还有一个鲜被注意的副产品:它顺手完成了对传播链条的重新定价。传统发布会模式里,声量向头部媒体与少数评论者集中,曝光按刊例计价;匿名盲测则干脆拆掉中间商,把议程设置权交还给一线工程师——他们的实测帖就是通稿,复现实验就是分发,赞弹皆出自一张无法收买的脸。对正处在资本化关键窗口的公司而言,这种由局外人口吻垒起来的信任,比任何广告投放都难能可贵。

💡 独思时刻:我一直在想,Pony Alpha 这场实验最值钱的东西到底是什么。后来我拿自己的经历比照——我开发 Knowly 和 WeClaw 时,从来不发「产品公告」,而是先自己用三个月,剪贴板日志跑通、微信消息网关稳定了,才往 GitHub 上扔。不是不想宣传,是觉得「自己还没用顺手的东西,没资格让别人用」。智谱把这种内部压强测试外化成了社区盲测——让真实用户替你压测,让真实流量替你验证。这比任何内部 QA 团队都管用,因为用户不会按你的测试用例来。自己先用、再让社区用、最后才宣布——这个顺序,比发布会通稿有说服力得多。

半年之后,第二次演习开演。8 月 20 日,OpenRouter 又冒出一个隐身模型,代号 Ox-Alpha——中文社区管它叫「牛来」。上次马甲是马,这次是牛,网友调侃:「无论从分类学还是从『牛马』的隐喻来看,都很合理。」[10]有经验的社区几乎是熟练工式地完成了全套侦测:不到一天,分词器指纹、视觉 token 的逐位对照等多条证据链齐刷刷指向智谱,预测市场上超九成的筹码押注智谱,独立研究员给出「99% 把握」的判断。这一次匿名模型首日即登顶 OpenRouter,创下约四倍于历史纪录的单日 tokens 流量,终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜,五天累计流量超过 50 万亿 token,单日峰值约 62T,使用量一度达到 DeepSeek 的两倍以上——连硅谷吃瓜群众都学会了蹲守「猜爹」直播,反而群嘲起那些平时无所不能的 Agent 工具们集体失灵[10]。这些细节留待第三章展开,此处只需指出一点:若没有 Pony Alpha 打过样,社区对第二个马甲的容忍度和解谜热情都会大打折扣。隐性资产是需要复利的,两次演习之间一场发布会都没开,智谱赚走的正是这半年的利息。更微妙的是,两轮演习还给行业预装了接收装置:指纹比对脚本、逐位对照测试、蹲守式猜谜直播全套就绪,连「下一顶马甲该轮到什么动物」都成了公共话题。悬念本身成了基础设施,这是广告买不来的生态位。

五、为什么 Flash 版成为战略武器

现在把镜头拉回那个等了很久的问题:猎场出现了,伏笔也埋好了,为什么最终押上去的是一款 Flash?

答案要从智谱自己的账本说起。截至 2026 年一季度,据报道其 API 定价累计提升 83%、调用量增长 400%——这是一份标准的「涨价受益者」答卷:中国前十大互联网公司里有九家集成了 GLM,业务铺到 218 个国家和地区(均为其对外披露口径)[1]。CEO 张鹏在业绩会上把这层逻辑讲成了一个朴素的乘法:AGI 的商业价值等于智能上界乘以 token 消耗规模——前一项决定你每一格电有多聪明,后一项决定你卖出去多少格电[1]。这两个因子对应着两种打法:要么纵向把智能上界捅破天,卖给少数付得起天价的客户;要么横向把单位 token 的智能做到极致便宜,让天文数字级的普通调用堆出盘子。GLM-5 和 GLM-5.3 是前者,而 Flash 是后者。涨潮的行情里没有人担心前者卖不动,但真正稀缺的产能,是如何在不牺牲体验的前提下接住海量平价需求。

而 DeepSeek 的撤退把这个问题的紧迫性放大了无数倍。斩杀线一路上涨到输出 4.5 元之后,市场上骤然空出了一大片需求——那些原本活在 1 到 2 元价格带的 Agent 工作流、个人自动化、爬虫清洗、长文本批处理,一夜之间失去了性价比之选。它们不会消失,只会游移,等待一个新的宿主。谁能在几乎不损失能力的条件下以十分之一的价格接住它们,谁就把整个海量长尾市场收入囊中。

GLM-5.3-Flash 给出的答案是架构层面的彻底重构,而不是旗舰的缩水裁剪。看一组数字就能明白这条路有多反直觉:总参数 320B,与一年半前的 GLM-4.5 相当;激活参数从 32B 压到 18B;层数从 92 层砍到 45 层,几乎减半[3]。配合混合注意力等设计,注意力计算量降到 GLM-5.3 的约三分之一,KV 缓存降到约四分之一[3]。按主流 AI 评论圈后来沉淀的评价,这套方案是一组成熟技术的精密工程组合——线性注意力承袭 Mamba 时代的思路、稀疏注意力借鉴 DeepSeek 先发的论文方向、流形约束超连接改良自字节 Hyper-Connections,再加上 IndexPool 这样的工程巧思,没有哪一项是从零到一的发明,堆在一起却产生了从八十元到八元的断层——按 8 月 26 日公布的价目表,这款模型每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元,恰好是同月早些时候发布的旗舰 GLM-5.3(8 元/28 元)的十分之一;叠加限时折扣相当于再打对折,落到旗舰价位的二十分之一;折算成美元,约为 Claude Opus 4.8 价位的四十分之一[3]。前一章划出的那条从 4.5 元延伸到 170 元的空白价格带,就这么被一张标注着「0.8/2.8」的表格从中间拦腰占住。

细读这张价目表,还有一处极易被忽略的机关:缓存命中价只有 0.23 元。对普通聊天应用而言,这只意味着稍便宜些;但在动辄几十轮往复的长程 Agent 流程里,缓存命中率几乎决定任务全成本的下限——系统提示词、工具定义、滚动的历史上下文反复出现,每命中一次就省下一次全价。把它钉死在两毛三分钱,等于替所有 Agent 创业者把固定开销砍掉一大截。叠加 FP8 精度权重约 306GiB 即可起跑、SGLang 与 vLLM 等主流框架同步适配,重度玩家大可自行部署——这既是开源的姿态,也是一道逼自家 API 定价必须「低到自部署都不划算」的军令状[3]。

价格的胆量另有出处:承载它的推理引擎采用智谱自研的 EPD 分离式架构,官方口径下端到端服务性能较初始基线提升约 3 倍[3]。换句话说,价目表上的每个数字都有工程侧提前榨出的效率做背书。靠补贴实现的降价是一种姿势,靠架构红利外溢实现的降价是另一个物种。

不妨做一道小学水平的除法。设某个典型 Agent 任务需要生成 100 万 token 输出:放到 Claude Opus 4.8 常规档位,这一步约合 25 美元、近 170 元人民币;换到 Kimi K3 名下约为 100 元;而 GLM-5.3-Flash 只收 2.8 元,限时折扣期间更进一步落到约 1.4 元[3]。同样的产出,价差贯穿两个数量级——这不是百分比意义上的降本增效,而是「这件事从做不起变成闭眼做」的门槛坍塌。市场真正会为此沸腾的理由很简单:一切因成本被毙掉的需求,都在同一夜之间复活了。

也正因为如此,Flash 尤其适合这套匿名打法——价格与体验的关系经不起预告的污染。若先开发布会再放访问,评论区会立刻吵成一团:嫌贵的嫌贵,质疑缩水的质疑缩水,真实的适配案例反而被淹没。匿名期的顺序正好反过来:所有人都以白嫖心态全力压测,把速度、稳定性、上下文行为摸了个底朝天;等揭晓那一刻亮出十分之一的价签,先前所有免费攒下的好评瞬间换算成性价比的铁证。先证明值钱,再证明便宜——顺序反过来,效果就全毁。

这才是 Flash 作为战略武器的全部含义:它进攻的不是旗舰榜的名次,而是整个行业的成本函数。2025 年 5 月那次战略会,智谱赌的是 Coding,赌赢了也只能和所有人一起挤在涨价潮的天花板下面抢高端预算;一年之后的这次隐形落子,赌的则是另一个更大的命题——当模型能力跨过某个临界点之后,真正稀缺的东西不再是更聪明的模型,而是更便宜的智能。Pony Alpha 验证过的匿名策略,让 Flash 的性价比不必等待媒体定调就被社区投票确认;为效率重写的架构,让这张价格表不靠补贴也能够长期成立。牛市里人人都会喊转型,熊市里敢掏出对折乃至一折价格表的,才是真的已经把刀磨好了。

至于最终挑在 8 月 26 日晚间掀牌,时机的盘算并不玄妙:斩杀线的新价已于 15 日尘埃落定,需求真空正当肥沃;自家纯文本旗舰 GLM-5.3 又在 14 日先行立起了智能标尺,Flash 的定价必须站在这杆标尺旁才能显出落差之震撼;再放眼全球,芯片圈正逢 Hot Chips 的热闹档口——OpenAI 同期公示的自研推理芯片实测中,每瓦吞吐最高可达英伟达新一代 GPU 的约 1.5 至 1.9 倍,算力自主这件事,各路头部都在悄悄准备后手。8 月 6 日 DeepSeek 宣布涨价的那一刻,牌就已经扣下;三股时势汇于同一周,所谓惊险一跃,不过是顺着坡道把自己交给了重力。

本章参考资料

  1. 一个扭转命运的决定:5000 亿智谱如何「逆风改命」——华尔街见闻
  2. DeepSeek 提价九天后,智谱用十分之一的价格杀进来——蓝鲸财经
  3. 智谱上线并开源 GLM-5.3-Flash:10 万张国产卡撑起海外最火模型——综合报道
  4. 智谱发布 GLM-4.5 开源模型——新京报贝壳财经
  5. 机房 GPU「冒烟」!智谱新一代旗舰模型 GLM-4.5 火了——中国基金报
  6. GLM-5.2 上线并开源:专注 Coding 与长程任务——智谱官方
  7. 神秘模型确认!智谱发布新一代旗舰模型 GLM-5——证券时报网
  8. 霸屏海外的神秘模型 Pony Alpha 身份曝光:就是智谱 GLM-5
  9. 编程 AI 又变天?神秘模型 Pony Alpha 火了,被曝是智谱 GLM-5,股价两日暴涨 60%——今日头条
  10. 终结 DeepSeek 霸榜,神秘「牛来大模型」火了——中国证券网
  11. 「涨价潮」来袭,DeepSeek 领涨,国产大模型告别价格战?——36氪
  12. 大模型价格战逆转?深扒 17 家厂商最新定价,竟有超 7 成在涨价——亿欧智库
  13. Kimi K3 开始拿到市场定价权!国产 AI 大模型打响「贴身肉搏」战
  14. 梁文锋也撑不住了?调用量全球登顶后,DeepSeek 涨价了——腾讯新闻
  15. Opus 4.8 刚发布,被 DHH 和 Redis 之父当场拆台:跑分赢了 GPT-5.5,但编码王座不稳了——今日头条

第二章 破壳而出——GLM-5.3-Flash 技术架构深度拆解

💡 独思时刻:八月二十六日晚,看到智谱官宣认领「牛来」的那一刻,我的第一反应不是惊讶,而是抓过纸笔写下三个数字并反复端详:320B 总参数、18B 激活参数、45 层。总参比 GLM-4.5 的 355B 还要小一些,激活参数只有其 32B 的一半多一点,层数干脆从 92 层砍到 45 层。按这些年大模型的惯性直觉,这三个数字无论怎么组合,都不应该追平自家上代旗舰与 Claude Opus 4.8——除非这个团队找到了一条大多数人没有认真走过的路。这一章要做的,就是把这条路一寸一寸拆开来看。

匿名测试的喧嚣尚未散去。八月二十日晚,「牛来」以隐身模型身份上线 OpenRouter 并首日登顶刷纪录的故事已经传遍开发者社区,这段全民侦探游戏的完整复盘留在第三章;八天后,智谱于二十六日正式揭开面纱,宣布这就是全新基座的 GLM-5.3-Flash,随后以 MIT 协议将权重开源上架 HuggingFace。当「牛来」变成社区口中的「牛模王」,技术圈的好奇心随之完成换挡:从「这是谁家的孩子」,转向一个更本质的问题——它到底是怎么做出来的?

答案藏在一组看似矛盾的参数里:320B 总参数配 18B 激活参数,92 层的历史包袱被 45 层的轻装上阵取代,外加一个足以整卷吞下多部长篇小说的长上下文窗口,以及一套把看图、看视频、读文件揉进同一个接口的原生多模态骨架。这些数字单独看都不惊人,组合在一起却指向一种与主流旗舰截然不同的构建哲学:不追求更深的网络与更多的激活,而是追求每一份算力产出的有效智能。

一、原生多模态的技术内涵:从「拼接式」到「神经式」

在 GLM-5.3-Flash 出现之前,市面上大多数所谓多模态模型走的都是拼接路线:先有一个强大的纯文本语言模型,再外挂一个视觉编码器,中间靠一层适配模块把图像特征翻译成语言模型能够消化的伪编码。这种方案的根本缺陷是信息损耗——视觉信号先被压缩成粗糙向量或文字式转述,再进入推理流程,等于让模型隔着一副毛玻璃眼镜观察世界。智谱自己此前的多模态布局也是类似格局:看图归看图的模型,看视频归看视频的模型,各自独立部署,调用专门的视觉端点,与文本流量走不同的管道。

GLM-5.3-Flash 把这套结构整个推平了。

图片、视频、文件现在以内容块的形式直接嵌入同一个对话请求。开发者面对的只有一个模型标识、一套计费维度、一个高达约一百万 token 的统一上下文窗口。依据官方文档披露的配置,该模型配有 24 层视觉编码器,视频输入按每秒两帧采样,单次视频输入的上限约为 24 万个视觉 token。而更根本的差异藏在预训练阶段:30T token 规模的多模态语料从第一天起就与文本语料混合喂养,视觉信号直接进入 MoE 路由的决策空间,与文本 token 在同一套注意力机制中被处理。这不是给文本大脑配一副眼镜,而是让视觉成为神经系统本身的组成部分。

官方博客有一段表述相当关键:团队为视觉编程方向搭建了专门的数据合成流水线,聚焦「自我视觉判断」与「测试时改进」,由此生成的训练轨迹要求模型与环境真实交互、亲手检视自己的输出,然后一轮一轮迭代修正。换句话说,看图问答只是及格线,真正的训练目标是教会模型「写完代码之后自己盯一眼渲染结果,发现问题,动手改掉」——把人类工程师的眼睛要做的事,内化为模型的感知本能。

这正是它与拼接式模型最深刻的分野。前端开发、游戏构建、三维建模这类任务的本质从来不是「看图说话」,而是「生成之后观察、观察之后修正」的循环。拼接式模型在这个循环里先天跛脚:视觉编码器与语言主脑之间那层映射太过粗糙,模型看不清自己刚产出的界面上哪里错位、哪个控件被遮挡、哪个配色失真。原生多模态让自我检验第一次具备了工程可用精度,官方文档将其概括为让模型能够观察界面、渲染结果与交互反馈,并据此持续测试和改进。本章第七节的实测案例会展示这个闭环真实跑起来的样子。

还值得指出原生多模态对成本结构的隐性贡献:一套模型服务承载全部模态,意味着推理集群、权重存储、请求调度都只需维护一份,而不必维持文本与视觉两套体系并行运转的费用。对一家要把百万级长上下文卖到几毛钱的厂商来说,架构上的简并本身就是省下的真金白银。

把视角放到智能体时代,原生多模态的价值坐标会更清晰。业界普遍将这类模型的用武之地归为三族:依设计稿生成并自查可交互界面的前端任务,分析长视频并完成剪辑、字幕或解说的工作流任务,以及在浏览器、代码环境与图形界面之间往复执行多步骤的通用代理任务。三族场景的共同前提都是「看得准」,且看图与动手不可分割地缠绕在同一回合里——这恰好是拼接式方案的天生短板区,也是本章第七节全部实测故事展开的舞台。

二、320B 与 18B:MoE 架构的记账逻辑

混合专家架构早已不算新鲜事,原理一句话可以说清:全部参数构成一个庞大的专家池,每个 token 到来时,路由器只挑选其中一小部分专家参与本轮计算,其余专家原地待命。此前路透社曾用一个浅白的比喻解释 MoE——它像一家大公司,专家是各个部门,开一次会只需要请最相关的几个部门到场,不必全公司坐满。这份全员名录决定了模型的知识容量上限,而每次实际到场的人数决定了一张张推理电费单。

把框架套到几代模型的档案上,选型逻辑一目了然。官方博客的基础模型对照表显示:GLM-4.5 为 355B 总参、32B 激活;同家族纯文本旗舰 GLM-5.3 底座为 744B 总参、40B 激活,评分更高但属于另一条产品线;DeepSeek-V4-Flash 底座为 284B 总参、13B 激活;而 GLM-5.3-Flash 是 320B 总参、18B 激活。横向一眼即见:Flash 在激活规模上落到了 DeepSeek 效率档那一格,却几乎保住了 GLM-4.5 量级的知识家底。总参更大意味着可被调用的「知识肌肉」更多,每次推理只动用 18B 又守住了运行成本的轻盈——储备的深与开销的轻,在这张对照表上第一次被解耦开来。

这笔账为什么重要?因为在大模型的服务经济学里,账单大头从不记在总参数名下。权重静态躺在显存里并不产生多少电费,真正随流量累进的变动成本来自每个 token 的激活计算。把激活压到 200 亿以下,配合下一节要讲的注意力减负,才构成了这款模型敢把价格打到上代旗舰十分之一的数学前提。总参是固定资产,激活是变动成本——Flash 的设计师显然深谙此道。

如果说 MoE 是节流的第一道闸口,那么真正具有标志意义的手术发生在注意力层:智谱首次在开源前沿模型中启用线性注意力与稀疏注意力的混合架构,这也是本次发布中最值得逐层拆解的技术决策。

三、四件套因果链:注意力层的减法艺术

要看懂这次手术,得先看清病灶。传统 Transformer 采用的 softmax 注意力机制,每一次生成都要翻阅当前全部上下文,序列越长计算量越呈平方级膨胀;与此同时,为了支持随时回看历史,每个 token 的键值都要驻留显存形成 KV 缓存,体积随上下文长度线性堆积。一百多万 token 的上下文若按老办法硬扛,光注意力计算与缓存的账单就足以令任何商业模式窒息。要把长上下文从天价拉回人间,必须搬掉这两块巨石。

第一刀砍向计算复杂度,工具是线性注意力。它不再让每个新 token 与全部历史逐一比对,而是把历史压缩进一份固定尺寸的递归状态持续更新——读过的所有内容沉淀为一个不断刷新的记忆矩阵,每次读取只需常数级操作,整段序列的处理复杂度随之从平方级降至近似线性。业内普遍认为这条思路的源头可以追溯到 Mamba 为代表的状态空间模型传统:用递归状态承载记忆。行业时间线也印证了它的成熟度——2025 年初 MiniMax 在 456B 参数的 Text-01 上验证了 1 比 7 比例的线性层混合落地,同年九月阿里通义实验室在 Qwen3-Next 中以线性注意力替换标准注意力并在百亿级模型完成验证,蚂蚁百灵随即开源两款验证工业可用性的线性注意力模型,十月月之暗面开源搭载 KDA 模块的 Kimi Linear,同样采取线性层为主的混合比例。到 GLM-5.3-Flash 登场时,线性注意力早已从论文里的异端变成了头部玩家的共同选项。

但线性注意力有先天软肋:递归状态是一份有损压缩,概括得了语言脉络,未必记得住几十万 token 之外的那个变量名。于是第二刀交给稀疏注意力来补——模型内置一个轻量级索引器,负责从海量历史中召回与当前生成相关的少数片段,再对这些片段做完整的精确注意力计算。「大意靠状态,细节靠索引」:局部依赖由线性层低成本流过,全局上下文由索引器定点打捞。在「少算、有重点地算」这条路径上 DeepSeek 走得更早,其 NSA 及后续 DSA 方案均已先行发表论文,充分验证了块状稀疏召回的技术可行性。

然而聪明的方案总会引入自己的新麻烦。索引器本身也要维护检索用的键值缓存,四个向量看起来不大,放到百万 token 尺度就成了新的延迟与内存热点。智谱对此的回应是 IndexPool:通过加权池化把索引器的四个缓存向量压缩为一个,舍弃的信息有限,节省的开销却是实打实的,尤其在高并发的长上下文生产环境中,这项压缩直接削平了一处延迟尖峰。

第四件套 mHC 回应的是另一个隐忧——层数从 92 层腰斩到 45 层之后,深层网络赖以工作的梯度通路与信息通路会不会塌方。Manifold-Constrained Hyper-Connections 在相邻层之间架设受约束的超连接,让信息绕过部分层次直接流动,同时稳住训练过程,改善深层信息流与扩展效率。这项为「砍半的深度」托底的改造并非从天而降:超连接思路此前已被业内探索改进过多轮,mHC 属于这条枝干上的延伸应用。

四件套各司其职,最终落成一张可以核对的账单。官方数据显示,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低约 3.01 倍,KV 缓存体积缩小约 4.44 倍,且在同口径对比的全部模型中注意力计算量最低。值得说透的是这笔节省究竟省在哪一层:MoE 专家层的计算一个子儿没少花,省下来的全部来自注意力层的乘加次数与显存驻留字节数。前者的减法叫 MoE,后者的减法叫混合注意力,两道减法叠加在同一张损益表上。

推理侧还有下半场工程。基于 SGLang 改造的自研引擎采用了所谓 EPD 分离式架构,把多模态编码、提示词预填充、逐 token 解码拆成三个独立调度、弹性伸缩的工作池,三类负载互不拖拽;配合分层切分调度、W8A8 权重量化与 INT8、FP8、BF16 混用的缓存量化策略,官方报告在同一批硬件上将端到端服务性能做到初始基线的三倍。FP8 精度的完整权重大约占 306 GiB 存储空间,官方支持 SGLang、vLLM 与 TokenSpeed 三条部署路径。第三方研究机构 SemiAnalysis 对这套运行于国产芯片之上的推理栈给出了罕见的正面评语:其硬件效率与单 token 成本已经可比英伟达 GPU。

至此因果链条完全闭合:线性注意力消灭平方项,稀疏注意力兜住全局召回,IndexPool 拆掉索引器自留的门槛,mHC 让浅层网络站得稳——四道工序合力,把每个 token 的服务成本从结构层面打了下来。价格战打到一半有人掀桌换掉了计价单位,说的就是这种时刻。

四、层数 92 到 45:效率哲学的重心迁移

从 GLM-4.5 的 92 层到 Flash 的 45 层,表面看是一次简单的腰斩,实质却是设计重心的整体迁移。过去几年行业默认了一个等式:更深等于更强,参数等于地位,旗舰就该是用巨量层数与激活堆出来的庞然大物。这条路走到极端便是难部署、慢响应、高单价——直到人们发现智能指数的增长曲线开始钝化,推理成本的曲线却在陡峭上扬,两个方向撕开的裂口正是新的机会窗口。

更浅的模型并不意味着必然更弱。深度带来的收益边际递减,代价却严格线性递增:每多一层,前向就多做一遍变换,KV 信息就多中转一站,诊断故障就多一个可疑环节。45 层的 Flash 在相同硬件上前向更快、端到端时延更低、单片卡的吞吐利用率更高。配合 mHC 提供的高效信息通路与大量线性层维持的序列建模能力,它证明了一件此前更多停留在猜想阶段的事:在中长尾的绝大多数任务上,模型的表现力对层数远不如对训练质量敏感——深度可以大幅折价出售,而几乎不掉分。

成绩单支持这个判断。第三方机构 Artificial Analysis 的综合智能指数给出 57 分,与 Claude Opus 4.8 持平,同时超过自家上代旗舰 GLM-5.2 与 DeepSeek V4 Pro 正式版的各自 53 分。官方博客还附了一张直观的散点对照:横轴是每任务成本,纵轴是智能指数,Flash 独自落在性价比帕累托前沿之上——在此之前的公开选项里,达到同等智能水平的模型价格普遍高出约十倍。若按限时折扣后的口径折算,外界推算它单个评测任务的成本大约只有 4.5 美分上下。这些数字合起来指向同一个结论:45 层足够在主流基准上与对手战平,代价却只是对方的一个零头。

需要坦率承认的是这个故事的另一面:极致的层数削减并非免费午餐,社区讨论中对深层任务一致性与极难推理表现的疑虑始终存在,相关短板将在第六节如实呈现。但方向本身已经清晰——这支团队并非做不出深网络,而是刻意拒绝为榜单上最后几分支付指数级的算力利息。AI 圈长期习惯把性能与效率对立起来,仿佛降本就意味着妥协;而一款把更高的能力分与更低的价格写进同一行表格的产品,逼着整个行业重读一遍 Scaling Law 这个词的本义:一条好的架构杠杆,抵得上一次千卡集群的扩张。

五、Z.ai Code Bench:一把自研尺子的设计逻辑与可信度

所有厂商都在基准上刷分,但刷分的姿势有别。智谱这次的评估组合里,一边由 Artificial Analysis 这样的第三方指数负责外部锚定,另一边则交给自建的 Z.ai Code Bench 做细颗粒度编程能力刻画。官方对此体系的结论表述直白:在这套评估上,GLM-5.3-Flash 的编程表现与 Claude Opus 4.8 相当。

自研基准听上去像既当运动员又当裁判员,可信与否取决于两个刚性条件:任务集是否覆盖真实工程场景,方法是否透明到可供独立复现。目前公开的信息恰好处于中间地带。智谱没有放出完整题库与评分细则,却披露了颇具诚意的执行细节:整套评估运行在与 Claude 完全相同的代理环境中——Claude Code 2.1.207 版本,并明确划分努力档位。结果是在每个努力等级上 GLM-5.3-Flash 都清晰领先 GLM-5.2,最高努力档拿到 29.0 分,距 Opus 4.8 的 29.5 分仅一步之遥。同一风格的严苛协议也体现在其对 Terminal Bench 2.1 的执行上:采样温度设为一,最大生成长度 65536 token,单项任务超时上限六小时。同轨、同引擎、同档位地对标对手,这套设计至少说明了评估环境的可控意图。

然后交代这把尺子的另一面。评测圈的老问题在于代理基准对测量环境的敏感程度远超常人想象:不同代码与代理模型采用的测试框架、工具环境、推理预算、最大输出长度和超时设定都可能存在出入,同样的模型换一副跑马灯,分数就能漂出好几个点——例如智谱执行 Terminal Bench 2.1 时允许单任务最长运行六小时,这份耐心本身就是一种资源优势。自研评估体系的密集涌现某种程度是对行业乱象的回应——2026 年七月已有媒体撰文批评大模型行业各家定价相差数倍、缺乏统一的计量标尺、成绩高度依赖私设赛道。但截至成稿,Z.ai Code Bench 的结论仍主要出自模型团队之手,亦有海外科技媒体直言其多数基准成绩缺乏独立机构的复核,完整任务集与方法论均未公开。公正地说,一枚还没被外人校准过的秤,读数可以是准的,也可能是被期待塑造的,两者眼下无法分辨。

因此本书主张把证据分为三级看待:平台真实调用量、第三方基准分数、厂商自报成绩,证明力依次递减。「牛来」匿名五天里超过五十万亿 token 的真实流量属于第一级,Artificial Analysis 指数的 57 分属于第二级,各类自建榜单上的辉煌属于第三级——三级证据互相咬合时故事才立得住,单靠任何一级都撑不起结论。Z.ai Code Bench 目前恰好处在最弱一级的位置上等待第三方复现,这正是全书对其保持礼节性敬意的全部理由。

六、横向对比:57 分背后的三条曲线

把核心竞争者放进同一张表格,格局立刻显形。

模型 总参/激活 AA 综合智能指数 每百万 token 定价
GLM-5.3-Flash 320B/18B 57 输入 0.8 元、输出 2.8 元
GLM-5.2 未公开 53 未在官方渠道统一披露
DeepSeek V4 Pro 正式版 未公开 53 未公开
Claude Opus 4.8 未公开 57 约输入 5 美元、输出 25 美元
GLM-5.3(纯文本旗舰) 744B/40B 高于 57 输入 8 元、输出 28 元

第一条是智能曲线:Flash 贴住了最高梯队。57 分与 Claude Opus 4.8 持平,全面领先两家 53 分的竞品,仅低于自家纯文本旗舰 GLM-5.3 一个身位——后者是智谱于同月早些时候八月十四日发布的另一条产品线,主打文本极限能力,那句「扩展后训练是我们所做的一切」的口号言犹在耳,两周之后 Flash 便换了一副打法登场。第二条是成本曲线:官方定价输入每百万 token 0.8 元、输出 2.8 元、缓存命中另低至 0.23 元,合计约为 GLM-5.3 的十分之一,限时折扣期进一步压到约二十分之一,折算下来约为 Opus 4.8 价格的四十分之一;不过缓存单价并非全场最低,DeepSeek V4 Flash 在这一单项上依旧占优,官方并未恋战,把比较优势留在了输入输出主档位上。第三条则是最能体现定位智慧的场景曲线,分项剖面如下——

Agent 编排科目是 Flash 频繁越级挑战自家旗舰的分水岭。考察真实工具调用编排能力的 Toolathlon 上,它拿到 78.4 分,反超 GLM-5.3 的 73.0 与 Kimi K3 的 76.5;AutomationBench 上以 48.8 对 DeepSeek 的 38.8 大比分胜出。这两科恰好检验着 agent 能否替代人肉执行日常操作。与此同时,短板毫不掩饰:在被称为人类最后的考试的硬核推理测试 HLE 上,带工具作答的 Flash 得 55.3,明显落后家族旗舰 GLM-5.3 的 62.5;Terminal Bench 2.1 里它得分 84.3,与 Opus 4.8 的约 85.0 在误差范围内贴身肉搏,却低于 Kimi K3 的 88.3 与 GLM-5.3 的 88.2。一个立体的 Flash 形象由此浮现:工具大师、自动化冠军、办公场景杀手,兼长跑型选手,但天花板级别的难题仍需族中大哥出马。

偏视觉与文档的科目分布更见心机。DeepSWE 1.1 软件工程基准上,Flash 得 63.4,超出 DeepSeek 对照版本 V4-Vision-Exp 的 59.3 约四个百分点;OfficeQA Pro 这一面向办公室文档问答的科目,它以 62.4 对 Opus 4.8 的 48.9 完成惊人的反超碾压;考验视觉认知理解的 BabyVision 上,53.4 对 DeepSeek 的 35.1 同样差距悬殊。这几科的轮廓绝非偶然——它们恰恰落在原生多模态与低廉价格的势力交界处。

三条曲线合并阅读,真正发生的只有一件事:同等智能水平的供给曲线被一根架构杠杆整体撬动下移。前面各节的铺垫至此收拢成一句大白话——如果没有注意力计算量 3 倍缩减与缓存 4 倍瘦身,没有激活参数近乎减半的自我克制,这一切近乎免费的智能都无从谈起。这也预告了第五章的主题:斩杀线的本质从来不是敢不敢降价,而是有没有本事让降价不亏钱。

七、实测的肉身感:识图、长视频与十六小时的厨房

基准是冷冰冰的,实测才有温度。发布次日,国内多家媒体在智谱的 ZCode 环境中对 GLM-5.3-Flash 进行了成建制的能力测试,覆盖识图、文档处理、代码生成、游戏开发与视频剪辑多个工作面。本节挑几个信息量最大的场景展开,它们共同揭示着一个被基准分数掩盖的事实。

识图层面的表现首先坐实了原生多模态的基本功。《复仇者联盟4》海报发过去,模型不仅认出主要角色,连火箭浣熊的配音演员都准确标注出来;拍立得相纸包装盒照片上的密集小字被逐一辨认,甚至判断出背面印有七种语言的相同安全警示。更狠的一道考题是半页公务员考试模拟试卷:照片上是印刷油墨、圆珠笔与铅笔字迹层层叠叠的手写草稿,页面首尾残缺。GLM-5.3-Flash 不仅识别出材料缺失、补全了完整题目并作答,事后比对发现十一道题只错一道。混乱手写体向来是拼接式多模态的重灾区,这个精度已经不是能用级别,而是开始逼近专业录入员的水平。

更值得注意的是两项长时间自主作业的场景,它们直接回答了前文埋下的问题——原生多模态的训练闭环在实战中究竟长什么样。

第一个场景是对《深海迷航》式游戏的从零复刻。测试者拟定一份极为详尽的需求文档,要求开发一款类似的开放水域求生题材 3D 游戏,全程不给任何视觉参考。GLM-5.3-Flash 写完基础代码后并没有停笔交差,而是主动进入实机测试环节:调用截图功能抓取游戏画面亲眼查看运行状态,逐项检查鱼群受惊的反应是否自然、氧气数值的消耗曲线是否合理、探照灯的光锥角度是否正确,看到问题便回头调整参数。测试者继续加码,让它追加第一人称视角与玩家走出潜水艇的新玩法,最终交付版本的流畅度、物理合理性与视角切换都达到了超出预期的完成度。关键点不在又一个 AI 生成了游戏,而在整个调试回合中没有一双人类程序员的眼睛参与——模型用自己的视觉系统充当了自己的评审员,「生成、观察、修正」的训练目标在这一单里得到完整兑现。类似的能力在同批测试中反复出现:给它一段《王者荣耀》训练营的对战录像,它能据此产出一个网页可玩的二维横版对战游戏,连公孙离的换伞机制与孙尚香的强化普攻都被还原了出来。

第二个场景来自智谱的官方演示,尺度更为夸张:让模型在 Blender 里凭空搭一座厨房。初始条件只是一堵白墙,此后十六个小时里 Flash 自主运行,反复盯着渲染结果找毛病、挪家具、调光照、改材质,最终交付出一个面积约四百平方米的主厨厨房场景——吊柜高度与灶台动线均在合理范围之内。十六个小时确实很长,长得像一部电影的时长被一个模型用来装修一间虚拟厨房;但方向远比速度重要,这是业界少有的大模型在三维创作领域公开展示无人值守式的自我迭代,人类设计师在这个流程中的角色退化为偶尔瞥一眼的监工。

长视频处理则展示了多模态能力的另一个方向。一段将近 48 分钟的吴恩达演讲视频交给 Flash,任务是剪成金句合集:它耗时 57 分钟通览全片,提取 17 个金句片段,配上中文字幕输出成品,同时把字幕文件、转写稿等中间产物归档在文件夹里。音画同步,切点流畅,成品拿来就能发布。同一批办公测试里,一篇 58 页的文学硕士论文只用五分半钟就被提炼出条理清晰的精华总结;几张甜品店的经营数据图表被读懂后,模型并未照搬原图,而是自行重新绘制图表,产出一份简洁美观的经营分析演示文稿。识图、剪片、读论文、做汇报连成一线,这款模型在商业落地侧的真实杀伤半径就此显形。

当然,肉身感的另一面同样真切——慢。上述场景共享的关键词是分钟级乃至小时级的耗时:三十五分钟复刻一个网站的设计语言,五十七分钟剪一支短片,十六个小时装修一间厨房。这不只是媒体高强度压测下的个例,社区对长期 agent 任务的反馈大体相同:半小时起步,一小时常见。可以为它辩护说,慢是把验证循环交给模型自理的必然代价——毕竟人类设计师装修一间厨房也远远不止一天;但也必须承认,对响应时效敏感的交互场景而言,这份从容就是实打实的硬伤。快与慢在同一款模型身上互为镜像,本书无意粉饰任何一面。

八、开源世界的第一反应与原创性之辩

MIT 协议的权重发布数小时内,生态的第一波反应便涌了出来。HuggingFace 模型主页挂出完整权重与配置;SGLang 官方文档当晚出现专属适配页,vLLM 与 TokenSpeed 同列官方支持的部署通道,偏好量化部署的社区也收到了 KTransformers 路线的提示。llama.cpp 社区的动向最能体现开源世界的生物本能:关注架构移植的开发者在仓库讨论区迅速集结,主流本地推理框架对混合注意力层的适配工作已然启动——尽管给一款 320B 的庞然大物做全量化改造注定是一场持久战,但箭已离弦。国产硬件阵营同样神速,摩尔线程在模型开源次日便宣布基于自家 AI 加速卡完成 Day-0 极速适配,与承载匿名期峰值约 62T 单日 token 用量的十万张国产芯片集群相互印证。开源周的标准剧本一夜演完:发布、适配、复现、对比,各就各位。

喧嚣之中,真正值得记录的是一场冷静的争论:这套惊艳的四件套,学术原创性几何?

把镜子擦亮了看,答案并不浪漫。线性注意力是学界与工业界多年耕耘的方向,思想源头可上溯至 Mamba 所代表的状态空间模型传统,MiniMax、阿里、蚂蚁、月之暗面在过去一年多里逐一完成了工业化验证;稀疏注意力方面,DeepSeek 更是以 NSA 与 DSA 两项先行工作树立了行业参照系;mHC 属于对超连接既有思路的改进延伸;IndexPool 则是一个漂亮的工程技巧,谈不上科学突破。形式上还有一个扣分项:智谱此次未同步放出 arXiv 论文,公众能看到的技术细节仅限官方技术博客——重大架构宣称缺乏经同行评审的原始文献支撑,在严谨的研究者眼中终究是个遗憾。一位长期跟踪开源模型的评论者的说法代表了相当一部分声音:四项技术均为成熟组件的组合运用,没有一个元件是从零到一的发明。

硬币的另一面同样成立。回顾本书第一章铺垫的行业背景——softmax 注意力的平方定律扼住了长上下文的咽喉,整个行业苦其久矣。把状态空间模型的递归压缩与稀疏检索熔铸进一个能在 30T token 多模态语料上稳定训完的前沿基座,且在上线头五天扛住全球五十万亿 token 的真实流量,这个整合动作的难度同样以天文数字计。科学的原创与工程的原创素来是两枚奖牌:前者奖励首次发现,后者奖励首次跑通。混合注意力在 GLM-5.3-Flash 手中第一次以前沿开源模型加原生多模态的全套装束落地,并经受住生产环境的实战检验——即便没有任何一项发明冠以其名,这份集成执行能力也自有其历史坐标。较为公允的评价也许是:它证明了把全行业的好招式练成本能,本身就是一种世界级的本事。至于原创性的最终定论,恐怕要等那篇迟到的技术报告问世之日才有结论。

再把视线放回商业棋局,架构选择本身就是战略声明。有研究者在 MLSys 社区估算过,MoE 模型的推理成本近似正比于激活参数而非总参数——把激活从 32B 压到 18B,同等硬件的理论并发能力便近乎翻倍;再叠上 KV 缓存缩至四分之一左右的减法,同一座集群能支撑的请求数达到旧世代的数倍。这不是玄学,是毛利率报表上可以直接读出的数字。

回头看智谱布下的这盘棋,更能读懂「破壳而出」四个字的分量。它没有选择在智能绝对高度上与 Claude Opus 4.8 或自家 GLM-5.3 正面对撞,而是在性能与成本构成的二维平面里给自己开辟了一个全新象限:一半的层数、一半不到的激活、四分之一的缓存、全套的原生多模态,在追平主流旗舰分数的同时,把服务价格钉死在其几十分之一的位置。八月二十六日晚之后,行业的价值标尺悄然移位:评判一个模型的好坏,究竟是看它在最先进的芯片上能刷出多炫的分数,还是看它能以多低的成本、在多少人家的芯片上稳定服务全球用户?GLM-5.3-Flash 用架构给出的答案是后者——而这个答案背后的国产算力底座,正是下一章的主角。

本章参考资料

  1. GLM-5.3-Flash: Frontier Intelligence, Flash Cost(Z.ai 官方技术博客,2026 年 8 月)
  2. What Is GLM-5.3-Flash? Z.ai's First Natively Multimodal Open-Weights Model(Z.ai 开发者文档)
  3. zai-org/GLM-5.3-Flash 模型主页(HuggingFace,MIT 协议开放权重)
  4. GLM-5.3-Flash — SGLang Documentation(SGLang 官方部署文档)
  5. 智谱上线并开源 GLM-5.3-Flash(太平洋科技快讯,2026 年 8 月 27 日)
  6. 神秘「牛来」模型真身揭晓:GLM-5.3-Flash 到底有多强(七牛云技术评论)
  7. 连夜实测智谱 GLM-5.3-Flash:剪视频、复刻《深海迷航》,价格降低百分之九十七点五(智东西)
  8. 刚刚,神秘「牛来」模型揭晓:智谱 GLM-5.3-Flash(网易科技)
  9. 阿里、Kimi、蚂蚁集体押注!混合注意力从可选项成必答题?(智东西,授权 36氪转载)
  10. 从 O(N²)到 O(N):DeepSeek NSA 与 Kimi MoBA 稀疏注意力底层原理深度拆解(CSDN 社区)
  11. Kimi Linear: An Expressive, Efficient Attention Architecture(arXiv 论文解析)
  12. Day-0 极速适配!摩尔线程 MTT S5000 跑通智谱 GLM-5.3-Flash(快科技,2026 年 8 月 27 日)
  13. GLM-5.3-Flash Hardware Requirements: GPU, Memory, and Deployment(Yotta Labs 技术博客)
  14. Zhipu's GLM-5.3-Flash: A Game-Changer in AI, Priced to Disrupt(AI DAMN 评论)
  15. 迷の高性能AI「Ox Alpha」の正体は「GLM-5.3-Flash」だったことが判明(GIGAZINE 报道)

第三章 沉默的巨浪——Ox-Alpha 匿名测试的5天传奇

8月20日,一个没有名字、没有公司标签、没有任何公告的模型条目,悄无声息地出现在全球开发者聚集的模型聚合平台 OpenRouter 上。供应商一栏只写着“一家在预览期间选择保持匿名的第三方提供商”,代号 stealth,意为“隐身”;价格栏里只有两个字——免费。它叫 Ox Alpha。

按照平台给出的描述,这是一款“专为高效编程、持续性智能体任务以及真实生产工作负载而设计的推理模型”,支持文本、图像、视频三模态输入,上下文窗口达到1048576个token——足够把一个中大型代码仓库整个塞进对话。没有发布会,没有预热帖,没有 KOL 提前打招呼,连一句“敬请期待”都没有。

要理解这个条目为什么能引爆,得先理解 OpenRouter 是什么地方。它是全球最大的模型聚合入口,开发者世界里的“应用商店”:几百个模型在同一条货架上按调用量与口碑排出座次,榜单就是橱窗,橱窗就是客流。无数工程师每天打开编辑器的第一件事,就是从这里选一个名字填进配置文件。在这样的地方,一个隐去厂牌、标价为零、配置却是旗舰级的条目忽然出现,效果等同于在闹市深处开出一家不挂招牌却宣布免单的餐厅——你不需要懂营销,只需要懂人性。

整个 AI 圈的反应,从“这是谁家的东西”到“我试试看”,只用了不到12个小时。而在接下来的五天里,这个不肯透露姓名的模型掀起了一场教科书级别的行业海啸。

本章要做的复盘很简单:把五天的潮水按三个维度重新码放——先量水(发生了什么),再验DNA(它是谁),最后拆发令枪(他们是怎么做到的)。写作时会尽量克制惊叹,因为复盘的价值在于提取可复用的方法,而不是替结果鼓掌。

💡 独思时刻:我在2026年2月亲历过 Pony Alpha 的匿名测试。那一次,模型在 OpenRouter 上悄悄上线,全网猜了几近一周才等来智谱认领——那是 GLM-5。当时我以为,这只是一次灵光乍现的战术奇袭。直到 Ox Alpha 出现我才意识到,那不是一个孤例,而是一套打法的第一次排练。这次,同一个剧团回到了舞台中央,但布景大了整整一个数量级。

一、一条没有名字的模型,和一个被踩爆的纪录

回到那条神秘的模型条目本身,它有三处反常,每一处都是精心设计的钩子。

第一反常,是免费。预览期内 API 调用零费用,不需要信用卡,不需要企业认证,任何开发者拿着账号就能接入。在一个主流前沿模型普遍按百万token计价收费的市场里,这是把自助餐厅的大门完全敞开。免费削掉了试用决策中最后一道摩擦力——反正不要钱,试试又何妨。

第二反常,是大。百万级token上下文外加图像与视频输入,通常只出现在旗舰产品的配置单上;一次性吃下一整个代码仓库的能力,过去是少数闭源巨头的特权。一个免费产品端出旗舰规格,本身就构成认知失调——天上掉馅饼的时候,人总想看看馅饼是什么馅的。

第三反常,是匿名。页面上找不到开发主体,找不到技术报告,找不到模型卡,连运营条款都语焉不详。在“身份即背书”的行业惯例里,匿名本该是减分项,但在聚合平台的语境里,它反而成了一个悬念引擎——每个使用者都顺手继承了一个待解之谜。

三个反常叠在一起,构成了完美的传播引信。上线当天,Ox Alpha 冲上 OpenRouter 单日调用量榜首,并且一举刷新了平台的单日模型用量历史纪录——不是小幅超越,而是把这个纪录一次性抬高了大约四倍。首日约有13.4万名用户涌入,累计消耗token超过7万亿;平摊到每个人头上,人均一天“喂”给它的文字量超过5000万token,折合长篇小说约有五百本——这不是浅尝辄止的猎奇,是把模型直接嵌进了日常的生产流水线。

火势在随后几天持续蔓延。到第三天,用户数增至22.1万,累计token消耗攀上16万亿;到第五天、也就是8月26日官方认领之前,五天累计流量已突破50万亿token,其中单日峰值一度冲到约62万亿。《独立报》、Bloomberg、TechCrunch、观察者网等十余家国内外媒体先后跟进报道。一款没有任何身份信息的模型,成了全球科技媒体的头条常客。

陡峭的曲线自然引来追问:会不会只是羊毛党的免费轰炸?结构数据给出了否定的答案。涌入 Ox Alpha 的流量并非均匀的闲聊灌水,而是高度集中在编程应用入口的重型任务;连 Anthropic 自家付费编程工具的用户都在批量把活计改道于此——没有人会拿真金白银买来的生产工作流,去替一个匿名条目制造假繁荣。更直观的旁证是 OpenCode 的姿态:敢为一个来路不明的模型划出每天100万亿token的容量配额,等于平台方用基础设施开支替它的流量质量做了背书——平台比任何人都清楚每一笔调用的成分。

这里必须记下另一家平台的名字。开源 AI 编程助手 OpenCode 几乎在同一时间接入了这头无名牛,并为它准备了每天100万亿token的调用容量,公开喊话:“让我们看看你能做什么。”这份近乎豪掷的邀约背后是平台的精明——谁都想把行业最炙手可热的流星请进自家场馆,顺便向全世界展示自己的基础设施容量。

匿名与免费,就这样共同完成了一场史无前例的大规模实战验收的开场。而这场的门票,白送。

二、水文测量:五天五十万亿token与单日62T

抛开情绪看水位线,这五天的流量曲线本身就值得一章水文志。

先看绝对量级。五天累计突破50万亿token的处理量,放在2026年全球任何一家头部模型服务商身上,都是需要在业绩会上单独解释一页的体量;而这五天,仅仅是它作为无名之辈的预览期。再看那个凶悍的单日峰值——约62万亿token的24小时,按一本长篇小说约合10万token的通行换算,相当于六亿本长篇小说的文字在一个地球日内被读入、理解并生成回应。假设一名开发者一轮调用平均消耗1万token,峰值日等于完成了62亿轮完整对话,只能是密度极高、强度极大的真实生产场景才喂得出来的流量形态,绝非泛泛的好奇心点击所能堆砌。

再看相对坐标。华尔街见闻在智谱认领当日发稿时的标题直截了当:《智谱“认领”神秘AI模型Ox Alpha“牛来”,使用量已达DeepSeek两倍以上》。一个五天前才出生的匿名模型,使用量一度达到深耕聚合平台已久的 DeepSeek 的两倍以上——这不是新玩家挤上了牌桌,是新玩家把牌桌掀了。

流量的成分同样值得化验。据《朝鲜日报》英文版统计,仅在通过其接口接入的前五大编程应用里,三天就有超过1.4万亿token的任务涌向这头牛;美国开发者在 Anthropic 付费编程工具 Claude Code 里,批量把原本属于 Claude 的任务替换成 Ox Alpha,三天跑掉了3140亿token,约合300万本长篇小说的文字量。该报据此估算这笔“白请全世界吃饭”的账单:仅这一小片流量,运营方三天垫付的服务器开销估计就达数亿韩元,若按正常商业定价出售,同量服务价值超过10亿韩元。冰山尚且只算了露出水面的一角。

水文志里还有一个耐人寻味的现象:随着“免费一周”的沙漏见底,末班车效应开始显现。大量开发者特意把平日舍不得开销的重型任务留到窗口关闭前集中投喂——整库代码审计、批量文档解析、超长会话回放,一股脑堆向这头不要钱的牛。限时免单制造的不只是参与率,还有参与强度的畸峰;无论单日峰值落在窗口期的哪一天,它展示的都是同一件事——只要供给端宣布无限免费,需求端释放的能量就没有上限。

质量维度的民间实测也在同步展开。独立研究员 Ben Davis 从软件工程基准 DeepSWE 中抽取10项真实 GitHub 任务测试,Ox Alpha 完成8项,一次通过率80%;同场对比中,Claude Fable 5 为65%,GLM-5.3 为62%,Grok 4.6 为62%,GPT-5.6 Sol 为52%。DeepSWE 论文的一作黄文琪第一时间把它拉去跑了自家全套测试,得到的准确率在63%左右——开源阵营顶尖水平,放进闭源横评也只是略逊 Grok 4.6 一筹。社区流传的测试记录里还有更细的颗粒:有人晒出共计51469项回归测试全部通过的日志,有人记录了69次工具调用仅出错一次的 Agent 任务全程,还有人发现一个此前三家主流模型均得零分的任务,Ox Alpha 第一次尝试就通过了。甚至有开发者靠它在自己项目的代码库里挖出了其他工具反复漏掉的两个真实bug。

Stripe 联合创始人兼 CEO 帕特里克·科里森上手一圈后在 X 上只留下四个字的评价:“非常令人惊叹。”Hermes Agent 的创始人称它超过了他们所有的内部评估标准,OpenRouter、T3 Chat、Box 的掌门人也陆续转发背书。硅谷半壁大佬轮流下场试刀,这阵仗过去半年从未见过,圈内人索性尊它一声“牛模王”。

当然,潮水并非全是赞歌。社区同样记录了这头牛的短板:推理速度明显慢于旗舰水准,长程智能体任务动辄半小时起步、一小时常见;百万上下文的纸面容量之下,超长输入的实际利用率尚缺乏独立验证。免费的代价是排队,慷慨的代价是等待。耐人寻味的是,这些具体的抱怨反过来成了可信度的证词——只有被真正塞进日常交付流程的模型,才会收获如此精确的差评;玩具没有人认真挑剔。

Davis 本人在成绩刷屏之后也主动降温:“这只是10个任务的子集,真实分数可能有很大方差。”更大的社区样本复测后,分数果然回落到63%附近,与黄文琪的结果互相咬合。小样本的惊喜会被热情放大,但真正扛住22万名用户五天反复折磨而没有崩掉的,是底层那份工程稳定性——这才是匿名盲测自动筛选出来的真金。

五十万亿token,一场无人组织却井然有序的压力测试。水位数据替这个无名者完成了最有力的自我介绍。

三、五十六天王朝的黄昏——OpenCode霸榜终结记

如果说 OpenRouter 单日纪录的刷新还只是“量的震撼”,那么另一份榜单的变化则是“质的变局”。

OpenCode 是开源 AI 编程助手生态里最重要的竞技场之一。它的内置模型排行不考核答题得分,只统计一件东西:全球开发者在真实编码工作流中的调用选择。某种意义上,这是一份比任何 benchmark 都诚实的成绩单——分数可以刷,无人逼你付费的调用行为刷不了。

在这份榜单上,此前整整56天的头把交椅属于 DeepSeek。八周,在大模型行业的时钟里约等于地质纪年:足够一代新品发布后又归于沉寂,足够三起融资新闻出尽风头,足够无数“挑战者”折戟而归。56天里,在性价比路线上做到极致的 DeepSeek 已经成为大量工程师的出厂默认,谁是第一名这个问题一度失去了悬念。

8月20日,王朝迎来黄昏。Ox Alpha 上线当天即终结了 DeepSeek 在 OpenCode 连续56天的霸榜,并在随后几天把差距拉到肉眼可见——双方并行计量的口径下,无名牛的使用量一度达到对手的两倍以上。

为什么一个没有名字的新人能瞬间撬动56天的惯性?因果链拆开看非常清晰。其一,免费让切换的货币成本归零,而人类对零价格几乎没有抵抗力;其二,百万token上下文改变的不是结果而是习惯——开发者 Ziwen 把 Ox Alpha 接入 Codex 之后,整个团队干脆放弃了“挑选重要文件再投喂”的老办法,转而把整座仓库一股脑丢进去,工作流本身被重构,回头的路径也随之被拆掉;其三,榜单自带马太效应,登顶带来曝光,曝光带来新增调用,新增调用进一步夯实登顶——一旦冲过临界点,滚雪球就不再需要外力。

颇具历史押韵感的是,把 DeepSeek 送上宝座的,正是当年那场横扫聚合平台的性价比风暴;而终结这一切的方式,是一张全免费的账单。排行榜的记忆总是很短,因为它永远只统计此刻。

为旧王朝记上一笔公允的注脚同样是必要的。五十六天的霸榜与其说是荣衔,不如说是重负——这八周里,DeepSeek 承受了行业最标准化的对照系待遇,此后每一次新模型横评,它都要被拉出来溜一遍。它最终丢掉的不是技术领先性,而是默认选项的位置;这两件事的区别,恰是大模型市场里最容易被混淆的地方。榜单易主并不会清零真正的资产——代码库里的存量集成、用户的手部肌肉记忆、围绕 API 生长起来的社区生态都还在原地。DeepSeek 与无名牛之间的第二回合没有在8月落幕,只是换了更分散的战场。

美国播客主播 Theo Jaffee 留下了这场变局中最生动的注脚。他在热潮正盛时断言:“这不可能是 Flash 类模型,如果这真是个 Flash,那美国就完蛋了。”他的本意是性能如此强劲,绝不可能是轻量级的产品线。没人想到五天后揭晓的答案会同时击中他设想的两个分支——它既强得令人不安,又恰恰是一台如假包换的 Flash。预言家猜中了时代的情绪,却猜错了剧本的具体台词。

56天霸榜的终结向整个行业宣示了一件事:当聚合平台把换模型的成本压到接近零,座次的流动性就会远超所有人的预期。王座依然存在,只是坐在上面的人,必须每天重新证明自己有资格坐在那里。

这场变局还有一层容易被忽略的行业含义:聚合平台正在取代官网成为模型的“第一发布现场”,榜单正在取代发布会成为产品的“第一解释框架”。谁能在这里持续占据默认位,谁就握住了开发者心智的总闸门;而五十六天来的第一次易主则提醒所有供应商,在这个渠道里,没有人拥有永久的免检资格。

四、猎巫行动:给一头牛验DNA

能力的问题解开了,身世的问题反而烧得更旺。一场跨越国界的分布式侦查在社交网络的各个角落同步展开——后来社区把这波全民推理称作“猎巫行动”,只不过这次的猎物不是女巫,是一头牛的户口本。

最先形成体系的是独立研究员 Ben Davis 的探针测试。他对25组不同提示词做了严格的分词比对,发现 Ox Alpha 与 GLM-5.3 的 token 计数每组都相差固定的75个——不多不少,恰好对应一段外挂在系统外部的隐藏 System Prompt 的长度。这条证据的杀伤力在于机制:词表是分词器训练完成时就冻结的资产,后续微调可以改写模型的全部权重,却几乎不会重铸词表。恒定不变的75个token差值,就像指纹里那条无论如何用力都抹不平的掌纹。

第二条证据链来自视频编码器。测试者制作四段受控视频分别输入 Ox Alpha 与智谱的 GLM-5V-Turbo,逐一核对输入token的消耗模式:帧率变化后采样策略基本不受影响;视频时长增加时,token消耗以约每秒147个的速度线性增长;逐帧分辨率的缩放方式如出一辙——连四段视频各自产生的额外token预算都能逐项对上。采样策略与增长斜率都属于写在实现里的工程参数,指纹的颗粒度细到了代码层。相比之下,其余候选模型呈现的完全是另一套编码特征。

第三条线索藏在报错信息里。有人故意传入异常参数,捕捉到类似“1210 The temperature parameter is illegal”的错误码——这一编号体系与智谱服务体系的报错方式高度吻合,触发时返回的还是中文错误日志。报错格式是服务平台的地基,如同口音,最难伪装。还有人称在输出中捕获过“trained by Z.ai”的残留字样,虽然这条更像社区狂欢里的彩蛋,却被成千上万次转发,几乎坐实了“牛来即智谱”的民间共识。

第四步是排除法。小米 MiMo v2.5 支持音频输入,而 Ox Alpha 明确拒绝音频;Qwen 3.8 Max 的视频编码特征与之明显不符;GLM-4.6V 的编码行为同样对不上。候选名单一层层划掉,最后指向的方向只剩一个。Davis 汇总四条指纹给出结论:99%的把握,Ox Alpha 属于智谱未发布的 GLM 系列血脉。

侦查现场也不全是干正事的。有人说它的服务器在北美,因此断定“不可能出自中国”;科技媒体 Wccftech 一度援引分析称,其分词器特征也可能指向微软的 MAI 系列;还有人抛出阴谋感十足的理论——这是 Cursor 拿开源 GLM 自己训练的壳,再罩上一层牛皮。爆料人士 Max For AI 则宣称“我已经确认是谁家的,100%是中国模型,作者会让所有人意外,但我现在不能说”——标准的谜语人发言,吊足了胃口。连 Google DeepMind 的研究员 Evan Otero 都赶来玩梗,先单发一个词“Gemini”,片刻后又补一句“万一 Ox Alpha 就是我们一路遇到的那位朋友呢”;同事 Vamsi Batchu 立刻接戏:“谷歌回来了,相信流程。”阴阳怪气拉满却一字不说死,直到评论区的高赞回复替全场补刀:“GLM=Google Language Model。”

需要说明的是,每一条证据单独拿出来都留有辩解空间——同源架构可能在两家实验室出现,报错风格可能彼此模仿。但四条相互独立的证据链交汇于同一个坐标时,“巧合”的解释概率便急速坍缩。严格说来,指纹技术证明的是血缘而非签名的唯一性,可当情绪与赔率都被点燃之后,陪审团的倾向早已写在了脸上:预测市场上,超过九成的押注最终落向同一家公司——智谱。

最有戏剧性的一幕发生在侦查陷入僵局之时。有人干脆直接质问当事人,8月24日观察者网也问出了那个全网都想问的问题:“你的开发者是谁?”屏幕对面返回一行冷静的回答:“我是 Ox-Alpha,由未披露的组织开发。”守口如瓶这件事,看来连模型本体都被训练得很到位。

猎巫行动也留下了自己的误判档案。性能如此凶悍,社区顺理成章地推测它的块头:流传最广的版本认为,这或许是智谱七千四百亿级纯文本旗舰 GLM-5.3 的多模态变体。直到8月26日晚谜底落地,大家才发现这是一台总参数3200亿、激活仅180亿的 Flash 基座全新模型——猜对了门第,却猜错了型号。这恰好划出了指纹技术的适用边界:词表与编码器能可靠锁定血缘谱系,却无法替目标称量体重;全民侦探擅长期待验证,不擅长规模测算。

回望这五天的猎巫,它的本质是一场规模空前的分布式信任验证:全网开发者自发担任陪审员,探针即证物,转发即庭审直播。匿名非但没有妨碍追查,反而给了大众侦探们最旺盛的取证欲一个合法的出口。真相开盘之前,其实早就写在筹码堆里了。

五、隐身模型的社区心理:占便宜与当侦探

匿名公测并不是中国人发明的新玩法。2025年 OpenAI 正式发布 GPT-4.1 之前,就以 Quasar Alpha 等化名把模型藏进聚合平台试探水温,事后大方承认收集了用户提示词用于改进模型。匿名发布原本是美系巨头的传统秘密花园。

但最近半年,这门手艺的传人换了主人。Ox Alpha 是六个月内主流分发平台上出现的第五个隐身模型,此前四个揭面之后无一例外地指向中国团队:2月的 Pony Alpha 被证实为智谱的 GLM-5,3月的 Hunter Alpha 由小米认领,Elephant Alpha 对应蚂蚁的 Ling-2.6-flash。韩国《朝鲜日报》英文版为此专程发文梳理脉络,并把这种打法解读为中国公司“借全球开发者的眼睛做公平评估”的新行规;Business Today 等媒体在 Hunter Alpha 揭面时的标题更是直白——“神秘 AI 模型背后的谜底令所有人热议”。科技圈干脆称之为“中国 AI 的假面舞会”:匿名上线、免费刷屏、社区破案、厂商认领,四步舞跳得一轮比一轮娴熟。

掌声也越过了太平洋,却在不同海岸激起不同的回声。首尔看到的是成本与威胁——《朝鲜日报》一笔一笔折算这顿全球免费午餐背后的韩元账单,字里行间压着对本土模型的焦虑;河内的标题则带着将信将疑的试探——“匿名的 Ox Alpha 引发轰动:这是中国的‘货’吗?”,问题本身已是半份答案。英文世界的转向更为微妙:最初几天的标题反复堆叠“免费”“神秘”“无人认领”这类猎奇字眼;随着指纹证据成型,悬案式的好奇逐渐让位于对中国 AI 工程实力的正面审视。一场匿名的产品测试,意外完成了一次跨语种的口碑输出——尽管输出的内容里,惊叹与警惕各占一半。

舞会能一直办下去,靠的是对两种底层心理的精准拿捏。第一种是占便宜。免费叠加超大上下文,薅羊毛变成限时竞速,工程师们连夜把私藏任务搬进来压测,把截图晒到时间线上——每一份囤积都在替模型义务投放广告。第二种是当侦探。人类天生抗拒悬案,匿名为全网装上了一台永动的解谜引擎:从token计数差异到报错格式,每个细节都是线索,每次猜测都是内容创作,每条高赞评论都是自来水。“中国有一部电影正热映,名叫《牛来》——我不明白为什么任何美国或欧洲的实验室会给自己的模型起名叫‘牛’。”X 上这条广为流传的困惑歪打正着,恰是社区潜意识里“此物多半来自东方”的直觉投射。免费让人蜂拥而至,匿名让人乐此不疲,两股欲望拧在一起产生的传播能量,任何营销预算都买不来。

命名文化是这场狂欢的最佳切片。“Ox”直译即牛,又恰好撞上彼时正在院线热映、梗图席卷全网的抽象电影《牛来》,中文社区顺理成章地为它冠上这个土味十足的名字。既然后台躺着的是匹“马”(Pony),如今又跑来一头牛,上海证券报记录下网友那句精准的刻薄:“无论从分类学还是从‘牛马’的隐喻来看,都很合理。”海外 Discord 社区则敬称其为 Bull King,与微博上的“牛模王”、朋友圈里的“牛来”遥相呼应——一个还没有官方国籍的模型,先用玩梗完成了全球户口登记。

💡 独思时刻:很多人把匿名测试简单理解成饥饿营销,我认为失之毫厘、谬以千里。饥饿营销贩卖的是稀缺,而 Ox Alpha 贩卖的是丰裕——管够、免单、随便折腾。它真正出售的商品只有一样:参与感。你既是用户又是侦探又是评委,全世界的注意力不再是单向围观一场发布会,而是集体追一部实时连载的悬疑剧。厂商省下的是预算,赚到的是一个愿意熬夜追更的社区。这才是该范式最难复制的地方——你可以照抄免费,但你买不到一场自发的全民破案。

狂欢亦有暗面。隐私研究者反复提醒:此前的匿名模型曾明确收集提示词用于训练;Ox Alpha 团队虽然承诺“本次输入不会被用于训练”,条款却仍注明输入内容由提供方留存——对象既然匿名,承诺便无从核验,违约亦无处追责。多位安全博主告诫同行勿将公司核心代码与敏感数据投入其中;还有人指出免费窗口随时可能关闭,把关键链路押在无名模型上等于埋雷。假面舞会的门票背面印着一行小字:入场免费,离场时的确定性损失自负。

六、先测后宣:一场可复制的发布范式

把 Ox Alpha 的五天摊开铺平,得到的是一部结构异常工整的三幕剧,每一幕都能单独抽出来复用。

第一幕,匿名上线。模型以隐身代号进驻聚合平台,故意剥除一切品牌痕迹,同时递上两个无法拒绝的钩子——完全免费、超大上下文。这一幕的全部功能在于清空偏见:在没有厂牌、没有国籍、没有预设好恶的白纸上,欢迎全世界的盲测。

第二幕,全网盲测。叙事权移交社区:性能实测、工程稳定性、身世侦查,内容全部由用户自发生产。这一幕藏着整个范式最精妙的自洁机制——大样本的真实使用会自动完成对小样本惊喜的过滤,80%的小子集成绩回落至63%的过程没有任何人为干预,市场亲手挤干了水分。当传统 benchmark 因泄题与刷分争议而信用折损,真实盲测恰好在公信力的真空地带立起了标杆。

第三幕,择日揭晓。在声量与好奇心的最大公约数处官宣认领,同步放出开源权重、商用定价与技术说明,把五天积攒的自由舆论一夜收敛为品牌资产。8月26日晚,智谱在公众号写下那句全场观众等了五天的台词:“发布前,我们在 OpenCode 和 OpenRouter 上以 ox-alpha 的名称匿名测试 GLM-5.3-Flash,以收集用户反馈。”协议 MIT,权重直上 HuggingFace,任何人都可以下载复核那套被反复比对过的词表——这场全民验DNA终于等来了终极对照组。

揭晓时点的选择同样经过计算:官宣恰好落在声量峰值与免费窗口关闭的交汇处,认领、开源、上线三件事被压缩进同一个夜晚完成,五天积攒的全球注意力几乎没有经历任何形式的真空,就顺着开源链接倾泻进了新的容器。至于如何把这份注意力进一步转化为可持续的商业现金流——那套以角和分为单位重写价格表的打法,是第五章要拆解的议题。

这就是“先测后宣”相对于“先宣后测”的根本优势。传统发布的顺序是先制造预期、再接受检验,实测一旦跟不上 PPT 的想象力,口碑便会加速反噬;匿名测试把顺序整个倒了过来——模型先进考场,成绩由人群唱票,等到“这东西确实能打”成为公共共识,厂商再走上台鞠躬领奖。掌声在你登场之前就已经备好,无需自己起立鼓掌。

这本账同样干净:前期投放为零,分发支出换来的是真实负载与真实反馈,认知积累全程未花一分钱;热度顶峰处揭晓,揭晓动作本身即二次传播事件。当晚微博话题#牛来回归智谱#阅读量不足24小时突破1300万,四川的用户感叹“这模型便宜得离谱”,北京的用户写道“它证明了国产开源模型在全球开发者市场又迈进了一步”。没有任何一篇公关稿能买到这种事件密度。而且这套打法自带保险丝:反响冷淡,可以静默下线无人知晓,品牌毫发无损;反响爆棚,就顺势加冕、满面荣光。下行风险有限,上行收益无上限——这是典型的期权式结构。

值得复盘的还有两次执行之间的迭代。今年2月的 Pony Alpha 是首轮彩排,验证了流程可行;这一轮则把每个环节的密度都加大了一档——规模上直接瞄准平台纪录,弹药的完整性上也今非昔比,揭晓之夜开源权重、商用定价与限时优惠全套同步落地,避免流量在真空期外溢。敢于开门迎客的底气则来自基础设施侧:每天100万亿token的调用容量敞开着,“让我们看看你能做什么”这句邀请函,本质上是把发布会预算预先兑换成了 GPU 时数。更重要的前提只有一个——模型自身过硬。隐去姓名仍能在全球最挑剔的开发者群里杀出重围,凭的只能是实力本身;弱者披上斗篷,只会死得更安静。

当然,范式远非完美。匿名期的责任真空、数据条款的不透明、“表演性免费”可能催生的估值幻觉、以及竞品效仿后稀缺性稀释的风险,都是这套打法的伦理与技术负债。方法论可以印刷,前提无法复印。

更大的隐忧在于范式的通货膨胀。揭晓日之后,《有头有脸的大模型公司,集体搞起“匿名公测”》这类标题开始密集出现——当每个团队都学会戴着马甲登场,悬念本身就会贬值。匿名若成为常态,用户将不再为“未知”兴奋,转而为“已知”的安全感支付溢价;今天的奇袭战术,可能就是明天的红海内卷。这或许也解释了智谱为什么只在第二轮就迅速把牌摊开:窗口期红利永远属于先行者,属于那个赶在所有人戴上面具之前,先把脸露出来的玩家。

就在揭晓的那个晚上,断言“不可能是 Flash”的主播收到了自己的答案,那份“99%把握”的指纹报告得到了官宣盖章,五十六天的旧王朝目送新王顶着一张牛头面具加冕。五天里没有新闻发布会,没有 KOL 预热,没有一分钱投放,只有一群程序员在终端里敲下 stealth/ox-alpha,然后被结果惊到——这本身就是最好的广告。

而这头牛脚下踩着的,是十万张国产芯片。那台庞大的算力机器如何驮起这场沉默的巨浪,是下一章要讲的故事。

本章参考资料

  1. 《AI Model Ox Alpha Is Free, Beats Claude Fable, and Nobody Knows Who Built It》,The Independent
  2. 《Anonymous AI Ox Alpha Suspected Chinese-Made》,《朝鲜日报》英文版(Chosun Daily),2026年8月23日
  3. 《AI ẩn danh Ox Alpha gây sốt: Có phải “hàng” Trung Quốc?》,Vietnam.vn
  4. 《Mystery Model “Ox Alpha” Ends DeepSeek’s Streak on OpenCode》,外媒综合报道
  5. 《Mystery behind Hunter Alpha AI model revealed》,Business Today,2026年3月19日
  6. 《神秘模型“牛来”走红,背后是中国厂商?》,观察者网,2026年8月24日
  7. 《终结DeepSeek霸榜 神秘“牛来大模型”火了》,上海证券报·中国证券网
  8. 《Ox Alpha:100万 Token 上下文、完全免费,这个神秘 AI 模型的幕后是谁?》,七牛云 AI 社区,2026年8月24日
  9. 《智谱“认领”神秘AI模型Ox Alpha“牛来”,使用量已达DeepSeek两倍以上》,华尔街见闻,2026年8月26日
  10. 《中国网友从最怪爆红电影寻找 Ox Alpha 起源线索》《牛终于回家:中国网络庆祝 Z.ai 宣称拥有 Ox Alpha》,Business Insider 台湾站
  11. 《神秘“牛来”掀翻硅谷,谷歌抢着认领被全网笑惨》,腾讯新闻,2026年8月26日
  12. 《霸榜多日的“牛来”模型,果然是智谱 GLM-5.3-Flash!》,网易科技;《Ox Alpha模型空降OpenRouter榜首 终结DeepSeek霸榜纪录》
  13. Ben Davis 于 X 平台发布的 Ox Alpha 分词器与视频编码器指纹测试系列推文,2026年8月

第四章 算力底牌——10万张国产芯片撑起的效率神话

8月26日晚,智谱正式认领“牛来”。随后放出的第一份技术文档里,藏着一行被大多数人忽略的数字:与同一批硬件上的初始基线相比,端到端服务性能提升了3倍。

3倍。不是靠换更强的芯片换来的。硬件没变,还是那一大批国产卡。这行数字推翻了过去三年AI圈一个心照不宣的前提:国产芯片只能跑跑demo,真上生产环境还得靠英伟达。

先把账面摆出来。过去一周,代号Ox-Alpha的隐身模型在OpenRouter和OpenCode两个平台上吞下了超过50万亿token的真实流量,单日峰值约62T,使用量一度达到DeepSeek的两倍以上;上线首日,它冲上两大平台榜首,把OpenRouter的单日token用量历史纪录一举抬高了约4倍,终结了DeepSeek在OpenCode长达56天的连续霸榜。这些请求没有一个落在A100或H100上——据多家媒体报道,它们全部由一支规模超过10万张卡的国产芯片集群承载,供应商据传为华为昇腾、摩尔线程、海光,智谱方面未予置评。

这可能是国产算力历史上第一次被“挤兑”到这种程度。不是实验室里的压力测试,不是精心挑选出来的峰值成绩单,而是全球开发者真实的、随机的、不可预测的并发洪峰:一个匿名模型,免费,来者不拒,五天刷新两大平台的全部调用量纪录。用户不知道模型背后是谁,也不知道芯片是谁家的,只用速度、稳定性与效果投票。检阅式的压测人人能做,全球范围的野战演习才见真章。

💡 独思时刻:我一直在想一个问题——为什么被反复强调的是“10万张国产芯片”这个总量,而不是“某款国产芯片达到了英伟达某型号的百分之多少”?因为真正卡住国产算力脖子的,从来不是单卡算力。一个系统的上限不取决于最强的部件,而取决于最窄的那段瓶颈。单卡再强,如果卡与卡之间的协作像个迷宫,一百张卡能跑出五十张的效果就算烧了高香。十万张卡撑住62T的日流量,这件事本身就在宣告:国产算力的瓶颈已经从单卡这一层,上移到了组网与调度这一层——而后者恰恰是可以用算法和系统工程去补的短板。想明白这一点,就看懂了本章全部故事的地基:这是一场没有换掉任何一颗芯片的胜利,赢在纸面之下。还有一个时间细节值得留意——这一切发生在智谱发布旗舰GLM-5.3的同一周之内:月初刚秀完智能上界,月末就演示智能成本的另一端,这种双线作战的组织强度本身就是信息量。

一、华为、摩尔线程、海光:十万张卡的首次大规模实战验证

最先给出名单线索的是《晚点LatePost》。据其报道,为Ox-Alpha提供推理服务的算力据传来自华为昇腾、摩尔线程、海光三家,智谱对此未予置评。官方技术文档的措辞则始终停留在集体名词层面:“过去一周,我们首次在大规模流量中尝试用国产芯片集群提供服务,这些芯片通过自研高带宽互联网络连接。”具体型号、各家配比、组网细节,一概不见下文。另有媒体援引知情人士的说法称,相关模型的训练环节也可能得到过国产芯片的支持,但同样无从证实。能够确认的只有一件事:匿名测试期间的所有线上请求,全部由国产芯片供血。

供应商名单为什么悬而不决?一种合理的解读是:在商业谈判、供应链安全与行业关系多线并行的情况下,点名任何一家都意味着让另外几家付出舆论代价;保持模糊,反而让这次发布成为整个国产算力阵营的联合发布会。这或许正是各方心照不宣的最优解——资本市场显然也是这么读的,细节后文再表。

名单真假暂且按下不表——反正短期内也不会有权威答案,更值得细看的,是这三家公司分别代表的三条路线。

第一条,华为昇腾的系统整建制路线。据公开资料,目前的主力推理产品昇腾910B采用7纳米级工艺,FP16算力约320TFLOPS,已支撑万卡级集群稳定运行;下一代昇腾950规划中的超节点方案,则以一千余张NPU互联为一个整体计算单元,对外提供EFLOPS级的FP8算力。昇腾的打法从来不是单卡单挑,而是用整机柜、超节点和高带宽互联把成百上千张卡焊成一个“逻辑GPU”——以系统之长,补单卡之短。这种哲学与智谱本次的做法一脉相承:都不指望奇迹般的单兵战斗力,都用工程把平凡个体组织成非凡整体。

第二条,摩尔线程的全功能GPU路线。这家从图形渲染起家的公司坚持让AI计算与图形处理共用一张卡,配套自研的MUSA统一计算架构。全功能的好处是用途宽、兜底性强,代价是每一种能力都要自建软件栈。过去它的舞台更多在中小规模商业部署,倘若本次传闻属实,这将是一家本土GPU公司第一次站上十万卡级、直面全球前沿模型流量的战场——对于一家仍处在市场检验初期的公司来说,没有比这更昂贵也更有说服力的广告位了。

第三条,海光信息的GPGPU兼容路线。海光的深算系列DCU源于早年获得的AMD授权起步,指令集形态与软件栈同主流生态血缘最近,在开发者社区里长期被视为“迁移摩擦最小”的国产选项之一。对智谱这样需要在开源框架上迅速搭起生产级推理的公司来说,兼容性带来的时间红利是实打实的:同样一套部署方案,在某些平台上也许要折腾数周,在这里可能几天就能上线。

三条路线,恰好对应国产AI算力的三种典型活法:整机协同派、自建栈派、生态兼容派。放进行业坐标系里看,变化甚至比外界的印象更快。据Bernstein研究等多家机构的口径,英伟达在中国AI芯片市场的份额已从三年前的约95%跌落到个位数,国产AI加速卡的份额则首次站上六成;各类买方调研纪要亦估计,2026年国内厂商的算力卡出货量将进入数百万张的量级,其中昇腾单一品牌约占三成,其余份额由寒武纪、海光、沐曦、摩尔线程等厂商分食。风早就起了。但在公开市场上,一线模型公司敢把十万张量级的国产卡直接顶到全球真实流量面前的先例,在这之前是零——份额说的是存量信心,这一次验证的是增量勇气。

这就是这次验证最锋利的地方:免费的、匿名的、来自世界各地的流量,是最刁钻的一份考题。负载的时段分布完全不可控,任务类型高度混杂——有人拿它读论文,有人用它写网页游戏,更多的用户挂着一开就是半小时以上的Agent长会话不放,上下文滚雪球一样膨胀。它不像跑分那样可以挑一个舒服的输入形状,每一次请求都是突然袭击。扛住这种输入,结论就不再是“演示可行”,而是“商用成立”。

再往深处看一层,这份考题的残酷性在于匿名等于零滤镜、免费等于零门槛。付费用户会为不完美的体验留三分余地,白嫖的用户只会用完就走,顺手还在社交平台留下差评;更不必说混迹在流量里的同行试探者、专喂刁钻长上下文的压力测试爱好者,以及各家竞品派驻的“匿名品鉴团”。这些最不友好的输入,一股脑涌向了这支国产芯片集群——它接住的不只是全球开发者,还有全世界最挑剔的目光。而GPU折旧、电费与工程师的深夜,没有任何人为智谱报销;这更像一笔记在未来账本上的投资。

一句话小结:这场发布会真正交付的产品不是模型,而是一个已被证实的命题——国产算力可以从PPT上的形容词,变成生产日志里的动词。

二、为什么偏偏是Flash:一套像是为国产卡量身画出来的架构

先看清单卡的病根

平心而论,换任何一款前代主力模型,这个故事都未必讲得通。答案要从单张国产卡最明显的两个短板说起:内存容量,以及内存带宽。

大模型推理本质上是极度访存密集的工作。每生成一个token,模型都要把累积至今的全部KV缓存——一份对上文逐层留下的“摘要备忘录”——从显存里重新搬一遍;上下文越长,备忘录越厚,每次搬运就越多,速度上限便卡在带宽而不是算力上。更隐蔽的连带效应在于:KV缓存越肥,同一块显存能同时伺候的请求数就越少,集群的有效并发被狠狠摁住。麻烦在于,GLM-5.3-Flash原生支持最长100万token的上下文,而320B总参的模型在长文本下的KV体积,对任何显存捉襟见肘的卡都是噩梦。看上去这是个死局:最需要的资源,恰好是国产卡最缺的资源。

智谱的回答分成两层——模型层釜底抽薪,系统层移形换位。

混合注意力:把搬运量打到地板上

模型层的答案是结构性的。GLM-5.3-Flash是首个采用线性注意力与稀疏注意力混合设计的开源前沿模型。拆开看:线性注意力放弃了对每个字都重读全文的传统做法,改用一个随阅读不断更新的固定尺寸状态来消化局部依赖——好比一本随写随翻的记账本,无论生意做多大,账本厚度不变,逐token的开销不再随文本膨胀;稀疏注意力则养了一位轻量级索引员,百万token的长卷里只把真正值得精读的全局片段调上来细看,不对全文平均用力;配套的IndexPool再把索引员手里的四本卡片目录加权合并成一册,专治索引器自身在超长上下文下的内存和延迟问题。整套组合拳的效果,按智谱测算:与旗舰GLM-5.3相比,注意力计算量降低约3.01倍,KV缓存大小降低约4.44倍。

这两个数字必须翻译成国产卡的母语才有味道。KV缓存砍掉近八成,意味着同样一段长对话所需的显存只剩原来的两成出头,每次生成要搬运的数据近乎同比例缩水,原先被缓存放大的那块带宽瓶颈原地松绑——国产卡最短的两块板子,被模型结构整个绕开了。同时,省出来的显存转头变成了并发容量:同样的卡,现在能同时揣着更多用户的上下文,集群整体吞吐水涨船高。

不妨再算一笔小账。以一段二十万token的超长会话为例,KV体积降到原来的两成多之后,原本需要跨好几台服务器分摊的上下文,如今一两张卡的显存组合就能完整装下;装得下,就不必为每次生成做跨机搬运;不必搬运,逐token的出字速度自然抬升。更妙的是这笔账是乘法不是加法:缓存瘦身、并发提升、带宽减压三项互为因果、层层放大,落到用户端就是那个被全球开发者用脚投票出来的体验——又快又稳还免费。

另一头,总参320B、每token仅激活18B参数、层数压缩到45层的MoE架构,把计算重心压回矩阵乘法上,而这正是各路国产芯片堆料最足、最容易干出漂亮峰值的部分。一减一加之间,模型的耗水点被挪出了国产卡的旱区,挪进了它们的丰水区。

系统层的动作则是把官方那句“以算力换带宽、以通信换显存”落成施工图。智谱在开源框架SGLang基础上构建了专用推理引擎:节点内张量并行摊薄单卡压力;W8A8量化把权重位宽压掉一半;INT8、FP8、BF16混合缓存量化让KV缓存挤进更小的容器;ReplaySSM与Layer Split则在执行层面精细腾挪。FP8精度下全套权重约306GiB,寻常多卡服务器拼一拼就装得下,无须依赖顶级进口卡的超大显存;模型权重同时以MIT协议在HuggingFace开源,支持SGLang、vLLM、TokenSpeed等主流引擎部署,开源社区可以直接复现这套部署配方。

所以,与其说是一群工程师含辛茹苦把大模型伺候上了国产卡,不如说是模型架构师与系统工程师并肩坐在一起,提前一年多就为这批硬件画好了图纸:注意力和KV缓存是搬运大户,那就削减搬运;国产卡的峰值算力相对充裕,那就设计“多用运算、少用过路”的结构。适配不是事故之后的抢救,而是立项之初的共同设计。这不是运气,是方法论。

顺带厘清一个命名上的误会。“Flash”在行业语境里向来是“又快又便宜”的产品线传统名称,容易让人联想到旗舰缩水的特供版;但这次的平台并不是从旗舰身上裁下来的边角料,而是围绕低成本推理重新设计的新基座——第三方综合评测57分的成绩、从上一代92层大幅瘦身到45层的全新结构,都在说明这一点。名字借用了旧的货架,货物却是按新的物理定律造的。

不过账要算全套。官方数据同样显示,GLM-5.3-Flash平均每层的KV缓存大小仍略高于Kimi K3与DeepSeek V4 Flash,社区测试里它跑长程Agent任务的速度也尚未达到旗舰水准;智谱坦承这些是后续优化的方向。换句话说,架构把短板藏进了系统里,并没有让短板消失——这正是留给下一版本的作业题。

三、端到端提升3倍的系统工程:把十万张卡拧成一股绳

EPD分离:让每个阶段吃自己最擅长的那口饭

模型架构决定了“单个请求有多便宜”,集群问题依然悬着:十万张异构卡,怎么排班?智谱在集群层面启用Encode-Prefill-Decode分离式架构,简称EPD——多模态编码、Prompt预填充、逐Token解码,被拆成三个可独立调度、独立扩缩容的工作池。

为什么非要拆?因为三个阶段的资源画像几乎毫不相干。编码阶段吃算力,图像进模型时的批量矩阵运算是典型的计算密集型重活;预填充吃内存带宽,要在一次扫描里读完动辄上万token的Prompt并把缓存建好;解码吃访存延迟,token一个个往外蹦,每一步都在等数据到位。三个工种挤在同一批卡上,等于让短跑、马拉松和射击运动员共用一双鞋——永远有一块资源在大部分时间里闲得发慌。拆开之后,各池按需分配最合适的卡,互不拖累:编码洪峰来了给编码池加卡,深夜解码闲了就让解码池瘦身,哪里出现热点就给哪里补位。

分离还附赠两个工程红利。其一是抗洪:三个池子天然形成缓冲层,某个环节被巨型请求打爆时,排队压力不会直接传导至全链路;其二是灰度:新机型、新固件可以先放进一个池子试运行,炸了也不伤全局。对一个要七天二十四小时直面全球流量的系统来说,这两条比峰值性能更救命。

尤其值得点破的是,EPD这套打法在国产卡上的增益比在同构英伟达集群上更显性。原因藏在“异构”二字里:十万张卡来自不同厂商、不同代际,单卡性能参差本是常态,混在一起排班时木桶效应会被放到最大——任何一阶段慢下来,整条流水线都得陪着喘息。而池化隔离恰好对症下药:算力富余的卡去编码池逞强,带宽充裕的卡到预填充池安家,访存表现平平的卡在解码池靠稳取胜。调度层的聪明之处在于,它不需要每一颗螺丝都完美,只需要每颗螺丝都被拧在对的位置上。

举个例子——这是一个基于公开架构描述的合理推演:假设你在8月22日深夜随手丢给“牛来”一段五百行Python代码请它review。这条请求进入流水线的瞬间,编码池的卡也许正替另一位用户理解界面截图,预填充池正在为你扫读上下文,解码池则在逐字敲出上一个请求的回答。三条流水并行不悖,你的排队时间不会被别人的巨型Prompt绑架。所谓3倍,省的就是这笔原本被闲置又被浪费的钱。

数字由智谱正式公布:同一批硬件,端到端服务性能较初始基线提升3倍;官方进一步表示,硬件效率与单Token成本“已达到与主流英伟达GPU相当的水平”。请注意这句措辞的克制之处——它并没有声称国产卡的单卡性能追平了英伟达,它说的是整套系统的单位成本服务能力追平了。对定价者而言这是天壤之别:成本结构成立了,每百万token输入0.8元、输出2.8元的定价才立得住脚。省钱的一半来自模型,另一半就藏在这一节。

ZCube预演:不加一块GPU,多榨出15%的能力

3倍从来不是临阵磨枪的产物。今年5月,智谱罕见地公开了一项已在生产集群验证过的组网架构创新——ZCube,堪称教科书级的“抠算力”:GPU一张没加,服务器一台没换,应用代码一行没动,仅凭重构集群网络拓扑,推理总吞吐提升15%,首Token响应时间的P99尾延迟下降40.6%;这些数字全部来自真实生产流量,而非仿真推演。一项同时披露的小实验更能说明病灶:其他条件不动,仅把网络带宽从200Gbps提到400Gbps,推理总吞吐即上升约10%——带宽,才是那个被冷落太久的阀门。

为什么网络成了水位线?传统数据中心网络是树状分层结构,跨节点通信常常要翻越两三层交换机,好比所有车都得挤同一座立交桥,高峰期的拥堵让再贵的引擎也白搭。ZCube发表于网络领域顶会ACM SIGCOMM 2025,思路干脆利落:把“路网”拍平。在主流400Gb交换机配置下,仅需一层交换机即可拉起一张连接一万六千余张GPU的扁平网络,同等规模的传统方案需要三层;规模化落地之后,交换机与光模块用量反比原方案节省三分之一——效率升上去、账单降下来,在资本开支以十亿计的行业里是不折不扣的重磅消息。智谱联合驭驯网络与清华大学,在GLM-5.1线上生产集群完成了这次改造。回头看,当时业内只当是“智谱在抠算力”,如今才看清那是十万张国产卡走上生产线的战前演练。

看得见“网络才是下一个主战场”的不止一家。几乎在ZCube公布的同一时间窗口,OpenAI联合英伟达、AMD、英特尔、微软、博通发布了面向超大规模AI集群的MRC多路径可靠连接协议,铺开在其自有超算之中。一个改协议层的“交通规则”,一个改架构层的“物理路网”,中美头部团队殊途同归地把筹码押向同一个方向。北京计算机学会AI专委会秘书长、北京大学特聘研究员张有鱼当时的点评切中两层含义:技术上,真实生产数据证明网络架构可以成为独立的效率杠杆,边际改造成本极低,在全行业砸钱买卡的氛围里,这种“四两拨千斤”比再下一笔芯片订单更具性价比;商业上,谁从既有资产里多榨出一成产出,谁就能在API价格持续下探的市场里拉开身位。

把这一节连起来看:EPD拆解的是计算流的阶段,ZCube拆解的是数据流的路径——前者让每张卡都有活干,后者让卡与卡不再互相干等。十万张异构卡在洪峰面前稳得住,是这两场手术合流后的结果。

一句话小结:10万张不够强的单卡,加上不讲情面的调度学,等价于一支足够强的舰队。

四、SemiAnalysis的量化依据:CUDA护城河为何再受考验

围观群众盯着的往往是关键词,专业机构盯着的是可复核的度量。这次发声的SemiAnalysis并非普通自媒体:它是英伟达财报电话会上会被点名引用的研究机构,手里握着业界知名的推理基准体系InferenceX,各家芯片的实测数据都要摊在它的实验台上过秤——由这样一家机构说出“再受考验”,权重与营销号的情绪化欢呼截然不同。智谱官宣前后,SemiAnalysis给出了那条被广泛引用的点评:继Jalapeño(OpenAI自研推理芯片)宣布之后,CUDA护城河再度受到考验。它同时认可了一个此前颇有争议的前提——这套国产芯片方案的硬件效率与单Token成本,已可与英伟达GPU相提并论。耐人寻味的是,大多数转载只保留了“护城河”三个字的戏剧性,却漏掉了这句话里同样重要的另一半:对一套非英伟达方案给出效率与成本层面的对等评价,此前几乎没有过先例。

要把这条点评的分量称出来,必须先补齐“第一次考验”的坐标。就在认领前一天的8月25日,OpenAI在Hot Chips大会上交出了首款自研推理ASIC Jalapeño的首份实测成绩单,测试由SemiAnalysis的InferenceX基准支撑,覆盖GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T三款公开模型。几组关键数字如下:单用户出词速度,Jalapeño达到每秒1459个token,GB200约为535个;跑完同一个任务,Jalapeño用时1.65秒,GB300耗时5.99秒;标称功耗700瓦对对手的1400瓦,实测持续功耗还压在550瓦以内。汇总下来,其每瓦AI工作负载吞吐达到GB200、GB300的1.5至1.9倍,端到端延迟改善1.7至3.6倍,在高交互负载下差距进一步放大至2.1至4.1倍。硬件规格同样激进:一颗主计算die配上六颗HBM4,合计216GiB、15.4TB/s带宽,每瓦HBM带宽指标高达22,同口径下Rubin为11.1、GB300只有5.71。SemiAnalysis据此估算其单芯片每小时总体拥有成本约1.56美元,与H100的1.55美元几乎持平,远低于Vera Rubin的3.61美元。别忘了电力才是数据中心真正的天花板——“每瓦吞吐”不是实验室里的趣味指标,而是地产商换算成美元账单的硬约束。

现在可以把两次考验放在同一杆秤上了。第一次考验说:你可以自己造芯片绕开CUDA,只要你烧得起研发和量产的钱——这条路属于财大气粗的美国头部玩家,从设计到流片仅用9个月的Jalapeño是与博通联手、绑定10吉瓦级订单的产物。第二次考验说得更诛心:你甚至不必造芯片,把手头这些与英伟达存在代差的国产卡用好,用算法补偿硬件,同样能把全球流量接住——这条路成本门槛低得多,可复制性也强得多。英伟达护城河讨论从此有了新的参照系:单卡百分之多少的领先,在系统工程面前不再是不可逾越的天堑;衡量一家AI公司的维度里,“单位美元的服务能力”正在取代“配置表上的峰值算力”。

还要替OpenAI补一句公道话:他们的芯片自救并不是针对英伟达的负气之举,而是推理经济学走到今天的必然——当推理消耗吃掉数据中心的大部分电力,把每一瓦都花在刀刃上就是第一性的商业诉求。这个逻辑对任何用量巨大的AI公司都成立,区别只在于美国队选择重铸刀刃,中国队选择磨快现有的刀。动机无关立场,路径各有国情,效果却可以放在同一张能量表上比大小——这正是SemiAnalysis把它们并列点评的技术底气所在。

当然,宣判死刑为时尚早。英伟达的统治不止一面:CUDA之外还有NVLink互联、TensorRT整套推理栈,以及训练侧近乎垄断的心智份额。就连口出狠话的OpenAI也没有真翻脸——就在公布Jalapeño前三周的8月上旬,英伟达同意为OpenAI的俄亥俄州数据中心园区提供最高1050亿美元的融资支持;OpenAI芯片负责人理查德·霍的表态同样直白:英伟达仍是重要的合作伙伴,我们还需要大量英伟达芯片。SemiAnalysis创始人Dylan Patel那句“连Rubin也被超越了”固然语惊四座,但专业读者更该记住他对自家基准数据的克制态度——每瓦1.5倍的领先与死亡通知书之间,还隔着量产爬坡、软件成熟度和整整一个商用周期。护城河与友尽墙的区别就在于:水的流向变了,墙还没塌。

一句话小结:考验的意义不在推翻,而在祛魅——CUDA从信仰降格为选项,而降格一旦发生,就不会逆转。

五、从“可用”到“好用”的三重跨越

过去几年,“国产芯片只能救急,不能安家”几乎成了行业的条件反射。这副有色眼镜背后,其实叠着三层具体而真实的顾虑——逐一比对这次的案例,会发现三层都被实质性地推过去了。

第一重是性能。单卡算力与带宽的差距最直观、也最容易被量化。诚实地说,这一层的差距仍在缩小而未被抹平。但这次给出的启示是:实战中它的正确打开方式不是硬追峰值跑分,而是像第二节所示的那样让模型长在硬件的优点上——性能焦虑的最优解不在晶圆厂里,而在计算图里。

第二重是稳定性。大模型服务最怕的不是慢,而是时好时坏——决定用户体验的常常是P99延迟,也就是最慢的那百分之一请求要等多久。对Agent场景尤其如此:一个挂几十分钟的长任务,中途哪怕只是偶发卡顿都可能带来状态错乱乃至前功尽弃。这次的62T日峰值洪峰等于把最坏情况强制拉满:一批非英伟达品牌的卡组成的大集群,端到端稳住了面向全球的免登录服务,七天没掉链子。能把P99摁住的集群才配谈生产环境,能在野战里活下来的部队才算真正的正规军。

第三重是生态,也是最深的一层。英伟达的统治力从不只在卡本身,而在从CUDA到cuDNN再到TensorRT的一整套开箱即用体系,外加十几年积累的教程、问答和人才储备。换国产卡从来不是“拔插一颗芯片”,而是整条软件栈的重写。这次的做法值得同行抄作业:不另起炉灶造私有框架,而是站在SGLang这样的开源底盘之上自建引擎——开源社区多年的工程积淀先接住基本盘,差异化优化再叠加在上面,生态缺口用工程能力一段一段填平。三层顾虑对照下来,“可用”与“好用”之间的距离,原来可以用三件武器丈量:一套长在硬件优点上的模型架构,一层把异构硬件组织起来的调度系统,一块垫在脚下的开源软件地基。而且这三件武器没有一件是孤品——它们都沉淀在智谱自家的推理栈里,意味着下一个想上国产卡的团队不必从零蹚河,照着这份图纸施工即可。

资本市场读懂了这道阅读理解。8月27日,港股智谱(02513.HK)跳空高开逾8%,盘中一度涨超10%,有报道称收盘涨幅维持在11%附近;同日上证科创板芯片设计指数收涨5.57%,存储与AI芯片板块领涨,“国产算力从可用到好用”成为当日卖方研报里密度最高的一句话。钱从来不说谎,但它偶尔会说得太满。硬币的另一面也要看清:有行业分析持续提醒,先进制程产能与高带宽内存的供给仍是中期约束,先进工艺代差、高端存储紧张都是公开讨论中的老问题;一次成功也不能线性外推成全局替代。从可用到好用再到“想都不用想”,中间还剩最后一级台阶,那是留给下一代国产芯片与新架构模型的作业。

一句话小结:信心比黄金珍贵,而信心的定价,那天直接写在了K线里。

六、算法补偿硬件:自主算力的闭环,和一个藏起来的彩蛋

把本章四个主角排在一条时间线上,智谱的棋谱一目了然:

架构层——45层深度、18B激活、混合注意力,从源头削减计算与搬运;推理层——EPD三池分离加上激进的量化压缩,让存量卡满负荷做工;集群层——ZCube重构组网,让卡间公路永不高峰拥堵;硬件层——一切流量落在国产芯片之上。四层环环相扣,这才构成那句“硬件效率与单Token成本可比英伟达GPU”的完整解释。这不是“用国产卡替换英伟达卡”的单点置换,而是一套算法补偿硬件的方法论:单卡弱,就让模型少吃;互联窄,就让数据少跑;生态缺,就借开源垫脚。每一步单拎出来都不惊艳,叠在一起却完成了从零到一的通路。它意味着中国AI公司第一次拥有了一条可以独立于英伟达供应链运转的算力路径——不是“不用英伟达”,而是“不一定非用英伟达不可”。这条路径的意义还会随时间复利:一套被十万卡真实流量验证过的推理栈,本身就是可迁移的资产,它能托举的不只是一款模型,而是此后每一代产品。

半导体产业史上反复上演过一个规律:后发者很少靠逐项追赶单点参数取胜,赢家的惯常姿势是重新定义评价体系。当年听惯了“制程落后几纳米”的叙事,如今棋盘上的问题已经变成“你的一美元能服务多少个token”——评价权这种东西,从来只认跑通的路,不认喊出的声。

这一章还有个容易被一眼滑过的彩蛋,藏在官方开放文档的角落里:整个推理引擎的构建工作,由GLM-5.3驱动的infra智能体显著加速——它协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈。换句话说,这届用AI造出来的推理系统,服役的第一个对象就是AI自己;模型优化系统,系统反过来承载模型。听上去像哲学口号,其实是具体的生产力:算子优化、瓶颈定位这类高度模式化的Infra劳动,重复性高、判据清晰,恰是当代大模型最胜任的工种之一。工程师定方向,AI跑里程,组织里真正稀缺的资源由此被挪去了更高处。

耐人寻味的是,太平洋对岸的同类闭环也在同步转动。据Hot Chips披露的信息,Jalapeño从设计到流片只用了9个月,远低于行业常见的18到36个月,秘诀同样是把AI请进了流片室:AI辅助设计帮SIMD单元省下8%面积、矩阵引擎省下10%面积,在注意力与MoE模块上,AI生成的代码跑得比人类顶尖专家的手笔快1.5到1.8倍。一条飞轮在大洋两端同时转动——AI设计芯片,芯片跑AI,AI再回头优化芯片上的AI。区别只在于半径:美国队纵向卷出新硬件,中国队横向用好旧硬件;卷法不同,卷出的方向却惊人一致。这也再次呼应本章开头那个判断:决定上限的早已不是最贵的那块硅,而是组织硅的方式。

两次考验叠加,C-U-D-A四个字母的神话色彩开始褪色,但常识不该跟着褪色:护城河还在,训练侧的天平也未倾斜,只是它第一次出现了漏水点——而且是从两端同时漏的。

一句话小结:当补短板的方式从“下单买卡”扩展为“算法补偿硬件”,竞赛就从军备赛变成了修桥赛——后者恰恰是最擅长修桥的那群人的主场。

本章参考资料

  1. 智谱AI开放平台官方文档:《GLM-5.3-Flash 跑在国产芯片上》,2026年8月26日
  2. 腾讯新闻:《智谱“牛来”模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40》,2026年8月26日
  3. 《晚点LatePost》相关报道:“牛来”模型算力供应商据传为华为昇腾、摩尔线程、海光,智谱未予置评,2026年8月
  4. 钛媒体:《GLM-5.3-Flash发布,多模态终于来了》,2026年8月
  5. 证券时报网:《智谱:GLM-5.3-Flash跑在国产芯片上》,2026年8月27日
  6. 《科创板日报》:《不加一块GPU,多榨出15%算力:大模型圈开始对网络“动刀”》,2026年5月22日
  7. 新浪科技:《智谱发布Infra新成果:同等硬件投入,算力多出15%》,2026年5月21日
  8. 新智元:《中国团队突破瓶颈!不加GPU,万卡集群算力暴涨15%》,2026年5月
  9. 格隆汇:《背刺英伟达?OpenAI甩出新“武器”!》(Jalapeño Hot Chips实测数据汇总),2026年8月26日
  10. 极客公园:《OpenAI 芯片实测跑分揭晓,“为模型造芯片”时代来了》,2026年8月26日
  11. 快科技:《撕掉追随者标签!国产GPU原创架构逆袭》(引Bernstein Research中国市场份额口径),2026年5月18日
  12. 上海证券报及证券时报综合报道:智谱(02513.HK)2026年8月27日行情与科创板芯片指数收盘综述
  13. 学术文献:ZCube 组网架构论文,ACM SIGCOMM 2025

第五章 价格屠夫——0.8元/百万token 的底层经济学

GLM-5.3-Flash 发布的那个晚上,很多开发者的第一反应不是去刷评测,而是把定价表看了三遍。

每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元。对照自家旗舰 GLM-5.3 的 8 元与 28 元,正好是十分之一;对照 Claude Opus 4.8 的 5 美元与 25 美元,折算下来约为四十分之一;再把发布期的限时折扣叠上去——折扣价大约再打对折,相当于把旗舰价格压到了二十分之一。大多数人盯着前两行看热闹,真正值得玩味的是第三行:缓存命中只要 0.23 元,几乎白送。定价表上敢这么标价的厂商,等于同时在告诉世界两件事——它的价格很低,以及它非常清楚自己的钱是从哪一行省出来的。

公告里那句话当天刷了屏:“同样智力,1/40 价格,前沿智能,第一次不需要省着用。”

“省着用”三个字戳中的是过去两年所有靠 API 吃饭的人的共同痛感。一位独立开发者的经历曾被反复引用:他在 2025 年做了款 AI 会议纪要工具,用户涨得不慢,可每月看到 API 账单都想关停服务——每处理一场一小时的会议录音,token 成本就要吃掉他收费的四到六成。他自我调侃:“我不是在用 AI 做产品,我是在给模型公司打工。”开发者社区当时流传一个段子:你训练模型烧钱,我调模型也烧钱,大家都有光明的未来。

于是问题摆在桌面上:把价格砸到地板的 0.8 元,到底是亏本换市场的悲壮冲锋,还是一条已被跑通的成本曲线的自然报价?本章把它拆成三步:成本端到底发生了什么;这场定价的对局里各方都在做什么动作;最后把两种会计口径各自的成立条件与软肋摆上台面——不下结论,只给判据。

💡 独思时刻:追踪一家公司的定价轨迹,比听它讲战略更有信息量。据当时的公开报道,2025 年春天智谱曾把 GLM-4-Plus 一次性降价九成参与行业价格战;到了 2026 年年初,据行业媒体梳理,它又把 API 与订阅套餐连续上调四轮、累计涨幅约八成;2026 年 8 月 26 日晚,它干脆用一款 Flash 把自家旗舰价格的十分之一变成了地板。三年三次掉头,一次比一次剧烈。我不认为这是精神分裂——它更像一套完整的棋谱在不同阶段的落子:旗舰负责锚定“智能上界”的定价权,Flash 负责用工程效率收割价格敏感的长尾。两条轨道互不拆台,反而合成一道价格防线:你要最强的智力,就得接受旗舰的牌价;你只要够用的智力,这里有彻底删掉溢价后的价钱。想明白这套“双轨制”,就看懂了本章全部故事的地基。

一、定价逻辑拆解:成本端的三层多米诺

单位 token 的服务成本是一道乘法题:每个 token 的计算量×每次计算背后的电费与折旧×整个系统的非效率系数。想把价格降一个数量级,单改任何一个乘数都不够,必须三层同时松动——Flash 的降本组合拳恰好对应这三个乘数。

架构层:先让每个 token 少算一点

GLM-5.3-Flash 总参数 320B、每次推理仅激活 18B、层数压缩到 45 层;作为对照,上一代 GLM-4.5 是 355B 总参、激活 32B、92 层。激活参数近乎腰斩,层数砍掉过半,每生成一个 token 所需参与计算的神经元数量大幅下降。混合注意力带来两个更关键的数字:注意力计算量较旗舰降低约 3.01 倍,KV 缓存体积缩小约 4.44 倍。后者需要向非技术读者解释一句:模型越长谈越贵的根源就是 KV 缓存——历史上下文要在显存里随身携带,上下文越长搬运越多、占用越狠。把这个包袱缩小四倍多,等于把“长上下文”这项奢侈品的进货价打了骨折。

必须说公道话:稀疏化本身不是新发明,MoE 是行业通解,线性注意力与稀疏注意力的思路在开源社区早有先声。Flash 的差异不在“发明”,而在取向——这是一个从第一天就为成本结构而设计的基座,而不是先造一辆豪华车再哭着打折出售的库存。

引擎层:同一批卡多喂三倍的饭

第二个乘数的功夫在工程侧。针对国产芯片内存带宽相对受限的特点,智谱基于 SGLang 改造出专用推理引擎:节点内张量并行、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split 分层切分;部署形态采用 EPD 分离式架构,把多模态编码、Prompt 预填充与逐 token 解码拆成三类独立调度的工作池,各按算力特征伸缩。官方口径的结果是:同一批硬件上,端到端服务性能较初始基线提升 3 倍。技术细节第四章已经展开,此处只取它的经济学含义:硬件没换,同样的房租多接待了三倍的客人——这 3 倍不是性能数字,而是毛利率的重构。

定价表第三行的玄机也在这层揭晓:0.23 元的缓存命中价之所以敢定这么低,是因为 KV 缓存体积缩小了 4.44 倍——缓存越多,厂商省下的真金白银越多,于是用极低的缓存单价反向激励用户把重复前缀都交给缓存。这是一处典型的激励相容设计:用户的省钱路径恰好是厂商的省卡路径。

集群层:折旧、电价与利用率三角

第三个乘数藏在重资产账本最沉的那一栏。芯片通电那一刻就开始贬值,利用率是唯一能对冲折旧的杠杆。前文第四章已经交代,这次全部推理流量承载于十万张以上的国产芯片集群——供应商据《晚点LatePost》报道传为华为昇腾、摩尔线程、海光,智谱方面未予置评。放进行业坐标系里看这件事的分量:中国移动通信研究院的数据显示,传统模式下智算中心 GPU 平均利用率通常不足三成;而头部云大厂凭借内外部业务互相填谷,能把利用率抬到 85% 以上——阿里巴巴管理层曾在财报电话会上形容,自家服务器里几乎没有一张卡是空的。利用率的差距就是毛利率的差距,三十个百分点上下,胜负立判。电价维度同样如此:业内报道普遍援引的数据显示,东部沿海工业电价约合每度 0.6 至 0.8 元,内蒙古、甘肃等绿电洼地可以做到 0.25 至 0.3 元,把可延迟的任务调度进低谷时段,又能在电费单上抠出一层利润。

三层乘数一起压小,地板价才有了立锥之地。

用一个刻意粗糙但方便记忆的思想实验来体会这种乘法关系:假如一个基线系统的每个 token 要做满三单位的计算,其中三分之一的花费消耗在等待与碎片上,剩下的开支又被折旧与高峰电价层层垫高——那么当架构把计算量砍去三分之二量级、引擎把有效利用率抬高一倍以上、缓存再把重复上下文的搬运近乎折叠归零时,三项改善不是简单相加而是彼此相乘,最终的数量级跃迁恰好足以铺通从几十元跌进一元区间的价格通道。这就是工程账本与财务账本之间那条隐秘的传送带:工程师改的是流水线,财务账本上呈现的则是毛利率曲线的整体换轨。SemiAnalysis 对此事的评价颇具分量:这套体系的硬件效率与单 token 成本已经可以比肩英伟达 GPU,“CUDA 护城河再受考验”。但有一个误读必须在第一时间纠正:所谓四十分之一,绝不是说国产芯片的硬件推理成本只有英伟达的四十分之一——那是服务价格的对比,中间隔着一层商业决策:效率追平给了定价自由,定多低则是另一种选择,里面含着让利的成分、汇率的成分和对竞品价格表的针对性校准。一句话小结本节:Flash 没有发明永动机,它只是把题量、电费与空转这三个乘数同时调小了——每个乘数都不是奇迹,乘在一起才显得像奇迹。

二、限时折扣与“二十分之一”:补贴,还是成本预告?

真正的分歧点在折扣。限时折扣期内价格大约再降一半,输入价进入 0.4 元量级,对应旗舰的二十分之一。如何理解这个姿态,业界立刻分成两派。

第一派称之为渗透定价的老配方:先用补贴炸开市场份额,教育用户形成习惯,等资金弹药耗尽或垄断地位确立后再回收定价权——互联网商业史上这样的故事不胜枚举,而且大模型行业此前几轮价格战确实大多雷声大雨点小,喊出低价的套餐往往限量限购、形同虚设。

第二派认为这是成本曲线的公开预告:厂商借“限时”二字给自己留足弹性,同时向对手宣告斩杀线的位置——那条让前代竞品瞬间失去性价比的临界价位。支持这一派的证据来自同业的镜像行为:据媒体报道,小米 MiMo-V2.5 在 2026 年 5 月宣布的是“永久降价”而非限时优惠,最高降幅达 99%,降价后单周调用量增长了 66%;海外的 GPT-5.6 Luna 上线三周即降价八成。当“降价”从营销话术变成产品策略的常规动词,就说明至少有一部分玩家是真心相信自己的成本曲线还在下坠。

鉴别两种解读,靠的不是听发言人的措辞,而是盯住两个可观察变量:其一,折扣退坡后的留存率——如果用户潮水般退去,说明此前的调用是被低价暂时租来的;其二,规模化常态负载下的实际单位成本能否稳稳托住 0.8 元的无折扣底价。冷静的旁观者也不缺席:中国信通院人工智能研究所国际发展部主任许珊就直言,仅靠极致低价建立的高占比非常脆弱,一旦海外厂商跟进降价、或中国模型调整自身定价策略,当前的流量结构会快速瓦解。完稿前夕,市场上也开始流传个别国内同行酝酿跟进式激进报价的风声——本书无法核实此类传闻,但它至少提示了一件事:这条赛道上没有人打算坐视地板价长期通行。

折扣的身份,大概率介于营销漏斗与成本宣言之间。它究竟是哪一个,判决书不由发布会书写,而由折扣结束那个月的续用率书写。

还应当补一层行为经济学的注脚。“限时”二字本身就是定价工具的一部分:先以超低折扣充当价格锚点,抬高用户对同类产品的心理参照系,再在退坡时利用温和的损失厌恶完成过渡——比起一开始就定 0.8 元,“曾经 0.4 元、后来回到 0.8 元”反而更容易被视为公道。同一份折扣表因此在无形中完成了三件事:拉新获客、压低对手的谈判空间,以及一场免费的价格发现实验——厂商借真实世界的成交数据,悄悄校准自己在无补贴状态下的需求曲线斜率。回望这行业的定价史,更适合佐证的是节奏本身:2025 年的价格战曾把全行业利润表烧穿,2026 年年初的集体回调又证明纯低价不可持续,如今折扣潮汐的一涨一落已成为这个市场的呼吸节律,Flash 不过是把这套节律推到了幅度最极限的一次深呼吸。

三、对照组实验:百元输出与峰谷涨价的两条路线

把 Flash 的发布放在行业日历上看,时点的戏剧性会加倍显现:它跳水的方向,恰好与两条主流曲线相反。

第一条曲线属于 Kimi。据开发者社区与部分财经报道流传的说法,Kimi K3 的输出价格已站上百元每百万 token 的量级。另据爱分析机构的拆解,K3 参数规模高达 2.8 万亿、MXFP4 量化后的权重文件约 1.4TB,连八张 H200 的显存加起来都装不下,这意味着它的推理只能栖息在最昂贵的英伟达 B300 级算力之上——而 B300 的服务器月租行情,按爱分析的观察已从年初约 12 万元涨到年中 19 万元以上。该机构据此测算:即便假设满负荷运转加上九成缓存命中,K3 在 B300 上的月度毛利依然为负。这组未经公司确认的第三方估算未必精确,但方向性的结论很难推翻:一家公司在设计阶段选定的参数规模与芯片路线,基本锁死了日后定价的自由度。换句话说,K3 的百元输出不是傲慢,是物理约束下的求生。当然也该替它说一句公道话:K3 并非没有对冲手段。据爱分析观察,其开放权重的协议中包含一项安排——对年 MaaS 收入超过一定门槛的合作服务商收取模型授权费,走轻资产分成的路子。换言之,K3 未必指望自营推理业务赚钱:把昂贵的推理外包给全世界愿意付费的机房,自己坐在上游收取智力租金,也是一条完全成立的商业模式——只是它与极致低价天然互斥,一家靠别人部署自己的模型抽成的公司,无论如何开不出地板价的推理服务。定价策略的分野由此显形:有人选择做收租的上游,就必然有人选择做让利的地面。

第二条曲线属于 DeepSeek。这位昔日性价比标杆的选择耐人寻味:据部分开发者社区反馈,V4 Flash 提价后调用量下滑了一半;另据行业媒体报道,8 月 17 日 DeepSeek 启动峰谷分时定价,V4 Pro 高峰时段涨幅最高超过十倍——像电力系统一样按时段售卖稀缺算力,这个动作本身就是 Token 供给侧紧张的白皮书。涨价当然证明需求旺盛:据摩根士丹利统计,第二季度中国模型输出的 API 均价已升至每百万 token 约 21.9 元,同比上涨超过六成,全行业正集体把通用 token 的价格往成本线上修。甚至智谱自己也在这条曲线上——据行业媒体梳理的公司披露口径,其 2026 年一季度 API 价格累计上调约 83%,同期调用量反而增长约 400%。

就在这三条曲线齐头向上的时刻,Flash 反身向下俯冲。逆流跳水者只有两种可能:要么握着别人没有的成本结构——第一节那三层多米诺给出的正是这个答案;要么纯粹倚仗融资胆量豪赌。两者之间的甄别窗口同样设在折扣退坡时刻。不过俯冲者也有自己的软肋,社区实测的反馈很直白:Flash 的速度明显慢于旗舰水准,长程 agent 任务半小时起步、一小时常见。定价上这等价于一笔隐性延迟税——“快而贵”与“慢而便宜”会被务实的开发者分别记进不同场景的成本核算,而这个分工恰恰可能正是定价者所期望的:把它赶到并不在乎等待的长尾场景里去。

四、开发者迁移潮:生态正在重构,钱还留在原地

价格信号最终都要落到人群的行为上。OpenRouter 平台的数据给出了宏观图景:2026 年 8 月的月度调用榜上,前七名全部是中国模型,前十名中占据八席,合计调用量占到前十总量的 88.1%;中国模型的份额从 2025 年上半年的 4.5%一路升到 2026 年 8 月的超六成。微观样本则生动得多:硅谷创业者 Ben Cera 今年 4 月收到一张 120 万美元的 AI 账单,转头切换到 MiniMax 与 GLM 的组合,两个月后月度支出降到 10 万美元;据报道,美国初创公司 Lindy 整体迁移到 DeepSeek 后推理成本下降了九成;DoorDash 则公开了它的分层外包哲学——简单客服与基础编码交给中国模型,最难的任务留给 Anthropic。

结构性原因藏在使用形态的变化里:Agent 时代单个请求的 token 消耗是普通问答的十几倍,Agentic Coding 任务的平均输入输出比可达一百五十比一以上。耗水量指数级放大之后,价差不再是百分比优惠,而是能不能活下来的问题——六十倍价差撞上高消耗场景,雪崩随之而来。这也顺手解释了一个经典疑问:为什么性能榜上同为一线的模型,市场表现会出现数量级的分化?因为下游需求的敏感系数本身就变了。

但重构这个词需要两面理解。正面是锁定效应:迁移完成的链路会沉淀 prompt 资产、评测脚本与工程惯性,回迁的经济阻力随时间递增——为了省回一点差价把整条流水线再折腾一遍,几乎没有理性的开发者愿意做;应用层也因此多出一批过去不敢立项的产品形态——那些只有把边际成本压到广告级才能养活的场景,终于获得了出生证明。反面则是价值分配的原地踏步:平台数据显示 Claude 系列仅占 OpenRouter 调用量的 12%,却拿走了约一半的消费金额——token 跑在中国,利润留在 Anthropic。Flash 们当前收割的,主要是高频低难度的长尾流量;高价值决策类任务的堡垒不仅未被攻破,反而在涨价中愈发金碧辉煌。

说得再具体一点。发布后第三天,一位做跨境电商 SaaS 的朋友发来消息:“我把三个产品的模型调用从 Claude 切过来了,成本直接从每月两万降到五百。”后面跟着龇牙笑的表情。我没有急着替他高兴——他回答的是月账单,没回答的是留存。这五百块能坚持多久,取决于三件事。第一件是数学:就算折扣取消、价格翻五倍回到两千五,相对原来的两万依然是近九成的削减,所以他留下的概率天然偏高——折扣是否永久,远不如相对价差重要。第二件是质量底线:假如下一轮促销季里多语言客服出现语气漂移、细致条款归纳漏项之类的生产事故,他就不得不把最关键的那条路径再挂一份旧方案的保险,纸面节省被悄悄蚕食。第三件是转换成本:他在新链路上沉淀的代码、评测与降级策略越厚,回头的心理阻力越大。两周后再问他,答案朴素:“能用就懒得动了。”这句大白话翻译成经济学词汇,叫转换成本锁定。迁移潮的方向由价差发起,由锁定效应固化——但它目前重塑的只是流量的版图,收入的版图改变起来要慢得多。

这些份额同样需要放进正确的坐标系里校准:据行业分析,OpenRouter 一家的调用量大约只占全球 token 总盘子的百分之二上下,用户高度集中于价格敏感的独立开发者与初创团队;在美国整体企业级大模型市场,中国模型的占比据估计仍停留在个位数百分比,绝大多数中大型企业依然把预算留给 OpenAI 与 Anthropic。六成的占比是真实存在的阶段性战果,但成立条件相当苛刻——超大的价差、高消耗的 Agent 场景、平台宽松的计费规则期,三者缺一不可;任何一项松动,数字都会重新定义自己。读懂这个前提,才不会把一场长尾市场的闪电战误读为整条战线的总攻。

生态重构也不只发生在开发者一侧,供给侧的角色同样在围绕 token 重新站队。据行业报道,中国电信已启动百亿级的 Token 工厂集采,中国移动上线了 Token 通用服务——手握消费者与政企两大渠道的运营商入场,意味着 Token 迟早会变成与话费包、流量包并列的标准商品,由最强的分发网络批量零售。与之对照的是夹缝中的独立服务商:既没有模型定价权,又要按市场价租卡并向模型方缴纳授权费,盈利公式的关键变量没有一项握在自己手里,被业内普遍视为这门生意中最难走出亏损的一环。渠道在下沉,算力在集中,模型在上游收租——产业链的每一层都在向 token 这个最小计价单元收敛,而定价权的归属将决定谁站在新食物链的哪一级。

五、从每美元多少参数到每美元多少智能

把镜头拉远,0.8 元真正的冲击力不在价格本身,而在它逼着全行业更换计价的尺子。这个行业先后用过三把尺子。第一把是参数:千亿万亿地层出不穷,参数成了对外叙事的硬通货——直到大家发现客户买的从来不是参数,如同买椟还珠。第二把是榜单:benchmark 的繁荣催生了刷榜经济学,分数与生产环境的表现渐行渐远,这也是本书反复强调 benchmark 必须搭配生产采纳证据的原因。第三把才是单 token 价格:价格战教会了所有人算术,每百万 token 几块钱变得透明可比——缺陷是它回避了那个更要紧的问题:花这些钱买到的是什么水平的能力?

第四把尺子刚刚出场:每美元购买多少智能。做法不复杂——把综合能力评分除以实际定价。Artificial Analysis 的智能指数体系已为此提供了公共基准,而 Flash 的成绩单恰好站在这套坐标系的极端位置:57 分的综合智能指数与 Claude Opus 4.8 持平,账面定价却只有对方的约四十分之一。“智能单价”这个从前只出现在投资人备忘录里的概念,一夜之间变成了采购说明书的第一行。

尺子换了,行为就跟着换。各家平台竞相推出 Token Plan 与 Credits 精细计费,替代过去的包月畅享;企业开始建立专门的 Token 成本管控体系,把规则性任务路由给低成本模型,只在复杂重构与疑难调试时调用旗舰;按效果付费与多模型混合调度正在成为标配。更深一层的变化在供给端所有玩家的共识里:连最不缺钱的 OpenAI 都在 Hot Chips 上公布了自研推理芯片 Jalapeño 的实测数据——GPT-OSS 120B 等模型在其中的每瓦吞吐达到 GB200/GB300 的 1.5 至 1.9 倍。巨头的动向往往是趋势的最强背书:关于单位成本的战争早已开打,区别只是有人用新芯片打,有人用新架构打,有人两样一起打。国内的分布节点同样密集:中昊芯英宣称其第二代 TPU“须臾”(算力 1792TOPS)要把单百万 token 硬件成本在上一代基础上再砍一半、后续迭代目标是压到现有的十分之一;清程极智“赤兔”引擎据称把昇腾 910B 八卡机运行千亿模型的硬件支出从 600 万元压至 150 万元;无问芯穹团队提出“优化即利润”,实测通过架构优化把单个 token 的成本降低 37.5%。这些散落在不同发布会上的数字,拼出了同一条陡峭向下的人力不可抗拒之曲线。

星环科技 CEO 孙元浩对此有过一句冷峻的点题:Token 工厂赛道竞争激烈的根源,在于 Token 价格与算力采购成本之间的价差过小、盈利空间逼仄。当毛利薄如蝉翼,出路只剩两条:把分子上的智能做大,或者把分母上的成本做小。Flash 选择的是后者,并把战果直接写进了价格表。每美元多少智能的时代,参数规模不再自动兑换为竞争力——这是效率成为新护城河这一命题,在定价维度的落点。

这轮讨论中最锋利的表述,叫“Token 零毛利时代”。多家行业专栏与研究机构给出过大同小异的判断:通用大模型的裸价利润率已进入长期下行通道;更有测算列出“通用 Token 每赚 1 元亏数元、场景化 Token 却可溢价十倍”的极端对比(以上均为媒体与研究机构的观点推演,而非审计结论)。假如这一判断大体成立,推论残酷而清晰:单纯贩售通用智能终将无利可图,定价权的重心必然上移——要么向场景纵深索取溢价,要么向成本曲线索取红利,二者必居其一。Flash 的选择是后者:不与对手争夺场景溢价的高地,而是先把成本曲线打穿,把省下的每一个铜板让渡给用户,用价格本身构筑别人难以跟进的地面优势。这等于对“零毛利”预言给出了一种正面回应——毛利可以趋近于零,但只要成本下得比价格更快,负毛利的诅咒就落不到自己头上。

六、亏损换市场,还是规模效应的自然定价?

最后回到那个绕不开的问题:0.8 元到底赚不赚钱?先把材料摊开,并事先声明口径——下列数字均来自公开报道转述,读者宜持保留态度:据多家媒体报道的年度财报数字,2025 年智谱研发开支达 31.8 亿元、年内净亏损约 47.18 亿元,有媒体据此测算其“每赚 1 元亏 6.5 元”;另有报道称,其 MaaS 平台的年度经常性收入在 2026 年 3 月达 17 亿元、同比提升约 60 倍,注册用户突破 400 万、业务覆盖 218 个国家和地区,前十大互联网公司中有九家集成 GLM 系列;进入 7 月,又有行业媒体援引公司口径称其整体 ARR 已冲上 10 亿美元——倘若串联的各环节均属实,Anthropic 从 1 亿走到 10 亿花了 15 个月,而据报道智谱只用了 5 个月。

面对同一份材料,存在两套都能自洽的算法。第一套从损益表出发,把亏损理解为固定投入的分期确认:研发与训练是一次性沉没的成本,推理的边际成本随调放量被无限摊薄,只要调用曲线持续陡峭上行,每 token 平均成本就会持续下穿售价线。它的成立前提有三——融资环境不恶化、调用增速不掉档、旗舰溢价不被后辈平替侵蚀;它的脆弱之处也在这里,任何一条断掉,“未来会摊薄”就永远停在未来。第二套从单位经济出发,根本不看总账的赤字,只问每一个 token 是否边际为正:若变动成本低于加权单价、且高毛利的缓存命中占比持续走高,那么每一笔调用都是微利,报表上的巨额亏损主要来自不随量变的固定项。它的前提同样苛刻——GPU 利用率须爬过盈亏门槛:爱分析指出,独立模型厂商的利用率通常难以超过七成,与云大厂的 85% 相距悬殊;折扣退坡后均价回升而不击穿留存,国产集群在大规模常态负载下的故障与折旧可控。值得一提的是该机构给出的另一组对照:此前据报道,GLM-5.2 因可以塞进月租仅数万元的昇腾服务器而能做到约 20% 的利润率,同期定位相近却只能栖身 B300 的模型毛利为负——能不能住进便宜的机器,早在模型设计那天就定了。

把两套算法放在同一个坐标系里,就能看见所谓的规模效应临界点究竟长什么样:盈亏平衡所需的最小日均调用量,等于固定成本除以加权单价与边际变动成本之差。分子被三层降本持续压薄,分母被激励相容的缓存定价持续增厚,剩下的变量只有一个——调用量的增长斜率。这条逻辑链有三个证据桩:国家数据局披露 2026 年 3 月全国日均 token 调用量已突破 140 万亿,市场总盘子足以容纳一个被价格释放出来的长尾市场;匿名测试期 5 天超 50 万亿、峰值约 62T 的瞬时洪峰证明了基础设施的下限;十万张国产卡的固定产能则需要常态负载去填满——假如折扣退坡后留存住哪怕一半的迁移用户,0.8 元就从补贴价滑向了接近盈亏平衡的自然价区间。反之,若增速放缓、利用率跌落或留存崩塌三者居其一,同一个 0.8 元就瞬间还原为一场代价高昂的市场倾销。

据财报发布后多家媒体报道,CEO 张鹏在业绩会上抛出过一个公式:AGI 商业价值=智能上界×Token 消耗规模。前半句解释了旗舰为何敢逆势提价——高阶智能是当下的稀缺资源,掌握上界者掌握定价权;后半句解释了 Flash 为何敢俯冲入海——消耗规模的引爆器安装在价格门槛上。但这个等式的阴面同样一目了然:假如折扣退坡击穿了留存、或旗舰的上界被追赶者抹平,两项相乘得到的就是一笔日渐贬值的资产,公式将从增长引擎衰变为估值稀释器。公式的最终检验器既不是掌声也不是股价,而是接下来几个季度的调用量与续费率。

对于想亲自跟踪这道题的读者,这里留一份四行的核对清单。一看折扣退坡日之后三十天的留存率与日均调用量是否稳住过半——这是判断补贴成色的第一现场。二看官方是否上调无折扣底价:敢涨价且不掉量的底价才是真底牌,迟迟不敢涨则说明连厂商自己都在怀疑成本线。三看第三方云平台上 Flash 权重的实际部署量与调用热度——开源权重在外部机房的流转数据,是绕开自营口径的独立验证通道。四看竞品的跟进幅度:对手若愿意贴着你的价格定价,本身就是对你成本可行性的反向背书;若集体按兵不动、只以小幅促销试探,则值得多一分警惕。清单很短,却比任何一篇多空争论都更接近真相。

所以 0.8 元到底是什么?它显然不是慈善——慈善不会精确到把缓存命中价算出小数点后两位;也很难说是陷阱——陷阱不会连同约 306GiB 的 FP8 权重一起按 MIT 协议开源,让任何人都能下载权重文件、自行部署去复核成本与质量。本章能够负责任地写下的判断是:两种会计口径各自拥有成立的罗盘,也各自拥有失灵的磁极,此刻无论断言“稳赚”还是“必赔”,都是越过证据的抢跑。价格屠夫挥下的这一刀,砍出的是新的价格地板,还是旧的成本幻觉——判卷人不是发布会,而是折扣退坡之后那条真实的调用曲线。

本章参考资料

  1. 腾讯新闻:《智谱“牛来”模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40》,2026年8月26日
  2. 智谱AI开放平台公告及定价页:GLM-5.3-Flash 输入0.8元、输出2.8元、缓存命中0.23元及限时折扣说明,2026年8月26日
  3. 钛媒体:《上线三周开启屠龙刀法,OpenAI定价的底层逻辑正在被改写》,2026年8月
  4. 爱分析(新浪财经转载):《卖Token的,谁在赚钱?》,2026年8月18日
  5. 产业家(腾讯新闻):《告别“堆卡”:2026,中国算力开启“Token价值产出”大考》,2026年8月19日
  6. 今日头条科技:《中国大模型在OpenRouter调用占比超60%,靠低价能走多远?》,2026年8月
  7. 南方财经网:《Token走向零毛利时代,智谱路在何方》,2026年8月
  8. 大河财立方:《当大模型不再拼价格,智谱走向定价权中心》,2026年8月
  9. 经济观察类媒体:《“大模型第一股”年报出炉,如何以智能“上界”掌握定价权》,2026年3月
  10. 格隆汇等行情综述:《智谱高开!“牛来”大模型身份曝光》,2026年8月27日
  11. 深度栏目报道:《深度|Token定价相差数倍!大模型行业亟待建立计量标尺》,2026年
  12. 中新经纬报道汇编:《美企转向中国大模型,最高省九成成本》(Lindy、DoorDash等案例),2026年8月1日
  13. 硬科技媒体报道:《1792TOPS算力!国产AI芯片暴降token成本,CEO揭秘4大技术诀窍》(中昊芯英相关内容),2026年
  14. 《2026硬核成果丨提速度,降成本!我国自研技术,让国产算力从“能跑”走向“好用”》专题报道,2026年
  15. SemiAnalysis 相关评价与《晚点LatePost》算力供应商报道综合,2026年8月

第6章 余波震荡——发布后的市场连锁反应

一场发布会的影响半径,从来不由发布会本身决定,而由它在第二天早晨的市场里激起多大的涟漪决定。8月26日晚,智谱认领「牛来」、上线并开源 GLM-5.3-Flash 的官宣信息发出之后,最先睡不着的不是开发者社区,而是香港中环的交易员们——他们需要在次日开盘前搞清楚一件事:一个主打「便宜地聪明」的模型,究竟值不值得真金白银地下注。而在同一张时区表的西侧,硅谷的分析师们也在加班加点,试图回答一个镜像问题:一套不依赖英伟达的算力底座,到底走到了哪一步。

这一章记录的就是这条涟漪扩散的头几十个小时:港股的K线、A股的ETF榜单、社区里的段子、学者朋友圈的一条短评、竞品群里意味深长的沉默,以及太平洋对岸那条被转发了两千多次的推文。把它们按时间轴铺开,你会看到一条完整的传导链——技术事件如何在一个交易日之内,变成资金事件、舆论事件和行业心理事件。

一、8月27日港股盘面解读

先看最硬核的证据:钱。

8月27日早上九点半之前,港股集合竞价时段,智谱(02513.HK)的买单就已经排起了长队。九点半一敲钟,股价跳空高开逾8%——上证报口径的开盘价定格在1115港元附近,较前一个交易日的收盘价高出八十余港元。这个开盘几乎没给空头任何喘息空间:等观望资金反应过来想要低位接货,股价已经站在了水面之上。

开盘之后的走势并非一条直线向上的完美弧线。早盘时段,获利盘与追高资金有过一轮短暂拉锯,股价一度小幅回落,但全天最低点始终稳稳站在前收上方——没有人愿意在这个位置交出手里的筹码。真正的第二波攻势出现在午后:多家媒体的盘中快照显示,智谱午后短线拉升,盘中一度涨超10%,站上1144港元;而在此前后,另一批媒体的快照里写下的读数是「盘中涨超9%」「盘中一度涨超11%」,到了临近收盘,又陆续出现了「收盘涨约11%」「大涨近12%」乃至「涨近13%」等不同版本的描述。同一天早晨,板块监测快照里还留着一个更早期的身影——「智谱涨超5%,天数智芯、壁仞科技涨超4%」。

要把这些互相打架的数字放进同一个坐标系里理解并不难:它们都是同一根分时曲线在不同时点的取景。对一只当日换手剧烈的股票来说,从「涨超5%」到「涨超8%」再到「涨超10%」「涨超11%」的每一个切面都真实存在过,区别只在于你在哪一分钟按下截图键。真正不会骗人的是总量:全天成交异常活跃,股价重心一寸寸上移,若以行情软件的收盘快照为准,智谱定格在1160港元一线,全天振幅超过八个百分点。对本书而言,比记住任何一个具体百分数更重要的是这一系列快照共同描摹出的形状——一根高开、回踩不破缺口、午后再度拔高的被持续买盘托举的放量长阳。这一天,智谱的市值凭空长出了一家中型上市公司的体量。

比涨幅本身更有说服力的,是这场上涨的「逆市」属性。就在同一天,恒生指数收跌0.34%,恒生科技指数也在水面之下徘徊——大盘在跌,智谱在涨,而且在港股人工智能板块里一骑绝尘。同样吃到资金的还有「大模型」标签的同门标的:TechWeb 的稿件快照里,MiniMax 升逾3%,百度集团涨超4%。钱不是漫无目的地涌进来,而是精确地对准了大模型这一个标签——资金很清楚自己在买什么。

还有一层容易被忽略的注脚。据财经媒体回顾,今年6月22日,智谱股价曾一路触及2980港元的历史高点,市值一度突破万亿港元,随后经历了漫长的回撤消化。换句话说,8月27日的这根阳线,是市场在被打过冷水之后,第二次为一个 AI 故事集中按下买入键——而这一次,故事的背后有了跑了整整五天的真实流量、十万张国产芯片的行业传闻和一份挂在官网上任人查验的技术博客。

盘面解读到这里就够了,剩下一句话留给定性:这不是一次情绪性的脉冲,而是机构资金对一个新叙事的集体表态。

二、AI概念股走强的叙事逻辑:故事到业绩

A股的钱包几乎在同一时间打开,而且打开的方式更值得玩味。

当日收盘,上证科创板芯片设计指数收涨5.57%,存储芯片、AI 芯片方向全线飘红。跟踪这一指数的多只科创芯片设计ETF批量涨超5%,整齐地排在当日ETF涨幅榜的最前排——收盘日报里,「批量涨超5%」是对这群产品步调一致最简洁的形容。放进大盘的坐标系里看更显眼:沪指涨1.13%,深证成指涨1.50%,创业板指涨1.71%,科创50指数大涨3.77%,沪深两市成交额2.13万亿元,较前一交易日放量超过三千亿元。放量上涨的含义很明确:进场的不是存量腾挪的浮筹,是新钱。

放大镜凑近一点看,这批ETF自身的结构还藏着更多信息。公开的盘中播报显示,其中一只跟踪上证科创板芯片设计主题指数的产品,午间刚过就把盘中涨幅扩大到了5.29%,而这已经是它连续第三个交易日上行;该指数的前十大成分股覆盖 AI 芯片、CPU、存储等核心设计赛道。这意味着什么呢?意味着当天通过ETF渠道进场的每一块钱,都不是在押注某一家公司,而是在打包认购「国产算力设计链」这条完整叙事。个股需要调研能力,指数只需要世界观——当门槛最低的资金通道出现如此整齐的动作时,说明「换叙事」已经不是少数研究团队的内部观点,而是零售与机构共同接受的公共知识。

个股与细分板块层面的联动同样是教科书式的。存储、光通信、PCB 概念在港股集体走强——光缆龙头涨逾10%,积层板龙头涨逾10%,PCB 代表企业涨近7%。这些公司与智谱没有任何股权或业务上的直接往来,它们的共同点是:全部身处国产算力的供应链纵深之上。资金的推理链条清晰得近乎粗暴——模型火了,推理需求是真的;推理需求是真的,承载它的国产芯片就不是故事;国产芯片不是故事,整条产业链的每一个环节都要重新标价。这也是那几天各大ETF净申购名单上芯片类产品密集现身的原因:普通投资者未必能分清 MoE 与稀疏注意力的差别,但他们看得懂涨幅榜和新闻联播之间的因果关系。

事实上,当日的收盘综述里还存在一种「归因之争」:有媒体把硬件行情的另一重燃料归结为同周披露的英伟达财报点燃了全球硬件景气度——此前亦有这样的背景新闻在圈内流传:电商巨头计划再加购海量英伟达 GPU。这种归因自然有其依据,但它恰恰反衬出科创板芯片设计指数5.57%涨幅的特殊之处:在全球硬件共振的大背景下,A 股资金选择把最高的溢价给了「国产算力」这个局部,而不是均匀洒向整个赛道。溢价的倾斜方向,就是判断力的倾斜方向。

这就是「从故事到业绩」的完整切换。过去两年里,「国产算力」是一个只需要信念就可以持有的题材:替代是大方向、生成式AI是大革命、沾边就能涨。而8月27日的这轮资金换了一套决策框架——它们买的不再是「某天也许」,而是一个已经发生了五天的既成事实:五天累计超50万亿token的真实流量、一份被独立评测机构打出57分、比肩海外旗舰的成绩单,以及一张明码标价、任何人都可以即时验证的收费表。换言之,「国产算力从可用到好用」不再是一句口号,它第一次拥有了一份可以被审计的对账单。

如果你那天恰好在上海浦东的某家券商营业部里,能听到散户们讨论的不再是「英伟达又涨了多少」,而是「那个牛来的模型是不是真的跑在国产卡上」。零售资金的注意力转向,往往是叙事完成从圈子内自嗨到大众常识换血的最后一个信号。

如果给这一天的买家名单做一个粗粒度的画像,会发现三类资金的决策节奏泾渭分明。最先动手的是跟踪事件驱动策略的交易型资金,它们的依据是发布当晚的信息增量,成本是开盘的那一跳;上午十点前后陆续进场的是行业研究驱动的机构配置盘,它们要在电话会与卖方晨会里确认「流量是真的、芯片是国产的、价格是有毛利的」这三件套之后才肯抬手;而通过 ETF 渠道涌入的广义公众资金,则要到收盘后的涨榜推送抵达手机屏幕的那一刻才完成认知更新——它们的子弹大多会在下一个交易日抵达。三种颗粒度的决策周期错开,意味着行情未必一天走完,也意味着第二天的接力成色才是判断这轮定价能否站稳的试金石。但无论快慢,三拨人当天读到的都是同一份材料——这在信息高度不对称的市场里,本身就是一次罕见的公平。

一句话收束本节:当天资本市场发生的事,本质上是一场为期五天的公测,被全体投资者在事发之后追认了一票。

💡 独思时刻:我观察了自己团队在8月27日当天的行为变化。上午十点,三个工程师先后在群里发了意思几乎相同的同一句话——「我去看看能不能把咱们小工具的推理后端切过去。」没有 KPI 驱动,没有产品经理催促,纯粹是看完性能与价格数据之后的肌肉记忆。那一刻我意识到,真正意义上的「市场冲击」不是股价涨了几个点,而是你什么都没说,团队里的人已经在自发地迁移工作流。价格降到某个阈值以下,决策就不再是决策,变成了本能。

三、「牛模王」昵称背后的情感投射

资本市场用涨跌幅投票,开发者社区用一个外号投票。

谜底揭晓之后,HuggingFace 上的 GLM-5.3-Flash 模型页在24小时内涌入上千条讨论。有人在评论区贴出用一张消费级显卡跑通量化推理的截图,附言只有三个感叹号;有人在 Reddit 上发起横向对比——同一段前端组件代码的生成任务,GLM-5.3-Flash 的产出比 Claude Opus 4.8 少了近三成的 token 消耗,而逻辑分支一条没丢;智东西的编辑连夜做了整宿实测,让它剪视频、复刻游戏《深海迷航》的经典场景,第二天清早发出的稿件里顺手算了笔经济账:对比旗舰方案,综合价格降了97.5%。某技术社区博主的标题更为直白——「六天前那头没人认领的牛,昨晚直接杀死比赛了」。

在这样的氛围里,「牛模王」三个字完成了从中文名向海外圈的迁移。OpenRouter 的 Discord 频道里,开始有人用 Bull King 指代 GLM-5.3-Flash——把中文谐音梗直译出去,竟然毫无违和感。这不是一个严肃的学术评价,但恰恰是这种不严肃说明了问题:开发者对一个模型的最高赞美,不是写评测报告,而是给它起外号。评测报告可能是合作方约稿,外号却免费并且不可收买。

往深处看,「牛模王」承载的情感结构相当复杂。它首先是对「平权」的庆祝——当一个模型的定价被压到旗舰的几十分之一,原本因为 API 账单不敢放开手脚的小团队和个人开发者,突然获得了与大厂同一数量级的火力,这种「我也用得起最强」的感受需要一个出口。其次是对「反转」的爽感——过去一年多的常见剧本是国内模型追赶海外的评价体系,这一次掉了个头:一款中国的模型先在海外社区的盲测里被封神,官方再慢悠悠出来认领。叙事上的攻守易形,让长期处于追赶者心态的开发者群体获得了一次久违的心理代偿。最后才是戏谑本身——「牛来」这个名字自带喜气,把它升格为「牛模王」,是典型的中文互联网造神仪式,而参与造神的每一个人,都顺手留下了一份带有个人印记的传播素材。

当然,社区不全是赞美诗。同期也有清醒的声音提醒:这个模型的速度仍逊于旗舰水准,长程 agent 任务半小时起步、一小时常见的耗时确实劝退了一批场景;KV 缓存的占用仍略高于两位老对手,官方自己也承认这是后续优化方向。把恭维与批评放在一起看,反而更像成年人对待一件真实作品的态度——它已经好到值得你认真花时间去挑毛病。

为什么一个外号值得在讲资本市场的这一章里单独占一节?因为对一门生意而言,用户的情感浓度是比功能列表更稀缺的资源。愿意给你起外号的用户,大概率也会在下一次选型时第一个想起你——这笔心理账户里的存款,迟早会反映在某一天的成交量里。

四、张有鱼学者观点提炼

喧嚣之中,一条更具方法论价值的评论来自学术界。8月27日下午,北京大学特聘研究员张有鱼在朋友圈发了一条短评,旋即被多家媒体转载。他把智谱这轮打法概括为「三部曲」:匿名上线、全网实测、择日揭晓。在他看来,这套策略的价值不在于制造惊喜,而在于在揭晓前完成了真实流量压测,并且收割了盲测口碑。

这个观察点出了问题的本质。传统的发布会模式是:厂商先说「我很强」,然后等用户去验证——信任成本由厂商承担,每一句宣称都要在铺天盖地的质疑声里艰难爬坡。匿名测试则把顺序倒了过来:用户先实打实地用了五天,自己得出「这玩意儿是真强」的结论,然后厂商才轻描淡写地站出来说「是我们做的」——信任成本由体验自动消化,官宣当天不存在任何宣称与事实之间的鸿沟。前者是在悬崖边上修栈道,后者是把桥修好、请大家先走过去,再揭开施工方铭牌。

把镜头稍微拉远,会发现这已不是孤例。今年春节前夕,一个名为 Pony Alpha 的匿名模型上线后被证实为 GLM-5,智谱首次跑通了「隐身—实测—揭晓」的全流程;这一次是第二次执行,节奏明显更加从容——8月20日以 Ox-Alpha 的身份悄悄登陆 OpenRouter,随即登顶并把这个平台的单日 token 纪录抬高了约四倍;随后终结 DeepSeek 在 OpenCode 上的连续56天霸榜;其间,独立研究员通过分词器指纹与探针测试给出「99% 把握指向智谱」的侦探式推演,预测市场上超九成的参与者押注智谱。整个过程里,悬念不是靠保密协议维持的,而是靠开源社区的好奇心供养的。好奇心是最便宜的营销预算,也是最贵的忠诚度测试——一个人只有在真的觉得「好用」的时候,才会愿意花一下午给它验明正身。

从产业组织的视角看,「三部曲」实际上重构了新品发布的博弈结构:厂商不必再为发布会的背书成本下重注,用户也不必再为「PPT 参数」的可靠性付学费,双方在一个匿名状态下完成了自愿的、大规模的、难以伪造的相互验证。五天、50万亿token、单日峰值约62T的调用洪峰——这份账单没法造假,因为它是由全球开发者的真实调用行为一笔一笔垒起来的。任何技术白皮书都可以写得漂亮,唯独流量图谱骗不了人。

这条朋友圈被转载的过程同样值得玩味。多家科技媒体在当天下午到傍晚之间先后引用了这几十个字,配上的标题却高度一致地把落点放在「方法论」三个字上——学界与业界罕见地在同一张桌子上达成了共识:值得讨论的不是这个模型有多强,而是这种发布方式改变了什么。有分析师进一步延伸:倘若「匿名公测」从此成为行业惯例,传统发布会的整个产业链——提前泄露的爆料节奏、发布会前排的媒体席位、发布当晚的通稿流水线——都将贬值;新品营销的核心资产,将从「保密能力」切换为「压测数据的含金量」。也有冷静者提醒,「三部曲」的前提是一次性准备到位的模型质量,盲测是把双刃剑,翻车的代价会被同比例放大——它奖励真金,也加倍惩罚镀金的。这个提醒恰如其分:这套打法的门槛不在于敢不敢藏,而在于藏住的货够不够硬。

一句话提炼这个观点的分量:当大模型竞争进入「眼见为实」阶段,发布会越来越像谢幕仪式——产品真正的首演,发生在没人知道它是谁的那几天里。

五、国内竞品的即时冲击

如果说海外社区的反应隔着一层语言与时差,那么国内同行感受到的压力则是零时差的、直接的,而且是成倍的——因为 GLM-5.3-Flash 选定的价格坐标实在太过刁钻。

要理解这种刁钻,得先把时钟拨回此前的一个多月。据多家科技媒体报道,国内大模型的 API 价格在那段时间刚经历一轮集体上调:DeepSeek 将主力模型的输入价格上调至原来的两倍以上,高峰时段翻番计费;据报道,月之暗面的 Kimi K3 把输出价格定在了每百万 token 100 元的高位,数倍于前代。涨价潮彼时的解释是「挤出补贴、回归商业本质」,行业内的默契潜台词是:烧钱换规模的时代结束了,该回到正常的商业逻辑了。然而话音未落,GLM-5.3-Flash 带着「输入0.8元、输出2.8元、缓存命中0.23元」的报价单进场——相当于自家上一代旗舰的十分之一、限时折扣期再减半、约为 Claude Opus 4.8 的四十分之一。这是一次教科书式的「斩杀线」操作:它压出的价位不是「略有竞争力」,而是足以让此前整个定价体系的合理性一夜之间变得可疑。

还有一个容易被叙事忽略的细节:发起价格冲击的这一方,本身恰恰是此前涨价潮的参与者之一——据媒体报道,智谱自己就在今年早些时候取消过订阅套餐的首购优惠,并上调过旗下轻量款模型的 API 价格。这层背景让8月26日晚的报价单显得更有信息量:如果只是烧钱抢市场,任何一家有资本输血的公司都做得出来;但在行业集体选择「往回收缩补贴」的当口,反手把新基座的价格钉在十分之一的位置,靠的就不是勇气而是账本——注意力计算量较上一代旗舰下降约3.01倍、KV 缓存下降约4.44倍、推理引擎的端到端服务性能提升三倍,这些此前章节拆解过的架构红利,在这一刻兑现成了报价单上的小数点。降价的底气写在架构里,而不是写在融资额里——这是竞品真正难以模仿的部分。

在这种量级的价格差面前,同行最初的反应耐人寻味。据社区观察,认领消息传出的头二十多个小时里,DeepSeek 的开发者群里出现了这样的问答:有开发者试探性地问「能不能给个匹配牛来的折扣方案」,管理员没有正面回应,只是复读了一遍已在执行的价目政策——不否认,也不接招。同样据社区观察,Kimi 的开发者社区里,有用户贴出 GLM-5.3-Flash 与 K3 的对比测试帖,帖子一度消失,几小时后又重新可见——一来一回不到四小时,围观者把它解读为内部对外部冲击烈度的实时校准。这些碎片远构不成什么实锤,两家公司也从未就此公开发表过一个字,但信号已经足够真实:沉默有时比声明更响亮,尤其是在所有人都竖着耳朵听的当口。

另一个只能远观的信号在流通层面悄悄发酵。截至本稿收笔的8月27日夜间,业内开始流传个别同行正在酝酿跟进式报价的风声——没有具名的公司,没有落地的数字,只有一个「据说」在各个环节的人嘴边传递。但正因为它只是风声,才更适合做一次干净的情景推演。倘若确有玩家选择跟进降价,短期效果立竿见影,代价同样立竿见影:单位收入骤降,除非成本端同步完成结构性优化,否则等于用毛利率换市场份额,考验的是财务纪律的韧性;倘若按兵不动,则要接受存量客户的调度权重持续向低价高性能梯队漂移的现实——流失不会以断崖的形式出现,而会化整为零,渗透进每一次续约谈判桌上的语气变化;第三种选择是用生态对抗价格——把工作流绑得更深,把垂直场景吃得更透,用服务确定性对冲单价劣势。三条路各有拥趸,但无论哪条成为主流,这个市场的基准参考系都已更换:往后任何一场定价会议的第一个议题,都会是「怎么面对那个0.8元」。

浙商证券对此有一句被广泛转述的判断:此举提升了国内前沿开源模型的整体定价权。乍听似乎矛盾——明明是降价,怎么会提升定价权?细想却精准无比:当最具杀伤力的性价比出自一家中国公司之手,降价的羞耻感就此终结,跟随者的每一次调价都有了正当性的模板;定价权的内核从来不是「定得多贵」,而是「有没有人为你定价体系的变化付出成本」。

对竞争格局的观察到此为止,留下一个问题悬在这里:当斩杀线成为常规武器,下一轮调价的触发器将不再是发布会的掌声,而是对手成本报表上悄然变化的那一格。

六、海外视角 SemiAnalysis 推文涟漪

在国内的语境里,这个故事的关键词是「国产替代」;被搬运到海外之后,关键词变成了「威胁评估」。完成这次关键转译的信源,是硅谷知名半导体研究机构 SemiAnalysis 在 X 平台上的那条推文。它的核心判断浓缩成一句话:这批承载真实流量的国产芯片,其硬件效率与单 token 成本已可与英伟达 GPU 相媲美——CUDA 的护城河再度受到考验。

推文的转发量迅速突破了两千次,而评论区的演化轨迹本身就构成一份不错的研究样本:争论起初仍停留在「国产芯片能否扛住生产级流量」的老问题上;随着 HuggingFace 上的模型权重、技术博客里的架构细节与平台侧的流量面板被逐一摆上台面,话题的重心开始滑向一个全新的问题——国产芯片什么时候开始跟英伟达抢订单。有评论者把这件事与 OpenAI 刚在 Hot Chips 上披露的自研推理芯片 Jalapeño 并排放置——后者的实测数据显示,其每瓦吞吐达到 GB200/GB300 的1.5至1.9倍——并为这张合成图配上了一句流传甚广的注脚:「CUDA 的护城河一周之内被敲了两个洞。」这话当然过于戏剧化:英伟达的基本盘并没有在任何意义上动摇,同期甚至还有巨头追加巨额 GPU 订单的新闻在路上。但情绪的转向是真实的——这是第一次,一家中国模型公司的硬件叙事拿到了与英伟达正面比较的入场券,而不是被随手归进「其他」那一栏。

涟漪继续向专业读者圈层扩散。英语世界的独立开发者博客出现了诸如「便宜、够好、而且跑在中国芯片上」这样直白的标题,把价格比、性能评分与芯片供应商的传闻打包成一篇完整的选型参考;立场严苛的工程师逐条核对官方技术文档,兜兜转转最后大多停在同一句被反复引用的表述上——「与同一硬件上的初始基线相比,端到端服务性能提升了3倍。」这句话在中文世界里读起来像一句朴素的工程日志,可在英语读者的认知框架里,它被自动翻译成了另一种语言:一个非英伟达的算力底座,叠加应用层的极限优化,跑出了一个商业上自洽的闭环。前者是技术陈述,后者是商业判决。

至于那条推文及其引发的争论是否会折算成英伟达股价的实际波动,坦率地说,截至本书收稿时点,还没有可供定量归因的证据,海外卖方的研究笔记也各执一词——但这已经不重要。资产价格的波动是一次性的,认知框架的更换却是永久性的。真正被改变的东西,写进了此后所有相关研报的第一段:评估中国 AI 公司,必须同步建立对其算力基础设施独立性与成本结构的评估框架。这曾经的加分项,如今成了必答题。

本节的定性收束可以这样写:那条推文满打满算不过数百词,它撬动的却是一个默认前提——「先进的 AI 必然生长在英伟达之上」。默认前提一旦裂开一道缝,修补所需的成本要以年为单位计量。

收束:price in 与 pricing in 之间

投资界有一句老话,叫 price in——某个信息已经被市场提前消化进了价格里。这通常是利好兑现后的平静,是「靴子落地」的另一种说法。但8月27日的盘面呈现出一种更罕见的状态:市场正在 pricing in 一个它尚未完全看懂的东西。能确认的事实是零散的——五天的爆量流量、一份57分的成绩单、一张2.8元的报价单、10万张国产芯片的行业传闻、一条措辞克制的海外推文——但要据此推演出这家公司三年后的利润表,任何分析师的工具箱里都还缺一块关键拼图。资金在这种不确定性面前没有离场,反而放量买入。这说明市场此刻交易的不是确定性本身,而是「不确定性正在系统性收敛」这个趋势本身。

「市场正在为不确定性收敛定价」这个判断,还可以换一种更朴素的说法:股价买的不只是这家公司会赢,还包括「这场牌局的规则终于被大家看懂了」。当一个新物种出现时,市场最恐惧的从来不是它太强,而是没有现成的估值框架去安放它——回想当年资本市场消化每一次技术革命时经历的漫长困惑期,无不是在等一套新语言成形。而这一次,从模型发布到估值框架的重构尝试,只隔了一个交易日:卖方连夜写出的研报里,「单 token 成本」「激活参数效率」「国产算力自主率」已经取代「用户数故事」成为新的通用语汇。语言的更新速度就是行业的进化速度——这个细节本身就是本书主题最好的注脚。

回头看8月27日这个交易日留下的全部遗产:一根逆市放量的大阳线,一批集体霸榜的 ETF,一个叫「牛模王」的外号,一条被转发两千次的推文,一场悬而未决的同行报价暗战。这些碎片单独看都不足以定义拐点,拼在一起却轮廓清晰——行业对国产算力的公共认知,在这一天完成了从「能不能用」到「什么时候大规模替换」的整体迁徙。

而对站在迁徙中心的从业者们来说,压力以一种极其具体的方式降临:当你的竞争对手开始以四十分之一的价格提供与你相当的能力,而你至今不知道对方的硬件成本结构到底是怎样的——这种信息不对称本身就是悬在头顶的剑。旧的竞赛比拼谁能把分数刷得更高,新的竞赛比拼谁能把单位智能的价格压得更低,并且活着走到下一个降价周期的终点。从这个意义上讲,8月27日收盘的钟声不是故事的终章,而是新考卷的发放仪式:这场震荡将如何继续向行业腹地传导——创业团队的成本账会被改写成什么样、哪些此前因为账单太贵而被封存的应用场景会一夜解锁——正是随后两章要逐一拆解的问题。

黎明时分最响亮的从来不是钟声,而是千家万户窗帘被拉开的窸窣声。8月27日,这个行业听到的正是这种声音——无数人在同一个清晨醒来,发现规则变了;而这一次,规则的改写者名单上,写着一个中国公司的名字。

本章参考资料

  1. 《港股异动|智谱(02513)高开逾8% 认领「牛来」、上线并开源 GLM-5.3-Flash》,智通财经,2026年8月27日
  2. 《智谱高开!「牛来」大模型身份曝光》,搜狐财经,2026年8月27日
  3. 《Alpha|智谱股价大涨超9%》,21世纪经济报道,2026年8月27日
  4. 《港股大模型概念股强势上涨,智谱与 MiniMax 发布利好业绩数据》,TechWeb,2026年8月27日
  5. 《港股收盘(08.27)|恒指收跌0.34% 英伟达财报点燃硬件行情 智谱认领「牛来」大涨12%》,智通财经,2026年8月27日
  6. 《港股人工智能板块走强 智谱涨超5%》,证券时报网·人民财讯,2026年8月27日
  7. 《ETF市场日报|科创芯片设计ETF批量涨超5%霸榜》,界面新闻,2026年8月27日
  8. 《芯片相关ETF批量领涨超5%/ETF收盘|半导体板块大爆发,多只科创芯片设计ETF涨超5%》,中国基金报,2026年8月27日
  9. 《连夜实测智谱 GLM-5.3-Flash:剪视频、复刻〈深海迷航〉,价格降低97.5%》,智东西,2026年8月27日
  10. 《调用量超 DeepSeek 两倍、57分比肩 Opus 4.8:智谱「牛来」推动股价盘中涨超9%》,腾讯新闻,2026年8月27日
  11. 《智谱新模型「牛来」跑在10万国产卡上,SemiAnalysis 评价「英伟达护城河再受考验」》,腾讯网,2026年8月27日
  12. 《DeepSeek 提价九天后,智谱用十分之一的价格杀进来》,网易科技,2026年8月27日
  13. 《亚马逊将加购200万块英伟达GPU,科创芯片设计指数强势涨超4%》(背景情绪报道),2026年8月下旬
  14. 《有头有脸的大模型公司,集体搞起「匿名公测」》,2026年8月
  15. Ox-Alpha 平台侧讨论串:HuggingFace 模型页评论区、OpenRouter Discord、Reddit 开发者版块,2026年8月20日至8月27日

第七章 竞争转向——从性能竞赛到效率竞赛的范式转移

2026 年 8 月 26 日之前,AI 行业的叙事主场属于跑分——谁的评测分数更高,谁的代码通过率更漂亮,谁的模型能在更少的 GPU 上跑出更高的吞吐。这种惯性如此强大,以至于当一个名叫“牛来”的匿名模型在 OpenRouter 上以每百万 token 输入 0.8 元、输出 2.8 元的价格横扫流量榜时,许多人的第一反应不是“它好便宜”,而是“它凭什么这么便宜”。

这正是竞赛规则被改写的瞬间。当模型之间的能力差距缩小到多数用户难以感知的程度,“谁更聪明”的问题就开始让位于“谁更便宜地聪明”。前一个问题比拼的是研究实力与资本浓度,后一个问题比拼的是架构、工程与供应链的综合密度——这是两场比赛,用的根本不是同一张记分牌。而记分牌的切换从来不只是技术事件,它是商业模式的重绘——正如民航业从竞速时代转向廉价航空、个人电脑业从主频战争转向能效战争,每一次转换都会重新分配整个行业的财富与身位。本章要讲的,就是这样一次正在进行中的重绘。

本章试图回答三个问题:统治行业六年的性能竞赛,为什么会在 2026 年显出疲态;效率竞赛沿着哪几条主线展开;以及这条新赛道可能把参与者带向怎样的终局。先把镜头拉回那条曾经支配所有人想象力的曲线。

一、Scaling Law 边际递减:万卡之后拼什么

一条曲线的黄金年代

2020 年,OpenAI 发表的那篇缩放定律论文给出了后来被无数次引用的经验结论:只要同步放大参数、数据与算力,模型的损失就会沿幂律平滑下降,找不到停下来的理由。2022 年 DeepMind 的 Chinchilla 研究修正了三者之间的配比,却没有动摇信念本身——方向不变,只是姿势更省。此后三年,行业按这条曲线铺路:从千卡集群到万卡集群,再到传闻中的十万卡级联,每一次跃迁都伴随融资新闻的狂欢与大厂财报电话会上关于资本开支的漫长问答。

“万卡集群”曾是 AI 公司的护城河,也是压在每张财务报表上的巨石。它同时解释了那个年代的两副面孔——融资故事里,它是通向未来的船票;损益表上,它是一年年折旧下来吞噬利润的巨兽。性能竞赛的逻辑闭环要求这个庞然大物持续变大,可当曲线斜率放缓,同一笔资本开支就必须换一个说法才能继续讲下去。效率竞赛恰恰是从这个叙事的裂缝里长出来的:它不再追问你手里有多少张卡,而是追问每一张卡能产出多少被真正调用掉的智能。

但幂律曲线的天性就是先陡后缓。到 2025 年前后,三重信号几乎同时出现。其一,高质量预训练语料的增量逼近见顶,互联网文本这座矿床的可采品位逐年下降。其二,多家机构的实践数据显示,在既有架构下每把评测成绩再抬升一个百分点,所需算力近乎量级式增长,而用户愿意为这一个百分点支付的意愿却是一条平缓的直线——成本的指数曲线撞上支付的线性曲线,剪刀口越张越大。其三,前 OpenAI 高管翁荔在其博客发表长文《谨慎对待 Scaling Law》,其中被讨论最多的观点是:幂律度量的是损失的下降,而损失下降与真实能力的涌现并不同步,把前者线性外推成后者是危险的。国内技术社区的复盘文章把这个转变概括得更直白——缩放定律从单变量冲锋变成了三维记账,参数、数据、后训练各算各的账,谁也不再垄断解释权。

最直接的证词恰恰来自本书主角所属的公司:两个星期前,智谱发布旗舰 GLM-5.3 时官方公告里写的就是“Scaling post-training is all we did”——把全部赌注押进后训练。当最有资格继续堆预训练筹码的玩家公开宣布换了桌子,这条老曲线的边际收益实际上已经被业界集体默认下调。

需求侧的剪刀差

耐人寻味的是,供给侧放缓的同时,需求侧的曲线正陡峭上行。国家数据局披露的数字勾勒出这条线的斜率:2024 年初,全国日均 token 调用量约为 1000 亿;到 2025 年底,已跃升至 100 万亿;2026 年 3 月,进一步突破 140 万亿——两年增长超过一千倍。局长刘烈宏当年 3 月在中国发展高层论坛上的判断是,围绕 token 的调用、分发与结算,一套新的价值体系正在加速成形,词元正在成为智能时代可计量、可定价、可交易的结算单位;央视的专题报道干脆把词元消耗量称作 AI 产业发展的“晴雨表”。

把两条曲线放进同一张图,剪刀差一目了然:一边是单位智能的生产越摊越厚、边际投入越来越大,另一边是全社会对 token 的吞噬量两年翻了一千倍。剪刀张口处即是缺口,缺口的学名是短缺——短缺的不是智能本身,而是便宜的智能。谁能把便宜的智能规模化供应出来,谁就接住了那条陡峭的需求曲线。这就是效率竞赛在 2026 年全面爆发的底层逻辑。海外的行业观察网站也记录了同一现象的价格面:据统计口径估算,主流模型的推理单价在大约十八个月里下降了约九成——单位智能价格的坍塌速度,远远快过单位智能能力的爬升速度。当价格曲线跑赢能力曲线,竞争的重心自然会从创造能力漂移到分发能力。

值得注意的是,价格曲线的下探并不均匀:多位行业观察者留意到,报价下调往往成簇出现——每当一批架构优化或新硬件交付的红利集中兑现,价格地板就整体下沉一格,随后在下一批红利到来之前保持平稳。台阶状的下降轨迹说明一件事:可持续的降价来自离散的技术兑现,而不是无休止的补贴燃烧。判断一家公司的报价守不守得住,要看的正是报价背后有没有真实对应的成本红线。

于是“万卡之后拼什么”有了答案:不是把老曲线继续画长,而是换一根横轴——从每瓦特能生产多少智能,换成每一个 token 卖多少钱、多少毫秒能够到手。

笔者对此有一段不体面的私人注脚。2024 年秋天的某个周末,我试图在一台巴掌大的 R86S 小主机上运行一个 7B 的本地开源模型:反复调整量化精度、更换推理框架、清空后台进程,只为让它在不烫手的前提下完成一次不算长的上下文总结。折腾到黄昏忽然意识到,我孜孜以求的根本不是让模型更聪明——同期的云端模型明显更聪明——而是让它在这只小铁盒上跑得动、跑得快、不烫手。边缘处的体感往往比机柜里的仪表更接近真相:效率竞赛的终点未必是数据中心那张漂亮的每瓦算力表,也可能只是资源受限的角落里,模型到底能不能被真正用起来。这恰恰是巨头们最容易忽视的盲区。

💡 独思时刻:我曾在一个凌晨用雨轩编辑器赶一篇关于国产芯片的长文。因为频繁切窗查资料,本地预览开始卡顿,我的第一反应是责怪电脑太慢,随即发觉不对——该被抱怨的是那个“太重的模型”。那一瞬间我明白,用户对效率的感知不是从 FP16 的算力报告里来的,而是从“它有没有打断我的思路”里来的。从业者喜欢谈论每美元多少 token,但对深夜写字的人而言,效率的全部含义只有四个字:不要打扰。

二、效率竞赛的三条主线:推理成本、部署门槛、场景渗透

效率竞赛听起来抽象,落到产品上却是三件非常具体的事。8 月 26 日晚,这场发布把它们逐条点亮。

主线一:推理成本——最显性的一刀

GLM-5.3-Flash 的定价直接击穿了市场心理防线。当 Claude Opus 4.8 按每百万 token 输入 5 美元、输出 25 美元收费时,0.8 元与 2.8 元意味着约四十分之一的价差;若叠上发布期的限时折扣,差距进一步拉开到约八十分之一。开发者社区的计算器被按得冒烟:同样一笔预算,半年前只够跑一万次文档摘要,如今够跑四十万次——这不是折扣带来的兴奋,而是成本结构变化的信号。

几乎在同一夜,价格表的另一半也揭晓了。8 月 26 日 23 时前后,阿里通义千问团队正式发布 Qwen3.8-Flash,并同步在 Hugging Face 与魔搭社区开源了 Qwen3.8-Flash-Next 的权重——后者是基于下一代 Qwen4 架构的先导预览版。这份答卷同样凶悍:主模型 125B 总参数,外挂 51B 的 N-gram Embedding 用于查表扩充容量,每个 token 仅激活 6B 参数;注意力侧采用门控 DeltaNet 与自研稀疏注意力 QSA 的混合架构,残差流扩展为四路并行分支,优化器换用 Muon 并针对全新架构重新拟合了缩放定律;原生 262K 上下文可经 YaRN 扩展至百万级,长文本注意力在预填充与解码阶段分别取得最高 7.6 倍与 4.9 倍的加速;训练成本据官方口径约为上一代 Qwen3.7-Plus 的九分之一,相当于直降近九成。价格表上,Qwen3.8-Flash 开出每百万 token 输入 1 元、输出 3 元,有媒体测算该报价已比 DeepSeek-V4-Flash 的闲时段价格再低约三分之一;而在仅 6B 激活参数的条件下,其基座模型在 14 项基准中的 8 项拿下最优成绩。

一夜之间两份答卷,值得放在同一张桌子上细看。技术路线各有侧重:智谱把当代旗舰验证过的混合注意力压深压实,用 45 层做出此前 92 层量级的成绩;阿里则干脆把下一代架构提前拆封,用 6B 激活宣告轻量化的下限还可以再探。商业姿态也迥异:阿里是在为云生态提前培育入口,开源权重本质上是一封寄往自家算力服务的邀请函;智谱则是把工程密度直接兑换成商业订单与开发者的真金白银;DeepSeek 的位置又不相同——它惯于把底层论文写进整个行业的引用列表,让同行沿着自己的数学排队入场。但当三家的价格表在同一个夜晚撞上同一条低位线,这就不再是巧合,而是同一条推理成本曲线在不同工程团队手中得到的自然读数:单位算力承载的智能密度取代总参数量成为共同角力点之后,降价是水到渠成的结果,而非赔本赚吆喝的补贴。

还值得把这层意思再往下挖一层:这些价格背后的会计结构。训练开销是一次性的沉没成本,可以摊进此后无数个 token 的生命周期;推理开销却是随每一次调用即时发生的现金流。这意味着模型公司之间的成本竞争,本质是在推理侧打的——谁的注意力计算更便宜、缓存命中更高效、芯片利用率更高,谁就有底气把公开报价一压再压。缓存命中 0.23 元那行小字,是读懂这份定价表最好的教材:同一段前缀文本的重复使用几乎不计费,等于在鼓励开发者把冗长的系统提示词和知识库摘要统统前置,用复用去换成本。一张价格表在手把手地教开发者如何写程序,这种事在商业史上并不多见。而对智能体时代来说,低单价还有一层乘数效应——一个自动化业务流程动辄几十轮工具调用,token 消耗量是普通对话场景的十倍以上,输入输出每便宜一块钱,智能体商业模型的可行性边界就向外推开一大截。在这场降价的受益者名单上,排在第一位的其实是智能体。

主线二:部署门槛

推理成本决定能不能进门,部署门槛决定能不能安家。GLM-5.3-Flash 给出的组合拳包含三件套:MIT 协议的开源授权、约 306GiB 的 FP8 权重文件,以及对 SGLang、vLLM、TokenSpeed 等主流推理框架的适配;再叠加全部线上流量由十万张以上的国产芯片集群承接、自研推理引擎的分离式架构把端到端服务性能较初始基线抬高三倍——最后一项已在第四章详述。这几件事拼在一起,含义非常具体:一个中小团队从此可以绕开英伟达的渠道溢价与漫长的审批流程,在合规的国产算力上直接跑起一个一线水平的多模态模型,这在两年前还近乎天方夜谭。更重要的是,MIT 协议允许任何人下载权重自行部署,用自己机房里的电表去复核那份 0.8 元的真实成本——开源的自由度本身就是效率的一部分,也是对外的信用凭证。门槛的降低还会自我强化:部署越容易,反馈周期就越短,社区发现的问题与贡献的补丁便能更快回流主线;国产芯片厂商也因为多了一个真实的重量级负载,加速自家软件栈的迭代。开源模型、推理框架与国产硬件在同一只飞轮里互相拉动,部署门槛每下降一寸,这条本土供应链的整体成熟度便抬高一寸。这也是为什么看效率竞赛不能只盯价格表上的数字,更要看数字背后的生态是否在自发增长。

主线三:场景渗透

第三条主线最不起眼,却决定战争能打多久:从一份 API 到一段业务逻辑之间的距离。过去,接入大模型是需要反复论证投资回报率的战略项目——立项、评审、试点、观望,半年过去,第一批提示词还没上线。而当价格低到可以随意调用、部署简单到可以快速试错、能力又足以应付真实业务时,模型就从战略项目降格为随手可接的工具,渗透的摩擦系数骤降。诚实的账本也要记下反面:社区反馈普遍指出,这款模型的速度尚未达到旗舰水准,长程智能体任务常常半小时起步、一小时常见,KV 缓存的体积也仍略大于两位同行,官方承认这是后续优化的方向。但反过来看,当每一次失败尝试的成本被打到原先的几十分之一,慢一点的探索也变得可以承受——效率不仅放大了成功者的回报,也给失败者打了折。国家数据局那条两年翻千倍的调用量曲线,其斜率计量的正是场景渗透的速度。

三、Flash 系列的战略定位:旗舰技术的效率化封装

Flash 不是凭空出现的。从 GLM-4.5 到 GLM-5.2,智谱走的是标准的旗舰路线:参数更大、能力更强、榜单更高。Flash 的定位截然不同——它是旗舰技术的下沉版本:320B 总参搭配仅 18B 激活、把层数从 GLM-4.5 的 92 层削减到 45 层、配合更高效的专家路由,在核心能力不显著衰减的前提下,把推理成本压到此前的十分之一乃至更低。眼熟吗?芯片行业管这叫旗舰架构下放——在旗舰产品上验证成熟的架构,经过裁剪优化装进取量的中端产品。Flash 系列的本质,是技术成熟之后的效率化封装,而封装往往是比原创更丰厚的生意,因为它收割的不是一个悬而未决的悬念,而是一片已被证明的价值。

有一个常见的误会需要澄清:Flash 并非旗舰的缩水版,而是“又快又便宜”这条产品线语义下的全新基座——这一命名传统可与谷歌 Gemini Flash 及 DeepSeek 的同名系列相衔接。硬账摆在桌面上:Artificial Analysis 综合智能指数 57 分,追平 Claude Opus 4.8,超过自家上一代旗舰 GLM-5.2 的 53 分——评分更高的 GLM-5.3 属于另一条产品线;注意力计算量较 GLM-5.3 下降约 3.01 倍,KV 缓存缩减约 4.44 倍。用一半的深度、约一半的激活参数,交出对手五十分之一的价格——这套组合真正的新闻价值不在任何单项之最,而在于没有明显短板。

定位的选择也有时机上的讲究。2025 年末到 2026 年初,国产大模型第一梯队集体转向涨价:据报道,Kimi K3 曾把输出价格提至每百万 token 100 元;另有分析称 DeepSeek V4 Flash 在提价后调用量一度下滑近半。这些动作并非无理——它们反映的是推理成本的真实压力,是成本曲线面前的诚实表态;但它们同时在市场上撕开一道口子:大批为价格敏感场景准备的预算无处安放。智谱的选择是反其道而行之——用规模换成本,用技术优化换定价空间,用低价换开发者生态。这不是一场单纯的价格战,而是一次有预谋的生态卡位:当 0.8 元出现在价格表上的那一刻,所有定价比它高出数倍的同档模型瞬间失去性价比,第五章所说的那条斩杀线被一次性触发。

把 Flash 放回整个产品矩阵,才能看清这步棋的全貌。8 月 14 日发布的旗舰 GLM-5.3 负责在能力上限处插旗——它证明这家公司在智力的最前沿不输任何对手;12 天之后发布的 Flash 则负责在最宽处修路——它让每一个付不起旗舰价的人也用得起同一套技术底座。双轨并行不是产品线的简单分岔,而是一套完整的价格分层设计:愿意为顶格智能付费的用户留在旗舰轨道,只为够用智能付费的用户被 Flash 接走。两条轨道共享同一套架构研究与同一条国产算力供应链,研发的一次性投入被两片市场同时摊薄——这才是效率封装更深一层的财务含义:不是放弃高端,而是让高端的创新在下坡路上继续收租。

对这份成绩单也要保持清醒。社区对其学术原创性的评价相当直白——“成熟技术的工程组合”:线性注意力可以追溯到 Mamba 时代的思想脉络,稀疏注意力的索引器设计与 DeepSeek 先发的 NSA、DSA 论文一脉相承,流形约束超连接与字节 Hyper-Connections 的工作有明显亲缘,IndexPool 则更像一项精致的工程技巧;官方也没有随模型放出 arXiv 论文,只有一篇技术博客。这些批评大体站得住。但换一个角度看,把已知组件以显著更低的开销重新装配成型,恰恰是效率竞赛的主武器——基础研究负责铸造奖杯,工程能力负责把奖杯锻造成可以流通的货币。在范式平缓期,后者离现金流更近,也更难被抄走。

四、中国 AI 公司差异化路径三选一

站在这轮转折点上回望,中国的头部玩家其实早已各自选定差异化路径,粗略数来有三条主线与一种姿态。

第一条是工程优化驱动,以智谱为代表——用算法、架构与集群调度的系统性工程榨取硬件的每一分潜力,把效率本身做成产品卖点。全部推理流量跑在十万张以上的国产芯片上,第三方机构 SemiAnalysis 评价其硬件效率与单 token 成本已可比英伟达 GPU 方案,还留了一句“CUDA 护城河再受考验”。第二条是基础研究驱动,以 DeepSeek 为代表——偏好模型架构层面的从零到一,其稀疏注意力先发论文如今已成为半个行业的公共组件,效率是能力突破的副产品而非首要目标。第三条是商业变现驱动,以阿里、字节等大厂为代表——模型为庞大的业务生态供血,开源是通往云业务的获客漏斗,效率更多体现在内部成本摊薄与云上毛利的守护,而不必表现为面向开发者的定价竞赛。三条路径并无高下,胜负要交给各自的基因与周期。耐人寻味的是,路径的分野恰恰在 8 月 26 日夜里被具体化了:阿里把下一代架构提前拆封给社区,是以未来换当下的生态粘性;智谱把当下架构压到极致的价位,是以当下换未来的调用规模;DeepSeek 的回应则是第三种姿态——它大概率不出现在价格表上,而会出现在下一篇论文里。三种节奏,对应三条完全不同的时间轴。

但站在 2026 年 8 月这个时间切片上,工程优化驱动迎来了它的高光时刻。原因有三。第一,基础研究的重大突破正进入一段相对平缓的斜坡段——这是基于近一年公开进展做出的情景判断,不是定理;当从零到一的间隙拉长,工程打磨的红利期就被拉长。第二,工程优化的边际收益依然可观:一款用 45 层做出此前 92 层水平的模型,是对“更少即更多”这条工程哲学最好的注释。第三,国产算力供应链恰好在此时进入大规模稳定交付的窗口期,供给与需求两头咬合,三个条件叠加出一个并不常见的共振窗口。当然,话必须说完整:这扇窗口并非永远敞开。假如未来两三年内注意力机制出现又一次彻底替换,或训练范式发生跳变,牌桌就会被重新洗过——届时把身家押在工程密度上的公司,需要具备随时切换赛道的组织弹性。推演出这样的可能,不是泼冷水,而是刻度。

还有一种姿态值得单独一记。月之暗面展示了一条不以地板价为武器的路线:凭借 Kimi K3 在代码与智能体任务上的顶格表现固守高能力高地,并以据报道高达每百万输出 100 元的价格维持技术与收入的纵深。效率竞赛再热闹,它也提醒旁观者——打得便宜是一种赢法,贵得有价值同样是赢法。每种打法都有自己的护城河,这正是竞赛迷人的地方。

五、全球视角:效率维度上的布局与滞后

把视角拉回全球。OpenAI、谷歌、Anthropic 仍在性能的最前排缠斗,但在“极致效率”这条侧翼战线上,它们绝非无所作为——只是动作的内在逻辑与中国玩家不同。

共识层面,三家都已把低价档列为标配。据海外媒体今年以来的盘点:OpenAI 的产品阶梯里,mini 与 nano 档位正与 Claude Haiku、Gemini Flash 系列正面相争;谷歌的 Flash 家族持续扩员,有行情类栏目报道称 Gemini 3.1 Flash-Lite 已在年中被观测到每百万 token 输出 0.25 美元的低位报价;Anthropic 一贯质量优先、产品矩阵克制,把入门市场交给 Haiku 系列看守。三家的 Flash 化产品确实存在、确实在降价,但这些数字换算过来,仍比那一晚的两张中国价格表高出数倍乃至数十倍——大家都有 Flash,激进程度不在同一个量级。

更深水区的布局在硅片这一层。OpenAI 在 Hot Chips 大会上披露了自研推理芯片 Jalapeño 的实测数据:运行 GPT-OSS 120B、DeepSeek R1、Kimi K2.5 这类负载时,每瓦吞吐达到 GB200 与 GB300 平台的 1.5 至 1.9 倍。自研芯片的终极目的从来不是摆脱英伟达,而是从晶体管层面定义属于自己工作负载的效率——这与谷歌 TPU 多年坚持的垂直整合路线殊途同归;Anthropic 则把火力集中在超大规模部署的总拥有成本优化上。方向不难辨认,差别在目的地。

目的地不同,指的是这些效率努力大多面向“内部”——服务于自家订阅产品的成本结构和推理集群的利用率,而非以极低的公开报价向全世界开发者敞开大门。订阅溢价、企业长约、搜索与广告业务的协同收入,这些商业模式决定了它们很难在每百万 token 数毛钱人民币的价位上跟进。这不是技术问题,是商业结构问题。市场也确实用脚投了票:匿名测试期内,“牛来”的使用量一度达到同期 DeepSeek 的两倍以上,五天累计流量超过 50 万亿 token,把 OpenRouter 的历史单日纪录抬高约四倍——全球开发者涌入的速度,标注出效率定价的需求被积压得有多深。

还有一个容易被低估的变量:开源权重的全球流转。在 MIT 协议之下,权重文件出现在哪家云平台、哪个国家的机房,本身就构成一份独立于任何官方口径的市场调查报告——第三方托管平台上的部署量与调用热度,是一台无法作弊的投票器。对许多身处美元结算体系之外的开发者而言,一份可以私有化部署的一线多模态权重,比一份便宜的 API 更接近刚需:前者意味着供应安全的确定,后者只是阶段性优惠的价格。效率竞赛打到深处,比的就不只是单价,而是谁能同时递出便宜与确定性这两样东西。

不过,公允地说,滞后再真实也有另外一面。论工具链的厚度、智能体编排框架的成熟度、企业客户的信任存量,海外生态仍握着多年积累的复利;中国厂商暂时的领先集中在“把效率明码标价”这一层——而这偏偏是全球个体开发者与中小企业最敏感的那一层。与此同时,旧大陆还在按旧地图囤货:据报道,亚马逊仍在筹划追加采购多达两百万块英伟达 GPU。上游囤货的热度与下游报价的跳水同时发生,恰是范式交替期最典型的景观——投资周期走得慢,价格认知走得快。

六、终局想象:模型免费,生态收费

效率竞赛的终局是什么样?流传甚广的说法是八个字:模型免费,生态收费。把它当作情景推演而非预言来看,逻辑链条是完整的——假如以近乎为零的成本就能调用顶尖模型的推理能力,那么继续靠 API 调用费谋生就失去了根基,价值将向上迁移:从提供智能,转向提供用智能解决问题的完整流程。比如,模型免费,自动化业务流程的智能体平台收费;推理免费,私有化部署、数据清洗、微调工具链收费。移动互联网时代早已排练过这一幕——流量免费、增值服务收费;只不过这次的流量是 token,增值服务是 AI 原生的生产力解决方案。

但这套推演有个常被忽视的前提:总得有人付得起让模型“免费”背后的固定成本。十万张国产芯片的折旧与电费不会因一句口号而消失;缓存命中 0.23 元这类细颗粒定价恰恰说明,厂商在认真地为每一种负载寻找差异化的毛利结构——与其说是奔向免费,不如说是在铺设一层极端精细的分层阶梯。再看竞争者的动作:DeepSeek 此前提价、Kimi 维持高位报价——据前文所引的报道口径——都在暗示价格地板之下仍有磁力,不会有理性的厂商为验证一句漂亮口号而烧穿现金线。因此更可信的中期图景或许是:能力溢价逐渐封顶,底座价格缓慢滑向成本线,利润重心迁往编排、数据与行业知识的深处——免费的修辞留给营销,分层的账本留给会计。

当然还存在第三种推演,方向恰好相反:假如海外巨头凭借自研芯片把内部推理成本压到足够低,它们或许会突然愿意把某个低价档位直接打到中国厂商的报价附近,用其他业务的利润反向贴补 API 战场——正如早年云计算巨头之间旷日持久的价格战那样。到那一天,前文所述的所有结构性差异都可能被阶段性的战略性亏损暂时抹平,效率护城河也将迎来第一次名副其实的压力测试。这一情景出现的概率不算高——它违背上市公司的盈利纪律——但只要它还躺在可能性的菜单上,效率领先者就不能抱着价格优势安然入睡。推演至此,结论反而清晰了:护城河的可靠性从不取决于对手今天跟进与否,而取决于自己的成本曲线明天还能不能再往下降。

笔者那段在 R86S 小主机上折腾模型的记忆,正好为这幅想象做一个注脚:假如有一天模型真的免费了,我最愿意付费的绝不是更多算力——本地算力是恒定的——而是更聪明的调度。让它在我写作时自动翻检本地知识库,在调试代码时自动解析报错日志,在开会时安静地把纪要归档。这些是生态的价值,不是模型的价值。顺着这个逻辑推下去,聪明的调度者会成为新产业链上的收费站,而像雨轩编辑器那样的写作工具——只要能在恰当的时刻把恰当的智力递到指尖——就有资格在零边际成本的智能之上建立自己的溢价。终局若是如此,赢家名单里未必还有今天意义上的模型公司。

从这个意义上说,8 月 26 日夜里发生的不是一次新品发布,而是竞赛规则的正式换轨:性能不再是唯一的标尺,效率成为新的护城河。挖掘这条护城河的,不必是拥有最多 GPU 的那一家,而可能是最懂得在每一瓦特、每一美元、每一毫秒里榨出智能的那一家。这也是“牛来”这个名字最好的隐喻——效率才是那头沉默而坚实的大牛,它不嘶吼,但能拉动最重的车。

次日的资本市场迅速给出回声:港股智谱跳空高开逾 8%、盘中一度涨超 10%,上证科创板芯片设计指数收涨 5.57%,“国产算力从可用到好用”成了盘面上最响亮的叙事。但比 K 线更有嚼头的,是那天流传的一句评语——市场正在 pricing in 一个还不确定的东西。确定的部分是:效率竞赛确已开打,两张价格表白纸黑字;不确定的部分是:效率作为护城河,能否像当年的性能一样扛住随后几个季度的冲刷。若能,第八章即将展开的创业成本账与行业落地窗口才有地基;若不能,这一切便只是一次漂亮的倾销。判卷人不会是任何一位分析师,而是接下来的每一天、每一条真实的调用曲线。

本章参考资料

  1. IT之家:《阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9》,2026 年 8 月 26 日
  2. 天极网:《国产大模型一夜双开源:比 DeepSeek 更便宜正成为前沿竞争赛道》,2026 年 8 月
  3. 智东西(今日头条转载):《千问智谱连夜开源,都比 DeepSeek 便宜,国产大模型价格猛卷》,2026 年 8 月 27 日
  4. 国家数据局官网专家解读:《以词元为引擎推动智能经济高质量发展》,2026 年 8 月 17 日
  5. 新华社:《我国日均 Token 的调用量三个月增长超 40%,目前已超 140 万亿》,2026 年 3 月 24 日
  6. 央视网新闻:《词元消耗量成 AI 产业发展“晴雨表”,新型商业逻辑正加速演进》,2026 年 3 月
  7. 翁荔(Lilian Weng)博客 Lil'Log 长文《谨慎对待 Scaling Law》及中文编译报道,2026 年
  8. 国内技术社区 Scaling Law 演进综述(《从“大力出奇迹”到“三维立体缩放”》等),2026 年
  9. 海外行业观察媒体推理成本追踪:《The Token Price War: How AI Inference Costs Fell 90% in 18 Months》等,2026 年
  10. TechInformed:《OpenAI joins Anthropic and Google in the race for cheaper AI work》,2026 年
  11. FuturePicker 评论:《The Small Model Counterattack: Why Haiku 4.5, Gemini Flash, and GPT-nano Are Winning》,2026 年
  12. Crashbytes 行情栏目《Friday Inference Price Move》系列中关于 Gemini 3.1 Flash-Lite 定价的报道,2026 年
  13. Hot Chips 2026 上 OpenAI 关于自研推理芯片 Jalapeño 实测数据的披露(多源综合报道),2026 年 8 月
  14. SemiAnalysis 相关评价与《晚点LatePost》算力供应商报道综合,2026 年 8 月

第八章 普惠时代——前沿智能如何走向千行百业

8月26日之后的那一周,我的微信被两类人同时轰炸。一类是AI圈的朋友,发来各种测试截图和“牛模王”表情包;另一类是多年不联系的前同事——做工业设计的、开律所的、搞跨境电商的、在小县城办职业培训学校的。他们问的是同一个问题:“这玩意儿我能不能用得起?”

这个问题本身就说明了某种变化正在发生。过去两年,他们从未问过 Claude 或 GPT——不是不知道,而是默认那些东西和自己无关。价格是一道隐形的墙,墙外的人连抬脚试探的欲望都没有。当“每百万 token 输入 0.8 元”这个数字砸下来的时候,墙裂开了一条缝。

第一节 平价化的实际意义:把门槛削到脚踝处

先把这个数字摆在桌面上。GLM-5.3-Flash 的 API 定价为每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元——只有自家旗舰 GLM-5.3(8 元与 28 元)的十分之一,叠加限时折扣后再降一半,而按官方说法约为 Claude Opus 4.8(5 美元与 25 美元)的四十分之一。再补一个横向坐标系:Artificial Analysis 的综合评测里它拿到 57 分,与世界最强梯队打平,并压过自家上代旗舰 GLM-5.2 与 DeepSeek V4 Pro 正式版——后两者的得分同为 53 分。性能站在第一梯队,价格却落到了地板以下,这道剪刀差就是本轮定价的全部秘密。

但平价化真正的意义,不在价格表上,而在门槛上。我在那台 R86S 小主机上跑过开源模型,深知“用得起”和“用得上”之间还有一道鸿沟。本地部署需要技术栈,API 调用需要工程能力,而传统行业的中小企业最缺的不是钱,是能把模型塞进业务流程的那双手。普惠的关键,不是把价格打到地板上,而是把门槛削到脚踝处——价格决定了他们敢不敢抬头看一眼,门槛决定了他们能不能真正迈进来。

对独立开发者而言,这道门槛的变化更为直观。一个周末想做点什么的程序员,过去面对的是每月几十美元起步的海外 API 账单或者折腾半日的显卡驱动;现在是一个下午就能接通的接口和几乎可以忽略不计的调试成本。有海外开发者在社区里晒出迁移后的账单,称把个人项目全部切到中国模型后每月省下数千美元——这类帖子在发布当周集中出现,未必个个严谨,但趋势读得出来。OpenRouter 上的数据更有说服力:8 月 20 日这个以“牛来”之名匿名上线的模型首日登顶,创下平台单日 token 流量的历史纪录,比原有纪录高出约四倍;上线五天累计流量超过 50 万亿 token,单日峰值约 62T,使用量一度达到 DeepSeek 的两倍以上,还顺手终结了后者在 OpenCode 榜单连续 56 天的霸榜。没有广告投放,没有发布会,需求侧用真实的调用量投了票。有国内科技媒体统计,这一轮降价让中小企业在相同预算下可调用的 token 总量提升了数倍到近百倍,原本因资金受限无法落地的轻量化 AI 工具与垂直插件重新进入创业清单——数字尺度虽有夸张余地,方向却是成立的。

使用形态的变化比价格数字更能说明问题。过去开发者接海外接口,心态是“省着用”——系统提示词压缩到极限,上下文能截断就截断,宁可牺牲一点回答质量也要省下几个美元。现在的心态是“放着用”:0.23 元一档的缓存命中价把长系统提示与知识库文档这类固定成本一次性摊薄,重复前缀几乎不再制造账单焦虑。编程场景最为典型:匿名公测期间就有开发者让它在终端里通宵跑长程编码任务,Terminal Bench 2.1 上 84.3 分对 Opus 4.8 约 85 分的成绩,意味着它与最强闭源模型的差距已经小到难以察觉;而在 OpenCode 榜单登顶——那本来就是全球程序员用真实工作流投票的地方——靠的还是无人知晓出处的假名。工具一旦便宜到不必精打细算,用法就会从小心翼翼地省变成大大方方地试,而后者才是涌现式创新的土壤。

💡 独思时刻:我早年在一家期货公司做分析师时,彭博终端的年费是 2.4 万美元,公司只买了三个账号,整个研究部排队用。后来万得出现,价格是彭博的零头,界面糙得多,但每个分析师都有了独立账号。十年后回头看,真正改变行业的不是彭博那种“最好”的工具,而是万得那种“够用且人人用得起”的工具。前沿模型正在经历同样的拐点——性能领先者赢得赞誉,但平价渗透者赢得市场。这不是劣币驱逐良币,这是工具回归工具的本质。

第二节 替代 Claude 的成本账:一份六人团队的推演月报

平价化对创业团队意味着什么,最诚实的回答方式是把账摊开来算。下面这份测算基于杭州一支六人团队的真实业务形态搭建,但人物与数字均为本书构造的推演情景,用于展示计价逻辑,不代表任何真实客户的账单。

情景设定:该团队做面向中小企业的 AI 合同审查服务,客户约四十家,月均处理合同一万六千份。长合同需要切块送检——一份两万字左右的合同连同审查规范、系统提示与少量对话缓冲,切成大约四次调用;每次调用输入约 1.7 万 token,返回的风险批注与整改建议约一千 token。全月总调用量约六点四万次,输入合计约 10.88 亿 token,输出合计约 6400 万 token。为了口径保守,缓存命中暂不计入。

项目 取值与金额 口径说明
全月调用次数 6.4 万次 含切片送检与复审轮次
输入总量 约 10.88 亿 token 单次约 1.7 万
输出总量 约 6400 万 token 单次约一千
GLM-5.3-Flash 发布价账单 约 1050 元 0.8 元输入、2.8 元输出
同负载旗舰 GLM-5.3 约 10500 元 8 元、28 元,恰好十倍
同负载 Claude Opus 4.8 约 5 万元 按 1 美元折 7.2 元估算

这张表的荒诞之处在于最后一行的对比跨度。同样一份活儿,交给 Opus 4.8 是一个月一辆新能源车的钱,交给 GLM-5.3-Flash 只是一次稍贵的家庭聚餐。官方宣称的四十分之一还是收敛了的说法——在这套输入远大于输出的负载结构里,实际差距接近五十倍。再往下细抠还有两层弹性:如果缓存策略生效、六成输入命中 0.23 元的缓存价,月账单可以压到七百元上下;如果叠加发布期的限时折扣,则只需五百多元。这份弹性正是折扣期的正确打开方式——圈内已形成默契做法:趁窗口期签订资源包锁定优惠单价,再把省下的现金流转成数据、评测集与工作流的积累,这些资产不会随折扣退坡而贬值。

创始人此前向我描述迁移动机时的粗略记忆是:“以前模型 API 一个月烧四五万,我们不是在打磨产品,是在给硅谷交电费。”迁移之后每月省下的四万多元,正好覆盖一名工程师的全包月薪——所谓平价化,落到经营层面的翻译就是:不必再在“用最好的模型”和“活到下个月”之间二选一。

这位创始人还说了一句值得记录的话:他们做过反向测试,把 GLM-5.3-Flash 在 OfficeQA Pro 这类专业文档问答集上的成绩拿来比对——62.4 分对 Opus 4.8 的 48.9 分——发现至少在他们最吃重的文档理解环节,便宜的那个反而更强。Benchmark 当然不能代替生产验证,但他们的选择给出了一个朴素算法:先看分数有没有进入可用区间,再看价格差几个数量级,最后用一个星期的灰度实测补齐判断。这也是如今开发者社区主流的选型方法论——先跑一周真实流量的小样本,做出月度预算外推,再决定切多少比例的流量过去。

账本之外,还有三笔不好入表却真实存在的隐性收益。第一笔是实验自由度:过去跑一轮全量回归测试要心疼半天预算,不少团队索性砍掉灰度环节;如今同样的测试从数百元降到几块钱,迭代节奏反而快了。第二笔是架构简化:当 token 不再昂贵,就没有必要为了缩短提示词专门养一位“提示词精算师”,把合同原文整份送检,往往比精心裁剪的摘要效果更好——便宜直接换来了准确。第三笔是人才结构:原先负责盯用量报表的两名运营被释放回业务一线。平价化的深层红利由此显形——它改变的不只是一张月度报表,而是一家公司的组织方式。

类似的账,我的朋友圈里已经有人真的算完了。那位在深圳做跨境电商的老同学,原先每个月给海外模型留出两万美元级别的预算,用来做多语种商品文案改写和客服工单初筛。8 月底他把主流程切到了 Flash 上,前两天给我发来他后台的截屏:“同样多的活儿,这个月账单折成人民币五百出头。”他说这话时没有狂喜,倒有点恍惚,像是刚刚确认了一件事原来是真的。(按本书体例须注明:此为作者身边个案的叙述性观察,样本为一,仅供感受数量级,不可当作统计依据。)

第三节 多模态平民化:千行百业第一次有了用得起的眼睛

如果说文本平价改变的是写作者的报表,那么多模态平价改变的则是整个物理世界的数字化入口。这正是 GLM-5.3-Flash 最容易被低估的一层价值:它是预训练阶段就融合了 30T token 图文语料的原生多模态模型,而不是在语言模型外面缝一个视觉编码器的拼接式方案。后者的能力上限受制于缝合工艺,前者则在 BabyVision 这样的基础视觉理解测评中拿到 53.4 分,把对照的 DeepSeek 方案(35.1 分)拉开近二十分的差距。一个更直白的参照是海康威视等行业公司正在把视觉大模型塞进安防与工业巡检的场景——这证明“看得懂照片和视频”已经是被真实订单认可的能力,剩下的变量只有价格。

值得点破的是它的取舍哲学:这款产品并不打算登顶智力榜——在最考验重型推理的 HLE 带工具测评中,它拿到 55.3 分,明显低于家族旗舰 GLM-5.3 的 62.5 分。与其说这是能力妥协,不如说是商业上的清醒:把足够用的智能配上能普及的价格,恰好是对“走向千行百业”这一命题的正确回答。

价格,恰恰是被撕开的口子。过去一个做面料检测的纺织厂要引入视觉 AI,需要采购专用设备、部署本地服务器、聘请算法工程师,起步投入动辄几十万;现在把布料照片通过 API 传上去,几秒钟拿到瑕疵分析结果,按调用付费,单次成本几分钱。广东省中山市一家灯具厂的生产主管告诉我,他们用这个模型检测灯罩表面的划痕和气泡,“以前靠老师傅拿手电筒照,现在手机拍一下就行”。他没有提“AI 转型”这类词,只说“省了三个质检员的工资”。(注:本案例为基于行业逻辑的推演场景,非真实事件,特此说明。)

这类推演并非空中楼阁,产业侧早有先行者在验证同一条路。据新华网等媒体报道,合肥的国家智能语音创新中心有一项基于多模态工业 AI 的产品智能化质检应用实践入选了工信部年度典型案例——过去一台空调下线前,人工要完成外观检查、扫码核对、文字识别、运行噪声判断等多个环节,而现在多模态方案可以在一条流水线上把这些环节串起来。浪潮云洲旗下公司的“人造革表面缺陷检测一体化装备”也进入了同类名单;佛山顺德的家电工厂则有 AI 视觉大模型直接上了压缩机产线,那条产线的节拍是每分钟两百台以上。这些先行方案的共同点是依赖专用部署与项目制交付,普通中小企业望而却步;而当同等量级的视觉理解能力变成几分钱一次的 API 调用,行业故事就从“示范工程”变成了“工具租用”。

视频理解的开放是另一个被低估的变量。安防、零售、仓储、农业——凡是需要“看”的行业,之前都被昂贵的专用视觉方案锁死。一个养鸡场想监测鸡群活动异常,以前得采购整套物联网设备;现在架一个摄像头定时抽帧,把图片连同问题一起发给模型:“画面里有没有病鸡的迹象?”它返回一段带细节的描述和判断。不是完美方案,误报还得人工复核,但成本从数十万元的一次性投入降到每月几百元的订阅式支出,决策质量从“凭经验”变成“有数据参考”。

电商客服是另一个肉眼可见的落地窗口。据媒体公开报道,京东的自研客服大模型每天扫描超过三亿条咨询消息,把商家侧的转人工率降低了近三成——大型平台用重资产证明了对话质检的价值;剩下的问题同样是价格:绝大多数中小店铺雇佣不起自己的模型团队。第三方质检服务商的做法提供了另一种样本——把店铺与买家的聊天记录批量送给平价模型,自动标注违规话术、情绪风险和服务瑕疵,全量覆盖取代过去的百分之三抽样。当一次对话的质检成本低于一分钱,质检覆盖率这件事本身就不再是预算问题,而是工程问题了。教育行业的办公自动化亦然:有教育信息化服务商在内部测试中表示,把作业图像识别与讲义整理接到多模态接口上以后,教师批改类事务的处理效率有了两位数的提升——这类说法当然带着宣传水分,但方向与 AutomationBench 上 48.8 分对 DeepSeek 38.8 分的成绩互为印证:在浏览器点击、表单填写、文档搬运这类办公室体力活上,它已经具备了承接批量任务的可用度。

把镜头拉回开头那份问问题的名单。开律所的前同事把三十年积案的卷宗扫描件喂给模型,让它先做事实要点摘录与争议焦点归档——“相当于配了个不睡觉的实习生,还不占工位”。在小县城办职业培训学校的前同事,把历年纸质教案逐页拍照上传,自动转成结构化的课件大纲再人工润色,一个暑假干完了过去外包报价五万元的内容数字化。做工业设计的那位则用它看图说话:拍下竞品样品的多角度照片,请它反推可能的注塑工艺与成本区间,作为报价谈判前的功课。三个人没有一个会写代码。多模态平价化最深刻的变化就在这里——“会用眼睛看”第一次变成了人人可调用的公共服务,而不是算法团队的专利。

行业将记住这个窗口期的特征:不是某个巨头打通了什么新场景,而是所有这些早已被验证的场景,突然间都对小微企业敞开了价格的大门。

第四节 三位一体:国产芯片、多模态基座与合规红利

低价能够成立的前提是低成本的供给侧,而这正是本案与前几轮价格战根本不同的地方。据《晚点 LatePost》报道,GLM-5.3-Flash 的全部推理流量都跑在十万张以上的国产芯片集群上,供应商传为华为昇腾、摩尔线程与海光的组合,智谱对此未予置评。研究机构 SemiAnalysis 的评价是:“硬件效率与单 token 成本可比英伟达 GPU”,并且认为“CUDA 护城河再度受到考验”。把这句话翻译成商业语言:砍掉中间商环节与出口管制带来的不确定性之后,国产模型才有资格把价格打到国产电容的价格区间。有趣的是,同一个夏天,OpenAI 也在 Hot Chips 会议上公布了自研推理芯片 Jalapeño——实测跑 GPT-OSS、DeepSeek R1 与 Kimi K2.5 时每瓦吞吐达到 GB200 与 GB300 的 1.5 至 1.9 倍。全球头部玩家正在各自收敛到同一个结论:推理时代的成本竞争,本质是芯片效率的竞争。对中国供应链而言,爆款应用本身就是最好的练兵场——十万张国产芯片头一回同时顶住生产级的流量洪峰,调度策略、驱动兼容与故障模式都会在这种高强度实战里被快速磨平。“从可用到好用”缺的从来不是又一场发布会,而是实打实的负载。

成本效率之外还有一层数字:相比家族旗舰,它的注意力计算量降低约 3.01 倍,KV 缓存降低约 4.44 倍,配合智谱自研推理引擎的 EPD 分离式架构,端到端服务性能较初始基线提升 3 倍。这些冷冰冰的百分比决定了两件对中小企业至关重要的事:一是单位算力的产出更高,价格才有持续下探的空间;二是 FP8 权重约 306GiB 的体积配合 SGLang、vLLM 等主流推理框架的开箱支持,让一体机式的本地私有部署第一次成为中型企业的现实选项,而不是需要几十人团队伺候的科研项目。浙江一家推理引擎创业公司甚至公开宣称,用自研引擎能把国产芯片上千亿参数模型的硬件支出从六百万元级压到一百五十万元级——若其数字属实,私有化的门槛还会继续松动。

于是国产芯片、国产模型加斩杀线定价,这三要素叠在一起,产生了一个海外巨头难以复制的合规红利。中国的政企采购有自己的铁三角约束:《数据安全法》划定了重要数据的出境红线,《个人信息保护法》收紧了敏感信息的处理链条,《生成式人工智能服务管理暂行办法》则要求服务提供者完成备案并对内容负责。在企业级选型的会议上流传着一个段子:技术负责人把模型测评分数讲得眉飞色舞,法务一句话就把话头堵回去——“这个数据出不出境?”使用境外模型服务,光是数据跨境的安全评估就可能耗掉半年周期;而全链条国产意味着从训练到推理都在境内完成,数据不出域、审计可追溯、断供风险可控。国务院国资委推动央企国企 AI 布局的导向也与此呼应——本地化是安全底座,国产化是自主底线。沈阳等地的政务云已经在信创环境里完成了开源国产模型的全栈部署,从底层芯片到模型框架都不假外求,这类先例把可行两个字写进了采购模板。

私有化路线的需求侧逻辑同样在变硬。金融、医疗与大型制造企业普遍面临等级保护合规与供应链断供的双重挤压,过去摆在桌面上的选项都不便宜:要么承受公有云调用中数据出境的灰色地带,要么砸下重金自建算力。MIT 协议的开源补上了第三条路——权重可以下载、可以审计、可以锁进自己的机房长期运行,配合国产芯片一体机方案,一次性投入换取的是多年确定性。作者接触的一家省级银行科技部门,就把评估问题从“能不能用境外模型”改成了“哪家国产方案能同时通过法务与运维两关”。开源从来不只是理想主义,它是合规叙事的另一半:许可证即信任状,可下载即确定性。(文中机构个案为叙述性笔触,但采购风向的转变在多个行业交流场合均可交叉印证。)

作者认识的另一家做政府热线智能化改造的系统集成商提供了时间维度的注脚:此前用某境外模型做概念验证,合规流程走了三个月;换成国产方案后两周上线。时间本身就是钱,而且是中小企业与大院大所同样输不起的那种钱。市场的即时反应出现在发布次日:8 月 27 日,港股上市的智谱跳空高开逾 8%,盘中一度涨超 10%,收盘涨幅约 11%;上证科创板芯片设计指数当日收涨 5.57%,存储与 AI 芯片板块领涨,“国产算力从可用到好用”成了盘面叙事的主线。资本不一定读懂了注意力机制的论文,但它读懂了十万张国产芯片支撑起一个爆款应用这件事的含义。智谱管理层在业绩场合表述过的那个公式——智能的商业价值等于智能上界乘以 Token 消耗规模——在这里得到了第二次验证:每一次单 token 价格的下探,都是在给乘号的右边松绑。

第五节 低价的另一面:滥用、波动与折扣退坡

然而低价从来不是免费的午餐。发布后的两周里,我在开发者社区泡了很久,把观察到的风险信号如实记下来——写实,但不渲染;每一个风险,都附上当下看得到可行的应对路径。

其一,滥用的工业化。 有博主在社交平台晒出“用 GLM-5.3-Flash 批量生成带货文案、日更三百条”的攻略,评论区一片叫好;但顺着链接点进那些由机器批量运营的账号,内容质量的滑坡肉眼可见——语句通顺,信息稀薄,辞藻堆叠,灵魂缺席。当调用的边际成本低到可以忽略,人对输出质量的敬畏感也随之蒸发。这不是模型的缺陷,是激励结构的产物——就像廉价印刷术曾经催生街头小报一样,廉价智能必然伴随“AI 垃圾场”的出现。眼下能指望的三道防线分别是:平台侧的风控,包括频率限制、内容指纹去重与举报下架机制;监管侧的标识义务,按照《人工智能生成合成内容标识办法》,生成内容需添加显式或隐式标识,责任已在法律层面落定;以及最釜底抽薪的一道——经济规律的淘汰:信息过载时代,无差别灌水的转化率必然衰减,最终留在牌桌上的仍是那些把模型当作生产力而非水军兵器的玩家。内容平台也在同步部署 AIGC 检测与限流机制,这场攻防注定长期化,但天平终究偏向有品牌与人格背书的生产者。对策的要义在于接受噪声是普惠的伴生物,然后用制度与算法过滤它,而非幻想低价世界干净如实验室。

其二,质量波动的传闻管理。 多位开发者在 OpenRouter 反馈,北京时间晚间高峰段的响应质量疑似低于非高峰时段,怀疑是推理集群在高负载时切换了量化精度或限流策略;Z.ai 社区也有人贴出同一道逻辑题在不同时段得到不同质量的回答。截至完稿,智谱没有正式承认这种波动存在,所以本书的处理方式是把上述说法严格挂据在社区反馈与开发者实测的层面,标注为有待证实的线索,而非既成事实。理性评估需要两面证据并陈:一面是用户的吐槽帖,另一面是厂商公布的技术账——EPD 架构带来三倍端到端性能提升、官方坦承 KV 缓存仍略大于 Kimi K3 与 DeepSeek V4 Flash 并将优化列为后续方向。敢于公开自己短板的公司,其澄清的可信度理应高于沉默者。至于学术面的评价——社区向来不吝于指出其中多项技术属于成熟思路的组合创新,官方也确实只发布了技术博客而没有配套论文——这种工程师文化究竟是敏捷还是取巧,市场与学界各执一词,只能交给时间裁决。而在生产一侧,聪明的团队早已自行对冲:那支杭州团队的负责人告诉我,他们在业务上线前向接口连发两千次合同条款分析请求做了压力测试,结论是“回答的一致性方差比原先用的海外模型大一些,但成本只有四十分之一,省下的钱够我们加一层人工复核”。双模型冗余路由、错峰调度、关键链路设置熔断——这些手段的共同点是:把平价但不完美当成已知条件来设计系统,而不是当成意外来抱怨。

其三,折扣退坡的可持续性疑问。 最难回答的问题藏在价格背后。即便算上国产芯片的成本优势,0.8 元这个价位也很难说是一个从容的毛利率水平,限时折扣打到旗舰价的二十分之一更像是争夺心智的市场攻势而非成本的映射。我问过一位接近智谱供应链的人士,他对利润率问题笑而不答,只说:“你可以算算十万张卡的折旧和电费。”我没有他掌握的数据,但朴素的商业常识摆在那里:不可持续的低价会反噬所有依赖它的人。历史上并不缺乏前车之鉴——社区流传某些竞品在补贴期结束后大幅上调输出价格、随后调用量近乎腰斩的说法,虽未经官方证实,但这类故事的经济学内核不难理解:当用户完全因为价格而来,也会完全因为价格而去。云计算行业十年前的竞价实例与包年合约之争早给出过模板:潮水退去时留在岸上的,是提前锁定合约、并把架构设计成随时可以搬家的人。所以无论开发者还是创业者,理性的姿态都是三条:其一,趁折扣期锁定资源包与年框协议,把优惠期的现金流优势沉淀为数据和工作流的积累;其二,在架构里保留模型抽象层,让切换一家供应商的工作量控制在几天之内;其三也是最重要的——把核心竞争力放在数据资产、评测基准与业务封装上,而不是绑定在任何一家模型的软肋或折扣上。对厂商而言,Flash 发布价、旗舰价、缓存价组成的分层价目表本身就是缓冲垫:就算未来价格回归,也有一条平滑的梯度可走,而不是悬崖。可持续的低价才叫基础设施;否则,那只是一场促销。

第六节 从奢侈品到水电煤:基础设施化的最后一百米

从奢侈品到水电煤的转变,从来不只是价格下降,更是服务标准的重塑。水电煤之所以成为基础设施,不是因为便宜,而是因为稳定、可预测、出了问题有人修。大模型的普惠化要走到终点,需要同步补上的功课是一整套非模型能力:白纸黑字的 SLA 承诺、可观测性工具链、故障回滚机制,以及一个能接住用户求助的响应体系。这些枯燥的东西才是从实验室走向千行百业的最后一百米。

基础设施化的路径,历史上早有范式可循。电力最初只是工厂主们的私有资产,直到公共电网把发电与用电解耦,制造业才敢围绕电动机重构整条流水线;云计算把服务器从购置资产变成按秒计费的公用资源,创业者的默认动作才从租机房托管变成随手开个账号。大模型正走在同一条三段路上——奢侈品阶段比谁最聪明,工具阶段比谁最好用,基础设施阶段比谁最让人放心。中国市场恰好为这场过渡备齐了燃料:开源社区供给了迁移的自由,价格战供给了切换的动力,两股力量叠加,让这里的进度条走得比任何地方都快。

我在自己的编辑器里集成 AI 写作功能时体会最深的一点是:终端用户根本不在乎你底层用的是哪家模型,他只关心两件事——写完这段会不会卡住,生成的内容能不能直接用。稳定性比性能更容易被感知,可用性比能力上限更重要。一个偶尔惊艳但经常掉线的模型,在真实业务里的口碑远不如一个始终及格、从不缺席的对手。这也解释了为什么牛来的匿名公测要做满六天:与其说是营销博弈,不如说是一场大规模的生产环境压力验收——五十万亿 token 的洪峰过后还能稳定供货,才有资格谈基础设施。

写下这些文字的 8 月末,OpenRouter 上这个模型的日调用量已从峰值回落了约三成。这不叫衰退,叫冷静——尝鲜者的热度自然消退,真正需要它的人开始沉淀下来,把接口埋进真实的业务流程。普惠从来不是一哄而上,而是一点点渗透,像水渗进沙地,看不见,但到处都在湿。

那位中山灯具厂的主管后来又发来一条消息:他们用同一个模型做了第二件事——拍仓库成品照片,让模型识别型号与数量,自动生成库存日报。“以前两个文员对一天,现在半小时。”没有欢呼雀跃,只是平静地陈述了一个事实上岗。这大概就是普惠最真实的模样:不激动,不喧哗,只是把手上的活儿变得省力了一点点。而当这样的省力遍布千行百业的时候,人们会忘记 0.8 元曾经是一个新闻数字,正如今天没有人讨论一度电值不值得用。普惠的终局不是所有人用上最聪明的模型,而是所有人都用得起足够聪明且不再心疼的模型——断供焦虑消失了,性价比计较失效了,剩余的命题只剩一个:拿这份便宜的智能,去做从前不敢做的事。价格战的故事写到普惠为止;但点燃这场地震的公司何以敢如此定价、又凭什么扛得住十万张卡的资本开支——下一章,我们把镜头转向这家公司自身。

本章参考资料

  1. 智谱官方:GLM-5.3-Flash 技术博客与开放平台定价页(2026 年 8 月 26 日)
  2. HuggingFace 模型卡:GLM-5.3-Flash 开源仓库(MIT 协议)
  3. OpenRouter 平台:隐身模型排行榜、每日 token 流量统计与开发者反馈区
  4. 腾讯新闻、36氪、IT之家:GLM-5.3-Flash 匿名上线到官宣认领全过程复盘报道
  5. 《晚点 LatePost》:智谱十万张国产芯片承载推理流量的供应链调查报道
  6. SemiAnalysis:关于 GLM-5.3-Flash 硬件效率与单 token 成本的评论
  7. Artificial Analysis:Intelligence Index 榜单更新与各模型得分明细
  8. 上海证券报、雪球:智谱港股行情与科创板芯片设计指数异动快讯(2026 年 8 月 27 日)
  9. 新华网、央广网、大众日报:工业质检多模态大模型产线落地系列报道(空调产线视觉质检、人造革缺陷检测装备等)
  10. 工业和信息化部:人工智能应用典型案例与质量提升典型案例公示名单
  11. 国家网信办等部门:《生成式人工智能服务管理暂行办法》《人工智能生成合成内容标识办法》
  12. 中国政府采购新闻网:政务云信创环境部署开源大模型的本地化实践报道
  13. 腾讯云开发者社区:大模型 API 选型、月度预算与迁移实战经验合集
  14. V2EX、知乎、Z.ai 社区:高峰时段响应质量与限流传闻的讨论帖汇编

第九章 智谱方法论——一家中国AI公司的战略哲学

💡 独思时刻:把 GLM-5.3-Flash 的参数表、定价单和流量曲线都摊开之后,我发现真正值得写的已经不是这款模型,而是这家公司。两年之内用同一套打法完成两次匿名发布——第一次验证工具,第二次收割战果;市值上行期不讲增长讲「归零」,流量封神前不讲品牌讲「隐身」。把这些动作连成一条线,你会看到比任何单一事件都重要的东西:一套可复用的公司级作战方法。全书行至此处,前八章回答的是「发生了什么」,本章回答最后一个问题——智谱是怎么想问题的。

二〇二六年七月十一日,智谱创始人唐杰发出一封题为《巨浪已来》的内部信。信不长,却几乎找不到一段在汇报收入、盘点成绩。「巨浪已来,趋势不可逆转。智谱要做那个迎着浪头、向上摸高的人。不登顶,就是失败。」信的核心是「Touch High(摸高)计划」:未来两年战略性投入四大核心引擎——长程任务、自治智能体系统、完全自我训练、极致安全治理,明确写下「不追求短期的应用变现」。放在任何一家高速增长的公司身上,这都是反常动作;放到当时的市场语境里,反常之外还有一层抢跑意味:就在前后脚,另一家港股大模型公司 MiniMax 因股份解禁遭遇连续下跌,市值跌破千亿港元,资本市场给AI公司打分的尺子肉眼可见地从「想象空间」换成了ARR、增速、留存率这些传统SaaS指标。市场上的聪明钱已经换了度量衡,唐杰抢先一步做的,是替组织重新定义「该用什么尺子量智谱」——不是回应质疑,而是预防性地下架对方手里的尺子。

六个星期后,八月二十日,代号Ox-Alpha的神秘模型(中文社区昵称「牛来」)悄悄挂上OpenRouter的隐身模型列表;八月二十六日晚,智谱官宣认领并以MIT协议开源、同步登陆HuggingFace。结局如今已是公共知识:五天累计流量超五十万亿token、首日把平台单日纪录抬高约四倍、终结DeepSeek在OpenCode连续五十六天的霸榜、揭晓次日港股跳空高开逾百分之八。这两个动作,一个向内重置组织的坐标,一个向外重置市场的坐标,相隔三十九天,底层却共用同一套哲学。要看懂这套哲学,得回到更早的地方。

第一节 清华系基因与进化

智谱的起点不是一家公司,是一间实验室。一九九六年成立的清华大学计算机系知识工程实验室(KEG),是国内最早开展自然语言处理与知识图谱研究的团队之一。二〇〇六年,实验室的唐杰团队做出科研情报挖掘系统AMiner,这台「守着台式机做学术搜索」的系统一做十年,从单机服务做到千万研究者规模。这段经历沉淀下来的不是某一个算法,而是一种时间观:想得足够深,才敢选得足够反;选得足够反,就必须守得足够久。这间实验室后来还走出过其他知名大模型公司的创始人,坊间津津乐道的师承故事此处按下不表——重点是,种子在同一家温室里待了很久。

二〇一九年六月,上述技术积累以成果转化方式落地为公司,智谱正式成立。此后每一个关键抉择几乎都是这种实验室时间观的延续。二〇二〇年底,当国内几乎没有机构认真对待大模型时,智谱决定不走OpenAI的GPT路线、也不走谷歌的BERT路线,从零自研GLM预训练架构;二〇二一年训练完成百亿参数的GLM-10B,同年用MoE架构跑通了收敛的万亿稀疏模型——请记住这手旧功课,本书第三章那套混合专家工程能力,伏笔在这里就埋下了。二〇二二年八月,中英双语千亿模型GLM-130B开源,比ChatGPT的发布还早三个月;同年十一月,斯坦福大学大模型中心对全球三十个主流大模型做全方位评测,GLM-130B是亚洲唯一入选者。二〇二三年三月十四日,GPT-4发布的同一天,智谱上线并开源ChatGLM-6B;当年十一月,HuggingFace盘点社区最受欢迎的十五家AI机构,智谱成为中国大陆唯一上榜者。开源先锋的身份,从这一串时间戳里自己长了出来。

制裁与奖项是这条曲线的两个路标。二〇二五年一月十五日,美国商务部把智谱列入实体清单,这是中国大模型公司首次「享受」该待遇;智谱当晚声明全链路自主研发不受实质影响,次日照常发布新模型,并把Flash系列以免费开放方式推给开发者——今天这个以「又快又便宜」立身的Flash产品线,最初竟是被制裁逼出来的一次公开表态,所以它身上天然带着对抗性基因。同年十一月六日,乌镇,世界互联网大会最高规格的领先科技奖从三十四个国家和地区的四百多项申报中评出十七项,清华大学与智谱联合申报的「GLM大模型关键技术及规模化应用」入选,《北京日报》以「京产大模型获世界互联网大会最高奖」为题报道。公司方面在获奖回应里留下了一句日后被反复引用的话:只有从底层开始自主研发,才有机会「摸高」与引领——两个月后「摸高」二字出现在内部信标题旁,没人觉得突兀了。

二〇二六年一月八日,智谱登陆港交所主板,摘下「全球大模型第一股」名号:发行价116.2港元,开盘报120港元、市值约五百一十二亿港元,IPO募资约四十三亿港元。敲钟当天公司的动作再次违反商业常识——不是庆功冲刺,而是宣布全面回归基础模型研究、全力冲击下一代模型,内部信里那句「别人敲钟,我们归零」由此而来。还有一个容易被忽略的画面细节:面向投资者的经营表达多出自CEO张鹏,基础研究与长期战略的宣示则一贯出自创始人唐杰,一人对准商业钟,一人对准技术钟,两人的公开轨迹恰好把这个故事后半段的「两只时钟」具象化了。再补一组来自招股书的冷数据校准温度:二〇一九年以来八轮融资合计超八十三亿元;二〇二二至二〇二四年收入从五千七百余万元增至三点一二亿元,同期净亏损从一点四四亿元扩大至二十九点五八亿元;累计研发投入约四十四亿元,研发人员占比一度高达七成四。这是一家披着上市公司外衣的研究院——也是理解它后续所有「反直觉」决策的财务底色:既然烧钱做前沿是常态,叙事重心当然该押在智能上限而非当季利润上。

实验室出身也意味着一笔独特的资产负债。据报道,二〇二一年底至二〇二二年是这家公司成立以来商业化色彩最浅的阶段——彼时国内几乎没有人为「大模型」三个字标价,直到第一批风投冒险入场,才拿到那笔续命的融资。把「最难熬的时候把GLM-130B开给全世界检验」视作这家公司性格的形成时刻并不夸张,多年以后,管理团队在接受媒体专访时仍用「开源和商业不要混为一谈」「我们选择慢慢来」来描述这种节奏——先把地基浇筑完,再等人潮涌进来。而把这个时间轴快进到敲钟后的半年,画面已经换了一层底色:曾经热闹的「AI六小虎」明显分化,零一万物的预训练团队并入通义,百川转战医疗垂直,月之暗面与MiniMax收缩战线深耕C端,业内流传起中国能持续参与基础模型竞争的玩家终将收敛为「基模五强」的说法。生存带宽变窄的行业,反而凸显出智谱提前站定基础模型身位的先见,也让「反直觉」三个字多了一层含义——它不是浪漫,是提前量。

本节定性:清华给智谱的不是一块招牌,是一副敢把周期拉长的骨架。

第二节 匿名发布:迭代了两轮的博弈

讲智谱方法论,绕不开匿名发布——它辨识度最高,也最容易被轻率解读为「营销花活」。放进策略框架看,精彩之处可用三组词概括:信息不对称、贝叶斯更新、预期管理。框架点到为止,重点看两轮迭代如何升级。

第一轮是今年春节前夕的Pony Alpha。一个无名模型悄然冲上榜单,在编码与Agent任务中表现惊艳,全网猜了数周后被证实是GLM-5。从方法论角度,这次试水买到最重要的数据不是分数,而是三个前置验证。其一,去掉品牌标签后,用户评价的真实锚点在哪里——结果证明「心理账户」确实存在:当一个模型顶着「中国公司出品」的标签出场,海外开发者的评判标准会被无形调高;匿名状态下,同等质量的输出能换来明显的惊喜溢价。其二,社区侦破的速度与路径——分词器指纹、探针测试这些手段多久能锁定厂商,决定了匿名窗口的实际长度。其三,揭晓名效应是否成立——谜底公布时,此前围观的人会不会转化为自来水。三个假设全部证实,于是有了第二轮。

第二轮就是「牛来」。这一次,规模与精细度全面十倍化:八月二十日隐身上线OpenRouter,首日登顶并将平台单日token纪录抬高约四倍;数日内终结DeepSeek在OpenCode平台连续五十六天的霸榜;五天累计流量超五十万亿token,单日峰值约六十二万亿;高峰期使用量一度达到DeepSeek的两倍以上。更重要的是质变:第一轮只是让极客惊讶,第二轮变成了全网的侦探游戏——独立研究员以分词器指纹与探针测试给出「百分之九十九把握指向智谱」的判断,预测市场上超九成筹码押注同一个答案。这局棋的最简表述是:厂商握有「我是谁」的私有信息,社区依据不断出现的公开线索修正各自判断,每一张新截图、每一次独特的回答口味,都在让某个候选者的概率收敛。而智谱的高明在于从未试图阻止这场推理——它实际是在配合演出。悬念越早被「破案」,讨论热度越高,揭晓日的确定性就越足;等到八月二十六日官宣认领,「是谁」早已没有信息含量,揭晓剩下的功能是情绪兑现:所有人都在为自己早已相信的答案鼓掌。

预期管理才是这套玩法的内核。传统发布会试图一次性投递惊喜,匿名发布则把惊喜拆成连续剧:第一集匿名性能封神,第二集全网破案,第三集身份揭晓顺势抛出定价炸弹——每一集都有独立的传播峰值,且前一集天然为后一集蓄水。智谱Z.ai负责人李子玄曾在播客中补充过一个关键考量:海外开发者社区的口碑对国内舆论有强烈的反向传导,先被海外认证、再被发现是中国公司做的,这个叙事结构在国内激发的能量远大于一次常规的国产发布。

平衡面必须一并讲清。匿名不是万能牌:平庸的模型匿名出战,收获的只会是加倍的嘲讽,相当于给自己的失败办一场直播;而且第二轮的匿名其实早余名存实亡——社区普遍心知肚明是智谱,匿名的边际价值已从「隐身保真」退化为「仪式感与流程控制」。此外,对一家上市公司而言,把自家新模型的亮相包装成一场持续的公开猜谜,在信息披露规范上并非全无值得斟酌之处;目前没有任何监管层面的异议见于公开渠道,但这道边界值得写进公司治理课程的案例集。

把两轮放回同一张流程图上,「匿名发布」就不再是战术,而是方法。第一轮解决的是信息环境问题:在无人知晓厂商身份的水域里测量模型能力的真实水位,顺便校准品牌标签带来的心理折价系数;第二轮做的是放大与收割——所有参数乘以十,流量以生产环境的真实调用计费验证而非实验室压测,口碑则借侦探游戏的社会化传播完成二次分发。试水、定型、规模化复制,同一条作战链条清晰跑了两遍。顺带可以给任何想抄袭这套打法的公司开一张资格清单:产品自信(敢以素颜上架接受全网裸测)、组织耐心(忍受数周不认领的漫长悬置)、叙事储备(揭晓时给出比身份更有分量的新信息——比如一颗定价炸弹)。三者缺一,这出戏就会演砸:藏不住实力是悲剧,揭晓时无牌可亮是闹剧。

本节定性:两次匿名发布合起来,是一次完整的武器试验与定型——第一次造枪,第二次实战。

💡 独思时刻:再记一个反共识观察。智谱把效率红利大规模让渡给用户的做法,本质上是对Scaling Law边际递减的提前对冲。几乎所有头部公司嘴上都还挂着「Scaling仍然有效」,但智谱用GLM-5.3-Flash给出了另一种回答:下一代竞争的主战场,将从「能力上限」移向「能力成本」。这不是否定Scaling,而是拒绝单边下注——把对数增长的高墙筑在自己身后,再把墙内的土地折价出租。一家公司同时押注技术上界与成本下界、并把两者装进同一个产品推出,意味着战略层早已接受「用利润换渗透」的阶段设定;至于资本市场愿不愿意为这个阶段定价,那是第五章定价与第六章盘面的故事了。

第三节 三项决策:MoE、原生多模态与MIT协议

GLM-5.3-Flash的技术解剖在第二章已完成,这里还原的是三个选择的决策顺序与共同逻辑。

第一个选择是MoE架构。三百二十B总参数、十八B激活,层数压至四十五层——还记得第一节里二〇二一年那台万亿稀疏模型吗,五年前的旧功课在这派上了新用场。相比GLM-4.5世代的九十二层纵深堆叠,近乎腰斩的层数意味着更短的通信路径与更小的调度损耗;混合注意力让线性注意力以递归状态捕获局部依赖、稀疏注意力以索引器召回全局上下文,再辅以mHC与IndexPool这类精巧模块,注意力计算量较GLM-5.3下降约3.01倍、KV缓存降低约4.44倍;配合自研EPD分离式架构带来端到端三倍的服务性能提升,最终把每百万token输入0.8元、输出2.8元的定价稳稳托住——叠加限时折扣期约再半价的阶梯,这相当于旗舰GLM-5.3定价的二十分之一、Claude Opus 4.8的约四十分之一。请注意这条因果链的方向:不是先喊低价再倒推技术,而是架构决定成本、成本决定定价安全边际——那张令同行牙酸的价格表,其实在架构图上就已写就。顺带一提,0.8元这个位置实质是把一条斩杀线直接画在对手的成本表上:任何前代旗舰在此价位面前瞬间失去性价比,这正是术语意义上的清场动作。Flash之名沿用「又快又便宜」的产品线语义——对标Gemini Flash的命名传统,是全新基座而非旗舰缩水版;用一个品类名承载一次路线选择,让市场以最低的认知成本接受「便宜不等于弱」,同样是方法论的组成部分。

第二个选择是原生多模态。预训练阶段就把图文语料融入三十万亿token语料池,而不是在成熟的文本模型外面缝一只视觉编码器——业内俗称拼接式方案。两条路线的跑分未必悬殊,但任务一致性天差地别:OfficeQA Pro拿下62.4分,显著甩开Claude Opus 4.8的48.9分;BabyVision 53.4分对比DeepSeek同类版本的35.1分更是断崖式领先。更深一层是优先级的表态:智能体办公自动化场景里,屏幕信息大多图文混排,原生多模态基座省掉的是每一次调用时的格式搬运成本。省钱的结构,从预训练起就被焊进了地基。

第三个选择是MIT协议。把大模型开源许可排成光谱,MIT位于最宽松一端:保留版权声明即可自由商用、修改、闭源分发衍生作品。对照组一目了然——Meta的Llama系列采用Community License,长期不满足OSI开源定义,设有「月活跃用户超七亿须另行申请授权」等条款,个别版本还对竞争者施加排斥性约束;阿里的Qwen在自定义协议与Apache 2.0之间过渡;月之暗面的Kimi K3自定义许可保留了收入门槛式的商谈空间。而DeepSeek坚定选用MIT,智谱亦自此把GLM系列陆续切换为MIT——头部两家不约而同收敛到同一个最大自由度上,有社区评论称之为一种默契:中国头部开源阵营已然认定,生态渗透的价值高于许可独占的租金。对一个志在出海的开发者生态来说,MIT等于一张免签护照:任何云厂商的企业法务都没有理由否决一个MIT权重的接入评估,任何想在其上构建商业产品的创业公司都不必担心某天收到律师函。当能力大致追平时,许可细节会成为采购决策中一票定音的因素——这不是纸上推演,而是Windsurf、Vercel、Cerebras等海外平台陆续接入GLM系列的现实路径。

还有一个常被当作花边的细节值得正名:为什么只发技术博客、不挂学术论文?放进两只时钟的框架里,这几乎是一种必然——论文的同行评审以月为单位结算声誉,而技术博客当天发布、官宣当天权重即可下载复现;当竞争对手还在打磨「相关工作」章节的措辞时,这份博客里的部署文档已经被数百家企业的评估流程翻阅。信息披露的速度本身就是产品的一部分:效率哲学不只写在注意力公式里,也写在传播链路的每一处接缝上。

本节定性:三项决策分属架构、数据、法律三个领域,纸背写着同一句话——把未来十年的通行关税降到零。

第四节 对照样本:DeepSeek、阿里与字节的不同答卷

智谱方法论并非孤本。把同期几家巨头与新贵的关键动作摆上同一张桌子,差异立刻清晰。而把对照放进产业收缩期来看,意味更足:据公开报道,字节二〇二六年资本开支规划约一千六百亿元、其中AI芯片预算约八百五十亿,阿里则启动了三年三千八百亿的新基建计划;巨头的资金、算力与人才三重碾压悬在头顶,独立公司若在同一维度上打消耗战,等于自缴武器。这正是智谱必须「反直觉」的生存前提——差异化从来不长在预算表上,它长在发布时序、协议结构、认知规律这些对手没当回事的缝隙里。

DeepSeek是MIT路线的先行者,也是「直球派」:每逢发布皆是论文与官宣一条龙,从不匿名暖场,靠信息密度本身制造声量。两家在协议上同频,在传播风格上互为镜像——DeepSeek追求绝对冷静,让模型自己说话;智谱吸收了同一套信任机制并加以戏剧化,先用盲测建立可信度,再借揭晓制造第二波声量。殊途同归:都在绕过品牌折扣,只是路径不同。赛果同样耐人寻味——Artificial Analysis综合指数上,GLM-5.3-Flash以五十七分反超DeepSeek V4 Pro正式版的五十三分;另据部分市场分析的说法,DeepSeek V4 Flash一轮提价后调用量下滑过半(该数据未经充分交叉核实,姑妄听之),若属实,恰好印证斩杀线上没有人能长期靠提价守住阵地,也反衬出Flash定价的凶狠并非鲁莽。

阿里Qwen走的是「大而不赌」路线:家族主力采用Apache 2.0,旗舰Max长期闭源仅提供API接口,直到近期才表态将首次开放权重——摇摆本身,泄露了闭源变现与开源渗透之间的内在张力。而在GLM-5.3-Flash官宣的同一夜(第七章详述过的那个对照样本),Qwen3.8-Flash-Next以一千两百五十亿参数、输入一元输出三元的价格现身,作为Qwen4架构的先导预览。贴身、迅速、精确卡位同一价位带,说明这已是被公认的主战场;但拿预览版对阵全新基座,两种身法的底气差异也写在命名里。

字节跳动交出的则是教科书式双轨制:C端以豆包应用承接大众心智,B端凭火山引擎承接企业预算,模型能力通往商业化的路径最短。更有意思的是上游亲缘——GLM-5.3-Flash的mHC模块脱胎于字节先前公开发表的Hyper-Connections思路之改进,稀疏注意力亦有DeepSeek先发论文的影子。批评者据此评价这套架构是「成熟技术的工程组合」,无一从零发明,且智谱未随模型放出学术论文、仅有技术博客,学界印象分难免打折。但换个角度看,学术界共享上游、工程界比赛集成速度,本就是这个阶段的产业分工常态:当这些零件以四十五层的紧凑身材组装出Artificial Analysis五十七分、与Claude Opus 4.8持平的成绩时,评价方法论便绕不开另一条标准——能否以最短时间把全行业的智慧兑换成自身成本优势。零到一的荣誉属于写论文的人,一到一百的回报属于把论文叠进架构的人;商业史惯常把后者记作赢家,尽管它欠前者一座奖杯。

本节定性:同一张牌桌四种打法,胜负宜缓判,但集成者拥有最低的学习成本与最快的学习频率。

第五节 全球化野心:一套动作的海外语法

细看GLM-5.3-Flash出海的全套动作,会发现一种刻意设计的「低摩擦语法」:MIT协议消除法律摩擦,HuggingFace第一时间上架消除获取摩擦,英文技术博客替代论文消除阅读摩擦,OpenRouter首日登顶消除试用摩擦。每一步都在降低海外开发者接触它的成本,直到成本趋近于零,只剩模型质量本身说话。这与「先海外认证、再国内发酵」的双城传播链严丝合缝:海外市场的品牌真空反而是后来者的机会——没有存量偏见,就不必缴纳标签税。

成效是实打实的。Windsurf、Vercel等海外主流平台相继接入GLM系列,美国开发者在工具链输出里读到中文注释的轶事已成圈内地标;据招股书披露期间的媒体报道,GLM-4.5与GLM-4.6在国际平台的付费API收入曾超过其余所有国产模型之和;这一次盲测期的五十万亿token,主体正来自真实生产环境的海外调用——开发者用钱包投出的票,比任何发布会都诚实。连芯片叙事也在随行出海:承载全部推理流量的十万张国产卡,在海外开发者眼中首先是一条成本新闻而非立场新闻,硅谷推理平台愿意接入,本身就是对「效率故事具备跨阵营说服力」的背书。只是仍需提醒一句:企业客户的信任账本分两层,试用层看效果,续约层看存续确定性——后者才是更漫长、也更容易被忽视的战场。

但「野心」一词必须配上边界才算诚实。先是地缘折扣:实体清单早在一切之前发生,中国模型在部分海外政企市场的准入天花板,不会因一纸MIT协议而消失;其次是供应链弹性——本次全部推理流量压在十万张以上国产芯片集群之上,既是护城河也是紧箍咒,训练需求与推理流量的增速一旦错配,扩张节奏便由不得自己;最后是国内基本盘:当价格已卷至极限、超额利润无处安放,全球化与其说是征服叙事,不如说是生存理性——本土市场给了量产验证,海外市场才供得起增量利润。李子玄把海外口碑的反哺价值讲得很透彻,而没被讲透的另一面同样成立:反噬也会沿同一条链路回流,未来任何一次重大翻车,都将在同样的结构里被放大传回。

本节定性:这一轮出海不是姿态表演,是几条路里唯一算得过账的一条;走下去的前提条件,同样苛刻。

第六节 八月二十六日之前的五个昼夜(本节为推演情景)

先亮明性质:以下全部内容为推演情景,系基于公开信息的合理想象,不代表亦无意还原智谱内部的真实过程。真实的会议不会有如此整齐的逻辑,请把本节读作一份决策清单的沙盘演练,而非纪实报道。

变量一是时机。八月二十日上线,为何拖到二十六日才认领?推演的头号约束是流量曲线:盲测期的传播自带自增强效应,过早揭晓等于亲手关掉发动机;过晚揭晓则放任热度衰减、给竞品留出截胡议题的时间窗。这五个昼夜,运营侧每天看到的绝不只是token计数,还有社交网络的讨论结构何时从「这是什么模型」迁移到「它是不是智谱」——当第二个问题成为主流,悬念的信息租值便已耗尽,揭晓只剩仪式价值,再拖反而把仪式拖成拖延。时序约束同样微妙:八月十四日旗舰GLM-5.3甫一亮相(那句「Scaling post-training is all we did」言犹在耳),十二天后便让以性价比屠榜的新模型接棒,前后脚构成「智能上限加单位成本」的组合拳——间隔本身就是叙事的一部分:太近怕左右互搏,太远恐气势中断。

变量二是道具的取舍。协议大概率无需临场争论——MIT已是系列的既定航线;真正要拍板的或许是发布要素的排序:先开源权重还是先公示降价、先讲架构创新还是先晒流量战绩、国产芯片的部分说到几分。事后看,官方对芯片供应商保持沉默,《晚点LatePost》援引产业链消息的口径指向华为昇腾、摩尔线程、海光,智谱方面未予置评。这个沉默未必只是低调:点名供应商固然能给「国产算力」叙事添柴,却也把合作方的产能与商务细节提前曝光于聚光灯之下;模糊处理,反倒更像一种保护。

变量三是二级市场的协同。对上市公司而言,八月二十六日晚的那纸官宣同时是一次面向资本市场的信号发射——次日港股智谱跳空高开逾百分之八、盘中一度涨超百分之十,科创芯片设计指数收涨5.57%,存储与AI芯片板块领涨。无论内部是否真把股价写进择时函数,事后回看,官宣时点的选择客观上促成了产品叙事与资本叙事的共振:流量数据先起飞,估值结论随后到账。

变量四是风险清单。认领送来的不只掌声:国产芯片的持续供给将被逐项问询,五十万亿token背后的峰值成本会被摊开算账,社区抱怨——速度不及旗舰水准、KV缓存仍略大于对手、长程智能体任务动辄半小时起步——也早被整理成帖。推演到这里,那晚的选择题其实高度对称:继续匿名,战术收益所剩无几;立即认领,接过全场火力的同时也收回定价权与生态卡位。所谓胆识,很多时候不过是把两份计算都做完之后的执行力。

变量五是口径的归属。发布会由谁站台、术语停在工程深度还是战略高度,都会被外界逐帧解读:讲深了怕暴露底牌,讲浅了辜负两星期的期待;「牛来」这个民间昵称要不要官方认领、终结DeepSeek连续五十六天霸榜的纪录要不要主动提,每一处细节都是站位问题。推演中至少存在两个版本的本子:一版克制,只谈技术与开源;一版铺陈,把国产算力的旗帜插满标题。最终官宣稿落点介于两者之间——技术与开源浓墨重彩,供应商一笔带过,股价与荣誉不着一字。这份配比的分寸感,本身就像一份被反复修改过的稿件。

再次强调:本节为推演情景。纪要锁在会议室里,真实分歧外人无从得知;唯一可确认的是结果呈现出罕见的干净利落,而干净利落背后,显然存在着排练。

第七节 方法论的本质:先做后说,与两只时钟

概括智谱的自我表述,是内部信里的三个词:本质、反直觉、专注。全书至此,笔者给出自己的版本,只有四个字:先做后说。学术搜索默然做了十年才等来商业化风口;GLM-130B提前三个月问世然后陪跑到赛道被点燃;Coding转向先埋头大半年才被海外订单追认;两次匿名发布更把「先做后说」推到字面——先把成绩跑出来,再把名字亮出去。

支撑这套打法的机制,就是贯穿全章的两只时钟。技术钟越走越快,模型迭代以三个月为单位计费,一处机会窗口错过便是永久失格;商业钟却按季度摆动,收入、留存、利润这些科目要有秩序地兑付。多数公司的痛苦在于两只钟频率不一又必须同时侍奉,而智谱的方法论恰恰生长在两只钟的相位差上:匿名测试让产品的终极验证提前在技术钟里跑完,把商业钟的长度留给下一代弹药;「别人敲钟,我们归零」说的是同一件事——上市是商业钟上最大的刻度,但只能当节点,不能当终点。《巨浪已来》宣布的四大引擎,本质是把技术钟往十年尺度拨动的又一次尝试,代价是「不追求短期变现」,让商业钟独自承受资本市场的季度拷问。按信中的表述,四个方向各有明确的靶心:长程任务是研发新一代记忆架构,让模型能把「设计一种新型抗癌药物分子」这类宏大目标自主拆解为数千个可执行子任务;自治智能体系统要建一个由不同专业「性格」智能体组成的社会,让它们自主辩论、协作、审查代码、调度资源;完全自我训练直面人类高质量数据见底的焦虑,以合成数据工厂与对抗博弈实现知识的「无中生有」;极致安全治理则把伦理与社会规范写入模型价值函数,攻坚机械可解释性。记忆、协作、进化、边界——恰好对准了智能体时代四块最大的空白。张力不会消失,只能被管理;迄今为止的管理办法,是持续的胜绩。

末了照例两面平衡。这套方法的脆弱同样醒目:它高度依赖「熬到被验证的那一天」——假如当年押注千亿参数迟到一年半,故事将彻底改写;今天的四大引擎若两年内无法兑现,市场不会因方法论漂亮而网开一面,六小虎分化与「基模五强」收敛的行业预言都在提醒独立模型公司,容错窗口正在收窄。但方法论的本义本就不是成功的担保,而是提高胜率的手段:在噪音最盛时保持独立判断,在资源有限时敢于把筹码押在不被理解的方向,再用可复述、可复制的方式把每一次胜利固化为组织记忆。GLM-5.3-Flash不是侥幸的爆款,而是这套组织能力运转十余年后的一次寻常输出。AGI马拉松尚在中途,方法论的下一步验证不在任何复盘文字里,而在下一次「先做后说」的结果之中。

本章参考资料

  1. 智谱创始人唐杰内部信《巨浪已来》(2026年7月11日),上观新闻、澎湃新闻相关报道
  2. 《巨浪已来:国产大模型双雄,同日发声》,凤凰网财经
  3. 《大模型第一股诞生!从清华园到港交所,智谱这六年》,《麻省理工科技评论》中文版
  4. 《智谱登陆港交所!海淀诞生「全球大模型第一股」》,北京市科学技术委员会官网
  5. 《京产大模型获世界互联网大会最高奖》,《北京日报》
  6. 《「GLM大模型关键技术及规模化应用」获2025年世界互联网大会领先科技奖》,世界互联网大会官网
  7. 《HuggingFace宣布最受欢迎的AI机构,开源模型ChatGLM-6B广受认可》,中国网
  8. 《智谱上线并开源GLM-5.3-Flash 10万张国产卡撑起海外最火模型》,搜狐科技
  9. 《10万张国产算力卡扛起「牛来」:智谱开源GLM-5.3-Flash》,科创板日报
  10. 《匿名模型Ox Alpha确认来自智谱,GLM-5.3-Flash正式开源》,网易·未来图灵
  11. 《从「Pony Alpha」到GLM-5:智谱的大模型周期博弈》专题节目实录
  12. 《声动丨唐杰:巨浪已来,不可逆转》访谈实录
  13. 《从DeepSeek、Kimi到「黄仁勋联盟」:AI模型开源到底「开」了什么》,雪球专栏
  14. 《市值2500亿港元,从清华实验室走出来个AI独角兽》,新浪财经
  15. 《独家对话智谱:开源的大模型越来越多,但智谱选择慢慢来》,腾讯新闻

结语 当潮水改变方向——中国 AI 的新坐标

潮水改变方向的时候,从不张贴公告。你能做的,只是盯着浮标起伏的幅度,然后在某个清晨承认:这片海的脾气变了。

——题记

站在 2026 年 8 月 27 日收盘的时间点回望,距离那头无名之牛深夜现身 OpenRouter,过去了整整七天。七天里,一座隐身的榜首被揭名,一张价格表被疯传,一个指数被点亮,一套旧有的竞赛共识被动摇。本章不打算提供一个斩钉截铁的结论——那样的结论在历史面前通常是廉价的——而是试图给出几组坐标:这款产品在坐标系里的三重位置,全球格局的再评估,一种发布范式的遗产归属,效率竞赛对于具体的人的意义,以及下一个临界点到来之前,值得持续追踪的未尽议题。

一、三重定位:一款模型的三份答卷

第一份答卷写在技术效率栏。GLM-5.3-Flash 以 57 分的综合评测追平 Claude Opus 4.8,超过了上代旗舰 GLM-5.2 与 DeepSeek V4 Pro 正式版的 53 分,而达成这一切的架构,是一款激活参数只有 18B、层数砍半、注意力计算量较 GLM-5.3 降低约 3.01 倍、KV 缓存缩减约 4.44 倍的效率机器。它证明了前沿智能的门槛并没有想象中那样与庞大的参数总量锁死;聪明可以用更精巧的方式交付。这份答卷回答的问题是:能不能做到同样好,却少得多。

第二份答卷写在算力自主栏。支撑全部推理流量的,是十万张以上的国产芯片集群——供应商构成至今仍停留在《晚点 LatePost》的供应链侧面信息(传为华为昇腾、摩尔线程与海光),智谱未予置评,但这不影响事实的重量:这是一次通过商业闭环完成的自我证明,全球开发者的真实负载日夜奔腾其上,单日峰值约 62T token,端到端服务性能较初始基线提升三倍。SemiAnalysis 有关「硬件效率与单 token 成本可比英伟达 GPU」的判断,与「CUDA 护城河再受考验」的警语一道,把这场验证的分量讲清楚了。国产算力从「可用」迈向「好用」的跨越,第一次有了大规模、可持续、被外部认可的证据链。这份答卷回答的问题是:离了你行不行——答案是,行。

第三份答卷写在商业普惠栏。输入 0.8 元、输出 2.8 元、缓存命中 0.23 元的价格表,连同 MIT 协议的开源放行,把前沿智能的门槛从采购科目降成了报销科目。对千行百业而言,这不是一个降价新闻,而是一道分水岭:此前需要为模型成本单独立项的场景,从此可以直接并入日常经营开支。三份答卷合在一起,构成全书试图论证的那句话——当性能不再是唯一标尺,效率成为新护城河。

二、全球格局的再评估:领先者的定义权正在易手

「美国领先是否正在被蚕食」——这个问题值得一克制的回答,而不宜有一句廉价的欢呼。

诚实的清单应当先摆出来。HLE 带工具的成绩单上,GLM-5.3-Flash 的 55.3 分仍明显落后于自家纯文本旗舰 GLM-5.3 的 62.5 分;社区实测普遍反映其生成速度慢于旗舰水准,长程 agent 任务常常半小时起步、一小时也不罕见;KV 缓存体积仍略大于 Kimi K3 与 DeepSeek V4 Flash,官方坦承这是后续优化的方向;至于学术原创性,圈内评价向来直率——线性注意力脱胎于 Mamba 时代的思路,稀疏注意力有 DeepSeek NSA 与 DSA 论文的先发身影,mHC 可追溯至字节 Hyper-Connections 的改进,IndexPool 则更像一处工程巧劲——没有一项属于从零到一的发明,甚至没有配套的 arXiv 论文,只有一篇技术博客。这份清单提醒我们,任何把它捧成全能冠军的说法都经不起推敲。

然而弱项清单丝毫无损另一件事实的分量:战场定义权正在易手。过去十年,竞赛的评价体系默认立在高性能这一维——更大的集群、更新的芯片、更高的分数。GLM-5.3-Flash 的做法不是在那杆秤上再添几两砝码,而是直接把秤搬到另一张桌子上:单位智能的成本。当追赶者开始在对手熟悉的主场上追赶,而创新者已在陌生客场开辟战线,胜负的天平就有了第二种倾斜的方式。值得注意的是,美国一侧同样嗅到了风向:OpenAI 在 Hot Chips 公示的自研推理芯片 Jalapeño,运行多个主流开源模型的每瓦吞吐达到英伟达 GB200 与 GB300 的约 1.5 至 1.9 倍——只是这条路线上目前看得见的实战级闭环,暂时打在上海的这台机器上。所谓格局再评估,结论并非「此消彼长」四个字那么轻飘,而是竞争的维度数增加了:谁能同时在「更聪明」与「更便宜地聪明」两条轴上交卷,谁才有资格谈论领先。

三、匿名模式的遗产:发布范式的岔路口

匿名测试大概率会成为本次事件最持久的副产品之一。它的方法论已经被写得明明白白,简单到近乎诱人:先匿名上线,用盲测剥掉品牌滤镜;再敞开免费用,让真实负载充当验收员;最后择日揭晓,把积累的口碑一次性兑换成性价比的铁证。今年春节的 Pony Alpha 是这套打法的小规模试点,八月的 Ox-Alpha 则是满编制实战,两次都赢了。可以预期,会有相当数量的团队在下一个发布周期里照方抓药。

但也正是这种「照方抓药」的前景,构成了遗产的另一面。悬念是一种会被耗散的资源:奇袭第一次是奇袭,第十次就成了流程。当《有头有脸的大模型公司,集体搞起「匿名公测」》成为栏目化标题,用户的新鲜感阈值会不断抬高,盲测的红利随之稀释——届时不排除部分玩家反向操作,以绝对的透明(实时成本公开、全量日志开放)作为新的差异化卖点。平台一侧同样会出现适应性进化:隐身模型专区和盲测机制可能被制度化,甚至演化出独立的匿名榜单生态。还有一个更冷僻、却迟早要来的议题:匿名期间,用户实际上在与一个「不知责任主体」的系统交互,误导与依赖的风险由谁承担?「认领之后溯及既往」的责任边界在哪里?这些缝隙尚无共识,行业大概率要在未来一两年的某次争议中被倒逼出一部迟到的潜规则。总之,遗产已经入库,利息怎么算,要看下一个敢于沉默的人是谁。

四、效率竞赛里的人:这件事与创业者何干

宏大叙事听得再多,最终都要落到具体的人身上。对创业者而言,效率竞赛改变的不是省多少钱,而是决策公式的分子分母。此前的账本是「要不要为最聪明的模型付这笔钱」,决策天然保守;现在的账本是「敢不敢围绕便宜的智能重新设计业务流程」,决策一下子激进起来。本书第八章推演过两组小案例:一间灯具厂仓库用多模态识别把两个人一天的盘点压缩进半小时;一位跨境电商的朋友把原本因 API 账单而搁浅的自动化清单重新捡了起来。这类故事的价值不在金额本身,而在它们第一次让「每个环节都问一遍能不能交给模型」成为普通公司负担得起的习惯——试错次数增加了,创新的概率自然变化。这也是普惠的本义:不是所有人都用上最强的模型,而是所有人都用得起足够的模型。

对普通用户而言,token 单价本来就感知不到,能感知的是另一些细碎的东西:应用的会员权益变厚了,视频理解的免费额度变多了,某些工具从「偶尔用用」变成「随时都在」。效率的感知从来不诞生于 FP16 的算力报表,它诞生于每一次等待、每一次卡顿、每一次「算了我不查了」的妥协时刻——这句话,笔者在后记里还会再讲一遍。当然,硬币的反面也必须写下:低价同时降低了滥用的门槛,质量波动与商业可持续性的问号并未消除,普惠并不等于免责。

五、下一个临界点:当推理成本再降一个数量级

按近两年行业内公认的成本曲线外推,推理价格每隔一段时间就会向下蹿一大截,而 GLM-5.3-Flash 只是把下一次下蹿提前兑现了。合理的追问是:再降一个数量级之后,世界会是什么样?

几个变化几乎是顺理成章的。其一,智能体将从「呼之即来」走向「常驻不离」:当每一次调用便宜到可以忽略,让 agent 整夜整夜挂在后台排队跑任务的记账逻辑不再心疼,长程协作类应用的形态会被重新发明。其二,视频与语音的原生应用获得商业公式:以帧计费的生意终于跑得通了,多模态能力从展示柜走向流水线。其三,个体专属模型浮出水面:为一个用户、一家小店微调维护一个专属副本,成本摊薄到可以纳入订阅费,「千人千模」从演讲词汇变成菜单选项。其四,也是最具想象力的一项:业界流传已久的「模型免费、生态收费」设想,将第一次拥有现实的讨论土壤——价格趋零之后,价值必然向上迁移,迁到哪里,谁也说不好。

但必须同时写下冷的一面。价格战的尾声未必全是繁荣,也可能是一场出清:行业对「六小虎分化」「基模收敛」的预言已经悬挂许久,若亏本换来的市场份额迟迟换不成毛利,今天的屠夫就可能成为明天的并购标的。说到底,下一个临界点的意义不在价格本身,而在于它把一个悬而未决的问题放大到无法回避:当智能便宜如水电,谁来为电网挣钱?

六、未尽议题:留给下一本书的债

本书收笔之时,仍有相当一批问题悬而未决,这里如实列出,也算是对未来的交代。其一,十万张国产芯片的供应商构成与真实采购成本,目前仅有供应链侧的传闻口径,官方始终未予置评;其二,0.8 元的定价究竟是长期策略还是阶段攻势,毛利率层面的证据并未公开,限时折扣结束后的留存曲线将是最直观的判卷人;其三,混合注意力这套工程组合的学术归宿仍是悬案——技术博客之外,那篇迟到的研究论文是否会来、以何种姿态来,决定了历史如何评价这次「集大成」;其四,Scaling Law 的后半场:通用能力的下一个主要台阶究竟来自规模、数据还是架构,业内并无共识;其五,各监管辖区对「先匿名后认领」这种发布方式的回应,可能在某个节点突然变得重要;其六,竞品侧的动态仍有诸多传闻属性——据报道 Kimi K3 输出价格涨至一百元档的消息未经官方确认,DeepSeek V4 Flash 提价后调用量下滑一半的说法也只见于媒体口径,至于其他玩家是否跟进降价的假设情景,更是无从坐实。这些问题中任何一个有了新进展,都值得被下一本书记录。与其假装全知,不如诚实列单。

七、终章·后记

书写完了。但我曾在最后一章卡了整整四天。

反复纠缠我的问题是:我到底在写一本什么样的书?是国产模型的成功学样本,还是一次效率竞赛的观察笔记?如果是前者,我该把每一处不确定都打磨成笃定的结论;如果是后者,我就得承认——很多事直到今天我也没有完全想明白。

最痛苦的一个取舍发生在第三章。Ox-Alpha 五天五十万亿 token、单日 62T,这些数字我核实了不下十遍,可写到独立研究员锁定智谱那一段时,我犹豫了很久:分词器探针的细节到底要不要展开?写深了,读者未必有耐心;一笔带过,「隐身模型被揪出来」的过程就成了黑箱。最终我选择了简化,并把那份愧疚留给这本附录里的时间线表格。直到今天我仍不确定这样做对不对——也许当年该把整套探针逻辑原封不动附上去,哪怕只有三个读者会去看。

最意外的收获,藏在第一章与第五章之间的那道裂缝里。梳理 2025 年春天的价格战与后来的连续涨价时,我发现了一个自己解释不了的时间差——降价与涨价,在智谱内部是两套截然不同的决策模型在驱动,还是同一套算账逻辑在不同市场阶段的自然演绎?我问了三个业内的朋友,得到三个不同的答案。没有人真正知道。后来我不再纠结,因为我意识到真正值得记录的从来不是定价公式,而是一个更朴素的事实:当 Kimi 把输出价格据报道拉到一百元档、DeepSeek V4 Flash 提价后调用量腰斩,智谱选择在这一款 Flash 上把价格摁到 0.8 元——这个决策的勇气不在低价,而在时机。它赌的是开发者对效率的敏感,已经积攒到了一个临界点。

这个临界点,我自己身上验证过。写书的间隙,我常用自己开发的 Markdown 编辑器雨轩。某天凌晨开了十几个标签页查资料,本地预览卡顿了半秒。我没有怪编辑器,反倒在心里嘀咕了一句:这个模型太重了。那一瞬间我忽然明白,用户对效率的感知,从来不来自任何一份算力报告,而来自每一次等待、每一次卡顿、每一次「算了,不查了」的妥协。GLM-5.3-Flash 名字里的那个 Flash,击中的恰恰就是这个妥协时刻。

书稿合上之际,我对「效率竞赛」的看法仍在变化,甚至说不准五年后,这本书里的判断还剩下几条站得住脚。唯一确定的是,那个凌晨在 OpenRouter 上以 Ox-Alpha 之名匿名现身的模型,确实让我重新想清楚了一个很朴素的问题——当性能的差距缩小到常人无法感知的程度,效率就是唯一的差异。这句话没有颠覆什么,它只是被人忽略了太久。

苑广山
2026 年 8 月 27 日
于上海

附录 数据速查集

说明:本附录数据均来自正文各章所引多源交叉核实材料(腾讯新闻、36氪、IT之家、稀土掘金、雪球、V2EX、《晚点 LatePost》、SemiAnalysis 等),统计与叙述截止于 2026 年 8 月 27 日;凡未获官方确认或存疑之处,均在备注栏以限定词标明。

附录A GLM-5.3-Flash 技术参数速查表

项目 参数与事实 备注
总参数 320B MoE 混合专家架构
激活参数 18B 对照 GLM-4.5 为 355B-A32B
层数 45 层 GLM-4.5 为 92 层,深度近乎减半
预训练语料 30T token 多模态语料 原生多模态方案,非后期拼接视觉编码器
注意力计算量 较 GLM-5.3 降低约 3.01 倍 得益于混合注意力设计
KV 缓存 较 GLM-5.3 降低约 4.44 倍 仍略大于 Kimi K3 与 DeepSeek V4 Flash,官方列为后续优化方向
端到端服务性能 较初始基线提升 3 倍 智谱自研推理引擎与 EPD 分离式部署架构之功
量化权重 FP8 权重约 306 GiB 供本地与私有化部署参考
推理框架支持 SGLang、vLLM、TokenSpeed 开源社区主流部署路线均可适配
开源协议 MIT 8 月 26 日晚官宣开源并登陆 HuggingFace
综合评测 Artificial Analysis Intelligence Index 57 分 与 Claude Opus 4.8 持平,超过 GLM-5.2 与 DeepSeek V4 Pro 正式版的 53 分
正式定价 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元(每百万 token) 限时折扣期约再半价;详见附录D
推理承载 10 万张以上国产芯片集群 据《晚点 LatePost》报道,供应商传为华为昇腾、摩尔线程、海光,智谱未予置评
关键节点 8 月 20 日匿名上线,8 月 26 日晚官宣认领并开源 同月 14 日智谱曾发布纯文本旗舰 GLM-5.3

附录B Ox-Alpha 匿名测试完整时间线

时间(2026 年) 事件 关键数据与备注
8 月 6 日 DeepSeek 宣布 API 提价,为本次事件的市场背景之一 本书第一章口径,提价后据媒体报道调用量下滑约一半
8 月 14 日 智谱发布纯文本旗舰 GLM-5.3 并开源 744B-A40B,宣传语「Scaling post-training is all we did」
8 月 15 日 DeepSeek 新价正式落地,中端价位带出现真空 本书第一章口径
8 月 20 日深夜 隐身模型 stealth/ox-alpha 上线 OpenRouter 无品牌、无文档、免费开放;上线首日登顶使用量榜首
8 月 21 日 OpenRouter 单日 token 纪录被刷新 新纪录较历史峰值高出约 4 倍
此后数日 登陆 OpenCode 编程评测榜,终结 DeepSeek 连续 56 天霸榜;韩国《朝鲜日报》、越南 Vietnam.vn 等外媒跟进「疑似中国制造」;中文社区命名「牛来」「牛模王」,海外社区称 Bull King 使用量高峰时达 DeepSeek 两倍以上
匿名期内(合计约五天) 流量洪峰 累计超 50 万亿 token,单日峰值约 62T
8 月 24 日前后 独立研究员发布分词器指纹与探针测试报告 称「99% 把握」指向智谱;同期预测市场超九成押注智谱;另有观点据分词器特征推测出自微软 MAI 系列
8 月 26 日晚 智谱向彭博社确认认领,同步宣布开源(MIT 协议)、上架 HuggingFace、公布架构与定价 代号 Ox 取意热映电影《牛来》;社区戏称当晚为「揭盅之夜」
8 月 27 日 资本市场反应兑现 港股智谱跳空高开逾 8%,盘中一度涨超 10%;上证科创板芯片设计指数收涨 5.57%

附录C 性能对比表(GLM-5.3-Flash 及主要对照模型)

评测基准 GLM-5.3-Flash Claude Opus 4.8 Kimi K3 GLM-5.3(家族旗舰) GLM-5.2(上代旗舰) DeepSeek V4 Pro
综合指数 AAII 57 57 另一产品线,评分更高 53 53
Terminal Bench 2.1 84.3 约 85.0 88.3 88.2
DeepSWE v1.1 63.4 59.3(V4 Vision 实验版)
HLE(带工具) 55.3 62.5
Toolathlon 78.4 76.5 73.0
AutomationBench 48.8 38.8
OfficeQA Pro 62.4 48.9
BabyVision(多模态) 53.4 35.1

读表提示:①「—」表示公开材料未见可靠对照值,不代表模型不支持该项评测;②AutomationBench、OfficeQA Pro 与 BabyVision 三项集中体现了 Flash 版在办公自动化与多模态理解上对 DeepSeek V4 Pro 的压制;③Toolathlon 上 Flash 反超自家旗舰 GLM-5.3 与 Kimi K3,是其 agent 执行力的亮点;④综合指数持平 Opus 4.8 而价格为其约四十分之一,是全书「效率成为新护城河」命题的数据支点。

附录D API 定价横向对比表(每百万 token)

产品 输入价格 输出价格 缓存命中 备注
GLM-5.3-Flash 0.8 元 2.8 元 0.23 元 限时折扣期约再半价,即约合 GLM-5.3 的二十分之一;MIT 协议开源
GLM-5.3(家族旗舰) 8 元 28 元 744B-A40B 纯文本,同为本书主角价格的锚点
Qwen3.8-Flash-Next 1 元 3 元 阿里 125B 参数 MoE,8 月 26 日同夜开源对标之作(IT之家报道口径)
Kimi K3 100 元 据报道,输出价格涨至百元档,未经官方确认
DeepSeek V4 Flash 8 月 6 日宣布提价;据媒体报道,提价后调用量下滑约一半,最新牌价未见权威披露
Claude Opus 4.8 5 美元 25 美元 美元口径;综合比较口径下约为 GLM-5.3-Flash 定价的四十倍

注:①限时折扣的具体截止日期以智谱开放平台公告为准,本书不代为推断;②表中人民币价为官方挂牌价,折扣叠加后的实际成交价随账期浮动;③「四十倍」为综合单价折算的行业通行说法,非逐项精确比值。

附录E 术语解释

术语 解释
MoE(混合专家) Sparse Mixture of Experts 的简称:总参数量大、每次推理仅激活其中一小部分的稀疏架构。本书主角为 320B 总参、18B 激活,兼顾容量与成本
原生多模态 预训练阶段即把图文等多模态语料熔为一体(30T token 多模态语料),区别于在纯文本模型上后期缝接视觉编码器的「拼接式」方案
混合注意力 线性注意力负责以递归状态捕获局部依赖、稀疏注意力由索引器召回全局上下文的双轨设计;配套 mHC 与 IndexPool 两项组件
线性注意力 将注意力计算从序列长度的平方复杂度降为近似线性的技术路线,源头可追溯至 Mamba 所代表的状态空间模型思路
稀疏注意力 仅对检索召回的关键上下文做精细计算的技术路线,DeepSeek 的 NSA、DSA 论文为先发代表
mHC(流形约束超连接) 对字节跳动 Hyper-Connections 方案的改进型连接机制,用于调控残差通路上的信息流
IndexPool 将四个索引向量加权池化为一个表示的工程组件,服务于稀疏检索的稳定性
KV 缓存 推理时缓存的键值向量集合,其体积直接决定显存占用与并发上限;Flash 版将其较 GLM-5.3 缩减约 4.44 倍
EPD 分离式架构 智谱自研推理引擎采用的部署架构,将编码、调度与服务解耦编排,端到端性能较初始基线提升 3 倍
FP8 八比特浮点量化格式,显著压缩模型权重体积;Flash 版 FP8 权重约 306 GiB
SGLang、vLLM、TokenSpeed 主流开源推理服务框架,用于把模型权重高效包装成并发 API 服务,均已适配 Flash 版
隐身模型 Stealh Model:不以真实身份上架、仅供盲测调用的发布形态,本书中指 8 月 20 日上线的 Ox-Alpha
斩杀线 一个新模型把价格压至使前代竞品瞬间失去性价比的临界价位;0.8 元被广泛视为本轮牌局的斩杀线
AAII Artificial Analysis Intelligence Index,第三方综合智能评测指数,满分百,本书以 57 分作核心参照
Token 经济学 以词元为单位计量模型服务的成本、定价与收入的经济学视角;国家数据局专家解读亦以「词元」为智能经济的度量引擎
MIT 协议 允许几乎不受限制地商用、修改、再分发的开源许可,Flash 版权重据此开源

附录F 延伸阅读索引

以下为本书写作过程中参考的核心报道与一手材料(按主题聚类,标题以刊发方原始表述为准):

  1. 《猜了六天的「牛来」是智谱的:匿名登顶 OpenRouter,今晚开源权重》——腾讯新闻
  2. 《智谱认领「牛来」模型,实测:「牛马」友好》——36氪·AI前线
  3. 《终结 DeepSeek 霸榜,神秘「牛来大模型」火了》——上海证券报·中国证券网
  4. 《智谱认领神秘 AI 模型 Ox Alpha「牛来」,使用量已达 DeepSeek 两倍以上》——华尔街见闻
  5. 《智谱新模型「牛来」跑在 10 万国产卡上,SemiAnalysis 评价「英伟达护城河再受考验」》——网易科技转发
  6. 《连夜实测智谱 GLM-5.3-Flash:剪视频、复刻〈深海迷航〉,价格降低 97.5%》——智东西
  7. 《GLM-5.3-Flash: Frontier Intelligence, Flash Cost》——Z.ai 官方技术博客(2026 年 8 月)
  8. 《阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9》——IT之家
  9. 《千问智谱连夜开源,都比 DeepSeek 便宜,国产大模型价格猛卷》——智东西
  10. 《DeepSeek 提价九天后,智谱用十分之一的价格杀进来》——蓝鲸财经
  11. 《Anonymous AI Ox Alpha Suspected Chinese-Made》——《朝鲜日报》英文版(Chosun Daily),2026 年 8 月 23 日
  12. 神秘模型 Ox Alpha 终结 DeepSeek 在 OpenCode 的连胜纪录——外媒综合报道

补充说明:以上条目与正文各章章末「本章参考资料」同源,题名均按刊发方原始口径转写。读者若需追踪附录F与附录B所述事项的后续进展,建议以智谱开放平台公告、HuggingFace 模型主页与 OpenRouter 排行榜为三处一级信源。