当Flash干掉Pro:DeepSeek V4.1 Flash的技术革命与行业信号
2026年9月10日,DeepSeek正式发布V4.1 Flash模型。这本该是一次常规的版本迭代,却因为一个前所未有的决定,成为了整个AI行业的标志性事件:DeepSeek官方宣布,将旗舰模型V4 Pro的全部请求路由到V4.1 Flash,并按Flash的价格计费[5][7]。
这不是“旧旗舰退役、新旗舰接班”——接班的不是新的Pro,而是低一档的走量款。在大模型行业里,这几乎是头一回:厂商亲手把旗舰的线上流量,交给小弟[6]。用大白话说,官方承认V4 Pro练砸了[6]。
但这次真正值得关注的,不是Pro用户被“降级”,而是DeepSeek用一次再粗暴不过的操作,公开了一个行业信号:模型能力的天平,正在从“参数更大”转向“架构更新、训练更干净”[6]。
一、V4.1 Flash到底做了什么?
V4.1 Flash是一个552B参数的MoE模型,采用全新的Causal-Encoder-Decoder(因果编码器-解码器)架构[4]。它的核心创新在于输入和输出的非对称设计:输入阶段激活参数只有8B,输出阶段激活参数为16B[5][15]。
这意味着什么?模型拥有552B参数带来的能力上限,但实际推理时只需要调用一小部分计算资源。就像一座巨大的图书馆,你进去查资料时,并不需要把所有书都搬出来,只需要找到最相关的那几本。
但真正让V4.1 Flash“干掉”Pro的,是它在KV Cache上的革命性优化。
二、KV Cache:从437倍到1/8
如果你不熟悉技术细节,可以把KV Cache简单理解为模型保存历史上下文的缓存机制[15]。当模型处理长文档、多轮对话或Agent任务时,它需要记住之前说了什么,才能保持连贯性。
问题在于,随着上下文越来越长,KV Cache会急剧膨胀。在Agent使用场景中,缓存命中的费用往往占比较高,成为比模型参数本身更突出的成本瓶颈[1][4]。
DeepSeek这次对KV Cache的压缩,可以用“暴力”来形容[8][12]:
-
与V4 Flash相比:对HBM的需求减少到1/4,对SSD的需求减少到1/8[1][12]
-
与初代DeepSeek V1相比:KV Cache规模已经缩小约437倍[2][15]
这项优化的直接效果是:把上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长[8]。
也就是说,你可以给模型输入一部百万字的小说,它的处理成本几乎和输入几千字差不多。这对需要长上下文、多轮调用的Agent工作流来说,意味着同样的预算能跑更多的任务。
三、性能全面超越:从榜单到实测
根据官方公布的Benchmark数据,V4.1 Flash在多项测试中超越了V4 Pro,以及GPT-5.6 Sol、Claude Opus 5、GLM 5.3和Kimi K3等一众旗舰模型[2][5]:
| 测试项目 | V4.1 Flash | V4 Pro | GPT-5.6 Sol | Claude Opus 5 |
|---------|-----------|--------|-------------|---------------|
| DeepSWE v1.1 | 74.2 | 62.7 | 73.0 | 74.0 |
| Terminal-Bench 3.0 | 30.0 | 11.8 | 34.4 | 43.3 |
| Automation-Bench | 54.8 | 43.2 | 45.8 | 50.3 |
| Agents‘ Last Exam | 31.8 | 25.7 | - | - |
在DeepSWE v1.1上,V4.1 Flash的74.2分已经接近GPT-6 Astra和Claude Opus 5的74分,说明这个benchmark已经接近饱和[2]。
但榜单之外,更值得关注的是实测体验。多位内测用户反馈,V4.1 Flash的速度达到300-400 tokens/s,相比V4 Flash的100-160 tokens/s提升明显[14]。在Agent场景下,这意味着整个任务的墙上时间大幅缩短——因为Agent是“思考→调工具→看结果→再思考”的多轮循环,每一轮的速度提升都会累积[2]。
四、价格策略:降价的背后
与性能提升同步的是价格下调。新定价于9月10日12:00生效[7][11]:
-
空闲时段:输入缓存命中0.02元/百万token,未命中1元,输出4元
-
高峰时段:价格为空闲时段的2倍
相比V4 Flash,缓存命中输入的价格降幅达到60%,缓存未命中输入降幅约33%[11]。这个定价策略的背后,是DeepSeek对Agent场景的精准判断:在Agent工作流中,缓存命中的费用往往占比较高,对KV Cache的压缩直接转化为用户账单的降低[1]。
五、行业信号:架构为王
V4.1 Flash的发布,传递了一个清晰的行业信号:模型能力的竞争,正在从“堆参数”转向“改架构”。
过去几年,大模型的军备竞赛主要围绕参数规模展开。更大的模型意味着更强的能力,但也意味着更高的推理成本。V4.1 Flash证明了一件事:通过架构创新,小模型可以超越大模型,同时成本更低[6]。
这背后的逻辑是:当模型进入长上下文时代,Agent任务成为主流,推理成本的结构正在发生变化。过去,模型参数是成本的主要来源;现在,KV Cache的存储和传输、长上下文的Prefill计算,开始成为更突出的瓶颈[4]。
DeepSeek的CED架构和CSA2机制,正是针对这些新瓶颈的解决方案。通过跨层复用KV Cache、分层稀疏索引器等技术,V4.1 Flash在保持能力的同时,大幅降低了长上下文的处理成本[4][15]。
六、对开发者的影响
对于像你我这样的开发者,V4.1 Flash的发布意味着几个实际变化:
第一,Agent工作流的成本结构改变。 缓存命中价格降到0.02元/百万token,意味着多轮对话、长文档处理、代码库分析等场景的成本大幅下降。同样的预算,可以跑更多的任务。
第二,模型选择的逻辑改变。 过去,开发者需要在“能力”和“成本”之间权衡:用Pro获得更强能力,用Flash控制成本。现在,Flash已经全面超越Pro,选择变得简单了[3]。
第三,Harness的重要性凸显。 DeepSeek同时发布了Harness v0.1.5版本,与V4.1 Flash训练深度结合[2]。这意味着模型的能力不仅取决于参数,还取决于如何被使用。好的Harness可以让模型发挥出更强的能力,差的Harness则可能让模型“走偏”[6]。
七、结语:Flash时代的开始
V4.1 Flash的发布,标志着一个转折点的到来。“Flash”不再意味着“便宜版”,而是可以成为主力旗舰[2]。
DeepSeek用一次激进的操作,公开了一个事实:在大模型行业,架构创新正在取代参数规模,成为能力提升的主要驱动力。这对于整个行业来说,是一个积极的信号——它意味着AI能力的提升不再必然伴随着成本的飙升,开发者可以用更低的成本,获得更强的能力。
对于Agent开发者来说,这是一个值得兴奋的时刻。当推理成本不再是瓶颈,当长上下文处理变得廉价,更多的可能性将被打开。正如DeepSeek官方所说,新架构的设计初衷是“能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型”[1][5]。
V4.1 Pro已经在路上。而V4.1 Flash,只是这个新系列的开始。