兰 亭 墨 苑
期货 · 量化 · AI · 终身学习
首页
归档
编辑文章
标题 *
URL 别名 *
内容 *
(支持 Markdown 格式)
# 当Flash干掉Pro:DeepSeek V4.1 Flash的技术革命与行业信号 2026年9月10日,DeepSeek正式发布V4.1 Flash模型。这本该是一次常规的版本迭代,却因为一个前所未有的决定,成为了整个AI行业的标志性事件:**DeepSeek官方宣布,将旗舰模型V4 Pro的全部请求路由到V4.1 Flash,并按Flash的价格计费**[5][7]。 这不是“旧旗舰退役、新旗舰接班”——接班的不是新的Pro,而是低一档的走量款。在大模型行业里,这几乎是头一回:厂商亲手把旗舰的线上流量,交给小弟[6]。用大白话说,官方承认V4 Pro练砸了[6]。 但这次真正值得关注的,不是Pro用户被“降级”,而是DeepSeek用一次再粗暴不过的操作,公开了一个行业信号:**模型能力的天平,正在从“参数更大”转向“架构更新、训练更干净”**[6]。 ## 一、V4.1 Flash到底做了什么? V4.1 Flash是一个552B参数的MoE模型,采用全新的**Causal-Encoder-Decoder(因果编码器-解码器)架构**[4]。它的核心创新在于**输入和输出的非对称设计**:输入阶段激活参数只有8B,输出阶段激活参数为16B[5][15]。 这意味着什么?模型拥有552B参数带来的能力上限,但实际推理时只需要调用一小部分计算资源。就像一座巨大的图书馆,你进去查资料时,并不需要把所有书都搬出来,只需要找到最相关的那几本。 但真正让V4.1 Flash“干掉”Pro的,是它在**KV Cache上的革命性优化**。 ## 二、KV Cache:从437倍到1/8 如果你不熟悉技术细节,可以把KV Cache简单理解为**模型保存历史上下文的缓存机制**[15]。当模型处理长文档、多轮对话或Agent任务时,它需要记住之前说了什么,才能保持连贯性。 问题在于,随着上下文越来越长,KV Cache会急剧膨胀。在Agent使用场景中,缓存命中的费用往往占比较高,成为比模型参数本身更突出的成本瓶颈[1][4]。 DeepSeek这次对KV Cache的压缩,可以用“暴力”来形容[8][12]: - **与V4 Flash相比**:对HBM的需求减少到1/4,对SSD的需求减少到1/8[1][12] - **与初代DeepSeek V1相比**:KV Cache规模已经缩小约437倍[2][15] 这项优化的直接效果是:**把上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长**[8]。 也就是说,你可以给模型输入一部百万字的小说,它的处理成本几乎和输入几千字差不多。这对需要长上下文、多轮调用的Agent工作流来说,意味着同样的预算能跑更多的任务。 ## 三、性能全面超越:从榜单到实测 根据官方公布的Benchmark数据,V4.1 Flash在多项测试中超越了V4 Pro,以及GPT-5.6 Sol、Claude Opus 5、GLM 5.3和Kimi K3等一众旗舰模型[2][5]: | 测试项目 | V4.1 Flash | V4 Pro | GPT-5.6 Sol | Claude Opus 5 | |---------|-----------|--------|-------------|---------------| | DeepSWE v1.1 | 74.2 | 62.7 | 73.0 | 74.0 | | Terminal-Bench 3.0 | 30.0 | 11.8 | 34.4 | 43.3 | | Automation-Bench | 54.8 | 43.2 | 45.8 | 50.3 | | Agents‘ Last Exam | 31.8 | 25.7 | - | - | 在DeepSWE v1.1上,V4.1 Flash的74.2分已经接近GPT-6 Astra和Claude Opus 5的74分,说明这个benchmark已经接近饱和[2]。 但榜单之外,更值得关注的是**实测体验**。多位内测用户反馈,V4.1 Flash的速度达到300-400 tokens/s,相比V4 Flash的100-160 tokens/s提升明显[14]。在Agent场景下,这意味着整个任务的墙上时间大幅缩短——因为Agent是“思考→调工具→看结果→再思考”的多轮循环,每一轮的速度提升都会累积[2]。 ## 四、价格策略:降价的背后 与性能提升同步的是价格下调。新定价于9月10日12:00生效[7][11]: - **空闲时段**:输入缓存命中0.02元/百万token,未命中1元,输出4元 - **高峰时段**:价格为空闲时段的2倍 相比V4 Flash,缓存命中输入的价格降幅达到60%,缓存未命中输入降幅约33%[11]。这个定价策略的背后,是DeepSeek对Agent场景的精准判断:在Agent工作流中,缓存命中的费用往往占比较高,对KV Cache的压缩直接转化为用户账单的降低[1]。 ## 五、行业信号:架构为王 V4.1 Flash的发布,传递了一个清晰的行业信号:**模型能力的竞争,正在从“堆参数”转向“改架构”**。 过去几年,大模型的军备竞赛主要围绕参数规模展开。更大的模型意味着更强的能力,但也意味着更高的推理成本。V4.1 Flash证明了一件事:通过架构创新,小模型可以超越大模型,同时成本更低[6]。 这背后的逻辑是:当模型进入长上下文时代,Agent任务成为主流,**推理成本的结构正在发生变化**。过去,模型参数是成本的主要来源;现在,KV Cache的存储和传输、长上下文的Prefill计算,开始成为更突出的瓶颈[4]。 DeepSeek的CED架构和CSA2机制,正是针对这些新瓶颈的解决方案。通过跨层复用KV Cache、分层稀疏索引器等技术,V4.1 Flash在保持能力的同时,大幅降低了长上下文的处理成本[4][15]。 ## 六、对开发者的影响 对于像你我这样的开发者,V4.1 Flash的发布意味着几个实际变化: **第一,Agent工作流的成本结构改变。** 缓存命中价格降到0.02元/百万token,意味着多轮对话、长文档处理、代码库分析等场景的成本大幅下降。同样的预算,可以跑更多的任务。 **第二,模型选择的逻辑改变。** 过去,开发者需要在“能力”和“成本”之间权衡:用Pro获得更强能力,用Flash控制成本。现在,Flash已经全面超越Pro,选择变得简单了[3]。 **第三,Harness的重要性凸显。** DeepSeek同时发布了Harness v0.1.5版本,与V4.1 Flash训练深度结合[2]。这意味着模型的能力不仅取决于参数,还取决于如何被使用。好的Harness可以让模型发挥出更强的能力,差的Harness则可能让模型“走偏”[6]。 ## 七、结语:Flash时代的开始 V4.1 Flash的发布,标志着一个转折点的到来。**“Flash”不再意味着“便宜版”,而是可以成为主力旗舰**[2]。 DeepSeek用一次激进的操作,公开了一个事实:在大模型行业,**架构创新正在取代参数规模,成为能力提升的主要驱动力**。这对于整个行业来说,是一个积极的信号——它意味着AI能力的提升不再必然伴随着成本的飙升,开发者可以用更低的成本,获得更强的能力。 对于Agent开发者来说,这是一个值得兴奋的时刻。当推理成本不再是瓶颈,当长上下文处理变得廉价,更多的可能性将被打开。正如DeepSeek官方所说,新架构的设计初衷是“能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型”[1][5]。 V4.1 Pro已经在路上。而V4.1 Flash,只是这个新系列的开始。 --- 1. [DeepSeek,新模型发布](https://news.dayoo.com/finance/202609/10/171077_55002089.htm) 2. [如何评价正式发布的 DeepSeek V4.1 Flash?](https://www.zhihu.com/question/2081380378493961583) 3. [DeepSeek:将于明日发布 V4.1 Flash 模型,各项指标全面超越 V4 Pro- DoNews](https://www.donews.com/news/detail/1/6703301.html) 4. [参数几乎翻倍,推理反而更省:DeepSeek V4.1-Flash 重构 KV Cache_AI&大模型_褚杏娟_InfoQ精选文章](https://www.infoq.cn/news/sbaJrAa8VTIRKIPCpKlo) 5. [DeepSeek V4.1 Flash 模型正式发布:全面超越 V4 Pro、原生多模态视觉理解,API 定价下调](https://m.ithome.com/html/1000719.htm) 6. [DeepSeek 官宣:V4 Pro 请求改路由到 V4.1 Flash](https://zhuanlan.zhihu.com/p/2081125943402313311) 7. [DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线](https://www.ithome.com/1/000/692.htm) 8. [刚刚,DeepSeek新模型上线,长文本缓存硬盘占用暴降88%-36氪](https://36kr.com/p/3977309281825025) 9. [DeepSeek V4.1 Flash模型正式发布](https://news.qq.com/rain/a/20260910A07E4500?adChannelId=hn) 10. [如何评价DeepSeek官方计划用V4.1 Flash取代V4 Pro模型? - 知乎用户 的回答](https://www.zhihu.com/question/2081051140829996148/answer/2081072765566821717) 11. [DeepSeek官宣降价,并计划9月10日前后正式发布V4.1 Flash模型](https://m.pedaily.cn/first/178161.shtml) 12. [刚刚DeepSeek新模型正式上线 长文本缓存硬盘占用暴降88%](https://eu.36kr.com/zh/p/3977309281825025) 13. [DeepSeek V4.1 Flash模型正式发布-36氪](https://36kr.com/newsflashes/3977211138142728) 14. [DeepSeek V4.1 Flash 开始内测,接口 9 月 10 日就到期:这可能是 DeepSeek 今年最值得测的一个模型](https://zhuanlan.zhihu.com/p/2080754134253413173) 15. [刚刚,DeepSeek 发布新模型,Flash 把 Pro 给干掉了](https://www.163.com/dy/article/L6FOI0NU0511CSAO.html?clickfrom=w_dy&referFrom=)
配图 (可多选)
选择新图片文件或拖拽到此处
标签
更新文章
删除文章