兰 亭 墨 苑
期货 · 量化 · AI · 终身学习
首页
归档
编辑文章
标题 *
URL 别名 *
内容 *
(支持 Markdown 格式)
# 《DeepSeek:开源大模型的技术与产业》 > 作者: 雨轩 > 完成时间: 2026-08-10 --- ## 序言 2026 年 8 月,当 DeepSeek V4-Flash 正式版在 OpenCode Go 的统计中占据约 65.07% 的 Token 份额时,许多人把它看作一次新的“国产模型高光时刻”。这个数字当然值得关注,但要理解它,必须先把口径说清楚:这是 OpenCode Go 自有统计中的份额,不是全球模型市场的份额。它真正说明的是另一件事,在一个以 Agent 编码为核心的开发者产品里,一个开源模型可以在短短两周内形成压倒性的真实用量,并把成本、上下文、工具调用和权重开放的优势同时兑现。 这本书想解释的,正是这背后的深层变化。DeepSeek 的意义不是“又有一家中国公司做出了很强的模型”,而是它用一套看似反常规的选择,把大模型研发的成本结构、知识边界和竞争规则同时改写了。它不融资、开源、低价、重用年轻人,也不把 AGI 当作营销词,而是把“让智能更便宜、更开放”当成工程目标。理解 DeepSeek,不能只看发布会的分数,还要看它在量化交易时代留下的组织基因、在 MLA 与 MoE 中的架构取舍、在开源生态中建立的协作方式,以及它在安全、监管和商业可持续性上必须面对的复杂现实。 这本书写给三类读者。第一类是 AI 工程师和研究人员,他们关心 MLA、MoE、FP8、强化学习和推理引擎如何落地,也关心为什么这些技术选择能够改变产业格局。第二类是产品经理、技术管理者和创业者,他们需要判断何时采用开源模型、如何评估成本与合规风险,以及 Agent 应用为什么会突然把 Token 消耗变成新的产品指标。第三类是对 AI 产业有兴趣的普通读者,他们不需要读完论文,也能理解 DeepSeek 从量化交易到通用智能的路线,以及它为何会引发股价波动、监管争议和全球开发者的追逐。 为了让不同背景的读者都能读下去,书中避免堆砌术语。遇到 MLA、MoE、KV Cache、蒸馏和稀疏注意力等概念时,会先给出直觉解释,再进入工程细节;遇到数字时,会尽量说明统计口径、比较对象和适用边界。这样做的目的是让读者既能快速建立全局图景,又能在需要时把某一章当作技术资料反复查阅。 全书只有三章,每章约一万字。第一章从梁文锋的成长经历和幻方量化的算力积累写起,解释一家量化机构如何把算法、工程、组织和资金资源转向 AGI 目标。第二章进入技术核心,拆解 KV Cache 瓶颈、多头潜在注意力、稀疏专家、FP8 训练、多 Token 预测和 R1 的强化学习路径,并延伸到 V4 的百万上下文与稀疏注意力。第三章讨论产业冲击,从 R1 时刻、开源推理引擎、企业落地、数据安全与芯片管制,写到 V4-Flash 正式版与 OpenCode 的爆量。三章之间不是简单的“历史、技术、产业”三段式,而是三个相互咬合的视角:为什么这样做,怎么做,以及做完之后世界变成了什么样。 本书不会给读者一个确定的“投资建议”或“胜负预测”。DeepSeek 是否会成为 AGI 时代最重要的公司,取决于尚未发生的技术突破、商业模式调整、监管走向和全球竞争环境。本书能做的,是把已经发生的选择、已经观察到的效果和仍然开放的问题摆在一起,让读者拥有自己的判断基础。 与许多把 DeepSeek 写成“逆袭神话”的叙述不同,这本书尽量保持工程和商业分析的克制。股价大跌、应用登顶、开源狂欢当然要写,但更重要的是它们背后的结构:557.6 万美元的训练成本并不是魔术,而是架构创新、系统优化、数据策略和组织效率共同作用的结果;OpenCode 的 65.07% Token 份额也不是“便宜就能赢”的简单故事,而是开源权重降低迁移成本、百万上下文延长 Agent 会话、缓存命中率压低单位成本之后形成的工程选择。书里既有可核验的数据和公开报道,也保留了没有定论的争议,例如蒸馏是否合理、开源模型如何治理、监管是否会继续收紧。 写作过程中,我特别注意到一个细节:DeepSeek 并没有把推理引擎牢牢攥在自己手里,而是公开组件、与 vLLM 和 SGLang 协作,并承诺在新模型发布前同步推理工程。这个决定在当时显得奇怪,却让整个开源生态围绕一个模型快速迭代。V4 发布后,vLLM、SGLang、TensorRT-LLM、国产算力适配和社区补丁几乎同步出现;OpenCode 随后把 V4-Flash 推上 Token 份额第一。可以说,DeepSeek 的真正产品不是某一个模型,而是模型、工程组件、开源协议和开发者生态共同构成的开放系统。 这本书也尽量诚实面对 DeepSeek 的困难。低成本训练并不等于零成本;开源模型让全球研究者受益,也让恶意使用更难阻止;隐私政策、数据库暴露和各国监管说明,能力增长与安全治理必须同步;芯片管制、自研芯片和巨额融资则提醒读者,技术理想最终要在资本和地缘政治中寻找平衡。书中所有真实人物、企业案例、政策事件和统计数字都尽量来自公开资料,并标注了资料文件与统计口径。尤其需要提醒的是,OpenCode 的数据是第三方平台在特定窗口内的统计,模型版本、价格、套餐计费规则和政策仍在快速变化,最终请以官方最新文件为准。 对读者来说,这本书可以按顺序读,也可以先读自己最关心的章节。如果你想理解 DeepSeek 为什么能存在,先读第一章;如果你想知道低成本背后有哪些技术选择,直接进入第二章;如果你正在评估是否把开源模型引入真实系统,或者想理解 R1 时刻之后全球产业为何发生连锁反应,可以从第三章读起。书中的章节相互独立,但共同指向一个问题:当算法、算力、数据和开放协作都成为可竞争的变量,AI 产业的下一个均衡点在哪里。 书稿中的数据和案例都以写作时点为准。版本号、价格、评测结果、政策状态和第三方平台统计都会随时间变化,尤其是 V4-Flash 正式版和 OpenCode 的使用量数据,几乎是按天更新的。读者如果用于正式决策,请务必核对官方最新文档和数据库,而不是把本书当作固定事实清单。 最后,这本书要感谢所有公开论文、开源项目、技术博客和媒体报道的作者。没有 DeepSeek 公开权重和训练报告,没有 vLLM、SGLang、Open-R1 等社区工作,没有开发者用真实负载检验模型,这本书不可能获得如此丰富的细节。写作中出现的任何理解偏差都属于作者,而真正的答案仍在快速变化的产业实践中。 截至 2026 年 8 月 10 日,DeepSeek V4-Flash 正式版已经上线,OpenCode 也把 Go 套餐中的 V4-Flash 使用量调整为按 2 倍计算。这些事件说明,低价与普惠不可能永远远离商业规则。但至少在这一刻,DeepSeek 已经证明了一件事:AI 竞争不再只是“谁有更多算力”的比赛,而是谁能在架构、工程、开放和可持续之间找到更好的平衡。这本书正是记录这段转变的开始。 如果你只记住一句话,请记住:DeepSeek 最大的遗产,不是某个模型的分数,而是它让“开源、低成本、可复现、可部署”成为全球 AI 竞争中的默认选项。 --- ## 目录 - 序言 - 第1章 从量化交易到通用智能:DeepSeek的诞生与路线选择 - 第2章 架构与工程革命:MLA、MoE与低成本训练 - 第3章 开源、冲击与未来:DeepSeek如何重塑AI产业 --- ## 第1章 从量化交易到通用智能:DeepSeek的诞生与路线选择 # 第 1 章 从量化交易到通用智能:DeepSeek的诞生与路线选择 ## 1.1 一个小镇少年与一台被改装的电吉他 2018 年,一位投资者拜访幻方量化时,见到一位穿深蓝色工装衬衫、捧着保温杯的年轻人。对方说话拘谨,甚至被误当成随行技术助理。他看起来不像是一家大型量化私募的负责人,更像某个实验室里刚刚结束调试的工程师。这个年轻人就是梁文锋,后来 DeepSeek 的创始人。 梁文锋出生于 1985 年,家乡是广东湛江吴川市覃巴镇米历岭村。他的父母都是镇上小学教师,父亲和母亲都教语文。和许多后来进入人工智能领域的人不同,他的成长轨迹里没有太多名校光环之外的传奇包装,更多是一种安静而持续的自学能力。 小学阶段,他先就读于吴川梅菉小学,六年级考进吴川市第一中学。中学时代,他就学完了高中数学,甚至开始自学大学数学。同学和老师对他的印象是文静、专注,但并不是只会死读书的书呆子。2002 年,他以吴川一中高考状元的身份考入浙江大学电子信息工程专业,专业方向是电子工程与人工智能。 进入大学之后,梁文锋依然保留了这种自学习惯。据校友回忆,他大部分课程靠自学完成,大二时就能独立设计电路板,并完成单片机开发。一个经常被引用的细节是,他把一把普通吉他改装成可以连接电脑的电吉他。这个物件本身并不昂贵,但改装过程涉及电路、接口、信号处理和动手调试,恰好浓缩了他后来做技术的方式:先理解底层原理,再自己把系统搭起来。 大三暑假,他参加了全国大学生电子设计竞赛,多数技术方案由他牵头,最终获得全国一等奖。本科毕业后,他继续在浙江大学攻读信息与通信工程专业研究生,方向是机器视觉。2010 年,他完成硕士论文《基于低成本PTZ摄像机的目标跟踪算法研究》,导师是项志宇。这篇论文的题目已经透露了他早期关心的问题:在硬件资源有限的情况下,如何用算法让系统更聪明。 如果只看简历,这只是一个优秀工程师的起点。真正让梁文锋与大多数工程师区分开的,是他随后做出的选择:没有继续读博,没有进入大厂,而是把机器学习用在当时中国还非常早期的量化交易上。 很多关于 DeepSeek 的报道都会强调它的技术奇迹,却容易忽略一个前提:这家公司不是从一间出租屋里白手起家的创业公司,而是从一家已经积累了大量算力、数据和工程经验的量化机构中生长出来的。梁文锋在量化投资里花掉的时间,不只是为了赚钱,更是在验证一个想法:机器能否从海量数据中找到规律,并持续做出比人类更稳定的决策。 这个想法第一次投入实践时,本金只有八万元。那是一个没有现成工具、没有成熟平台、也没有太多成功先例的年代。梁文锋和同学要做的事情,几乎是重新发明一套研究方法。 如果把时间拉回二十年前,中国的本科实验室里还没有今天随处可见的深度学习框架。学生们接触到的更多是单片机、数字信号处理、模式识别和经典统计方法。梁文锋在这样的环境里培养出的能力,并不是调用某个现成模型,而是从电路、数据接口、算法设计到系统集成逐层理解问题。这种训练方式让他对“黑盒”保持警惕:如果一个模型不能解释输入、输出和中间过程,他倾向于把它拆开重做。 改装电吉他的细节之所以值得记住,不是因为它在技术上有多少独创性,而是因为它展示了梁文锋处理未知问题的方式。他先确认吉他的模拟信号如何产生,再设计电路把声音转换成数字信号,最后通过接口让电脑识别和控制。整个过程需要机械、电子、软件三方面配合,缺一个环节都会失败。多年后训练大模型时,他面对的其实是同一类问题:把数据、算法、算力和系统放在一起,让它们稳定协作。 研究生阶段,梁文锋选择机器视觉方向。机器视觉的核心挑战是让机器从像素中识别出对象、运动和场景,这与量化交易中的模式识别有相通之处。他的硕士论文研究的是低成本摄像头下的目标跟踪,重点是如何用有限的硬件条件获得稳定结果。这个题目放在今天的 AI 语境下依然不过时:真实世界的部署往往不是拥有无限算力,而是要在约束下寻找有效解。 ## 1.2 八万元本金:机器学习的第一次实践 2008 年前后,全球金融危机正在蔓延,中国资本市场也在剧烈震荡。正在浙江大学读研究生的梁文锋,与几位同学开始尝试用机器学习分析市场数据。他们最初的启动资金只有约八万元人民币。 这八万元能做什么?放在当时的技术环境里,它甚至买不到一张后来大模型训练中常见的专业显卡。梁文锋和团队不得不从最底层开始解决数据问题。据幻方早期招聘材料和公开报道,他们曾通过破解行情软件接口、手动抓取交易数据的方式建立自己的数据通道。这不是一个干净利落的研究起点,却让他们很早就意识到,数据、计算与策略之间的边界并不清晰。 在那个年代,国内量化行业几乎是一片空白。大多数投资者依赖人工判断、技术分析和基本面研究,机器学习更多停留在学术论文里。梁文锋的团队选择了一条相反的路:先相信统计规律,再让模型在市场数据里寻找可以被重复利用的模式。 他们的方法并不神秘,困难在于执行。数据不完整,接口不稳定,回测工具粗糙,每一环都需要自己动手。梁文锋后来很少详细回忆这段日子,但与他长期合作的浙大同学徐进、郑达韡等人,后来都成为幻方早期班底的一部分。多年之后,有人翻出他们当年的微博,发现几个年轻人会在评论区里互相出题、讨论数学,也讨论毕业后去留。 其中一段被广泛转述的文字提到,2012 年,郑达韡在微博上出了一道关于蚂蚁沿立方体棱爬行的数学题,并艾特了梁文锋和徐进。梁文锋回复说,那道题他和徐进都没有做出来,但答案肯定大于四。后来别人重新计算,答案是十。他当时没有给出证明,只给出了一个方向正确的判断。在这条微博底下,他问了郑达韡一句:“最后是去是留?” 这句话没有上下文,也没有更多解释。很多年后,它被媒体解读成一个年轻团队在人生路口发出的邀请。更客观地说,它显示了一群人对未知问题的共同兴趣:他们愿意花时间讨论一个没有现实用途的数学题,也愿意把这种兴趣投入到一个充满不确定性的行业。 2013 年,梁文锋与大学同学徐进共同创办了杭州雅克比投资管理有限公司,这是幻方的前身。2015 年,杭州幻方科技有限公司正式成立,并拿到私募牌照。也是在这一年,梁文锋开始以机构化方式管理资金。公开资料显示,幻方在 2016 年管理规模约十亿元,2017 年达到三十亿元,2019 年突破百亿元。 快速增长的原因并不只是运气。2016 年 10 月,幻方推出第一个 AI 模型,实现了量化策略的 AI 化转型。2017 年,几乎全部策略改用 AI 模型计算。这家公司比国内同行更早、更坚定地把人工智能放进交易系统的核心。 对梁文锋来说,量化交易并不是终点。它更像一个极其严格的试验场:策略必须被数字验证,模型必须面对真实市场,任何自欺欺人的想法都会被亏损惩罚。正是这种试验场训练出来的工程直觉,让幻方后来敢于把上千张显卡投入大模型训练。 量化交易对数据质量的要求极其苛刻。一条行情记录的时间戳差几毫秒,一个复权因子计算错误,一次撮合规则没有考虑完整,都可能让回测结果与实盘结果完全背离。幻方早期的团队因此花了大量时间建设数据清洗、存储和校验体系。这些工作并不性感,却构成了后来 DeepSeek 数据工程能力的地基。 梁文锋和同学做量化的另一个收获是学会了与不确定性相处。市场永远不会给出标准答案,模型只能在概率意义上作出判断。团队必须设计合理的回测框架,避免过拟合,还要理解什么情况下模型会失效。这种训练让 DeepSeek 后来的研究带有明显的实证风格:不轻信直觉,不追求炫技,而是用实验数据说话。 2015 年拿到私募牌照后,幻方开始从个人研究转向机构化运作。2016 年,公司管理规模约十亿元。2017 年达到三十亿元。2019 年突破百亿元。这个速度在量化行业并不常见,原因之一就是 AI 模型带来的策略容量和执行效率。梁文锋后来很少把这段成绩归功于个人,他更愿意强调团队的持续迭代。 与梁文锋长期合作的徐进、郑达韡等人,构成了幻方最早的班底。他们中的许多人后来也参与 DeepSeek 的早期建设。一个经常被忽视的事实是,DeepSeek 并非从零招聘一批陌生人,而是把一群已经在量化系统中合作多年的人重新组织起来。这种长期默契让公司可以在极小的规模下运行复杂的研发项目。 量化阶段形成的另一项能力是成本意识。交易系统的每一次改进都会直接转化为收益或亏损,团队必须知道每一张显卡、每一度电和每一秒延迟的价值。DeepSeek 后来的训练成本控制,多少可以追溯到这种习惯:不是简单地省钱,而是把资源看作研究的一部分,追求单位投入的产出最大化。 ## 1.3 从萤火一号到万卡集群:算力即研究预算 量化交易给幻方带来了两个 DeepSeek 后来最需要的资产:持续的经营现金流,以及大规模的 GPU 集群。前者解决了生存问题,后者解决了研究问题。 2019 年,幻方在金牛奖颁奖礼上发表了一场后来被频繁提及的演讲,题目是《一名程序员眼里中国量化投资的未来》。那时,梁文锋已经不再只把 AI 当作交易工具。他开始把算力看成一种研究基础设施,而不是某个项目的采购预算。 同一年,幻方投资约两亿元自研“萤火一号”训练平台。平台搭载约 1100 块 GPU,算力在当时被形容为相当于四万台个人电脑。一家量化私募建设这样的平台,在很多人看来是难以理解的:交易系统通常只需要低延迟、高可靠的小型集群,为什么需要如此大的训练算力? 答案在几年后才变得清晰。梁文锋想要的不是更快地执行交易策略,而是训练更大的模型。萤火一号更像是他给团队搭的一座桥,桥的另一端是通用人工智能。 2020 年,“萤火一号”正式投入使用。2021 年,幻方继续投入约十亿元建设“萤火二号”,搭载约一万张英伟达 A100 显卡。按照当时公开报道的口径,中国拥有超过一万张 GPU 的企业不超过五家,其余都是互联网巨头。幻方作为一家量化私募,已经站进了这个极其有限的名单。 梁文锋后来解释这段投入时说,从最早的一张卡,到 2015 年的一百张,再到 2019 年的一千张和 2021 年的一万张,主要是好奇心驱动。这句话听起来轻描淡写,但背后是一次巨大的资源押注。量化行业赚钱并不等于愿意把利润全部投入基础设施,更不等于愿意在没有明确商业回报的情况下建设万卡集群。 万卡集群真正改变的是研究节奏。团队可以同时跑大量实验,可以训练更大模型,也可以快速试错。许多后来 DeepSeek 的工程能力,比如大规模并行训练、模型压缩、低精度计算,都在这个阶段获得了第一手经验。 另一个容易被忽视的积累是组织能力。管理一万张 GPU 不只是采购问题,还涉及调度、监控、故障恢复、网络设计和多团队协作。幻方为此建立了一支同时懂算法、硬件和系统的团队。正是这些人,后来成为 DeepSeek 的班底。 2021 年,幻方管理规模突破一千亿元,进入国内量化私募第一梯队。按照梁文锋自己的说法,DeepSeek 成立前,“我们面临的问题从来不是钱,而是高端芯片被禁运”。这句话后来被很多媒体引用,因为它准确概括了 DeepSeek 的资源约束:公司并不缺资金,但缺少最先进芯片的自由获取权。 当外部环境开始限制算力供给时,梁文锋选择的不是等待,而是把研究重点转向效率。这也解释了为什么 DeepSeek 后来会在注意力机制、专家模型、低精度训练和推理优化上投入如此多精力:他们必须用更少的资源做出更大的模型。 萤火一号和萤火二号的意义还在于,幻方培养了一支能同时理解硬件和软件的团队。训练平台不只是把显卡堆在一起,还需要设计高速网络、分布式存储、任务调度和故障恢复。任何一张卡掉线,任何一次通信拥塞,都会影响整个训练过程。幻方在自建平台中遇到的问题,比许多只用云服务的团队更接近真实的规模约束。 这种“自己建”的习惯后来延续到 DeepSeek 的工程体系中。DeepSeek 开源过 FlashMLA、DeepEP、DeepGEMM、DualPipe、EPLB、3FS 等组件,它们分别对应注意力内核、专家并行通信、矩阵计算、流水线并行、负载均衡和文件系统。如果团队没有在幻方阶段经历过大规模集群的运维,很难在如此短的时间内把这些组件做得足够实用。 另一个背景是芯片出口管制。2022 年起,美国开始限制英伟达最先进 AI 芯片对华出口,A100 等型号不能合法销售。DeepSeek 早期模型依赖幻方囤积的 A100,后来 V3 和 R1 使用“中国特供版”H800,之后 H800 也受到限制。算力供给的不确定性没有让 DeepSeek 停止研究,反而推动它把算法效率当作第一优先级。 梁文锋在公开采访中很少抱怨芯片限制,更多是把它当作一个需要解决的技术约束。他说过,中国必须有人站到技术前沿。这句话与其说是口号,不如说是研究策略:当无法获得无限算力时,唯一能做的就是把每一个浮点运算用得更聪明。 从商业角度看,万卡集群是一笔巨额沉没成本。但从研究角度看,它给了团队一个独特的机会:在模型规模达到百亿甚至千亿参数之前,先学会如何让大规模训练稳定运行。DeepSeek 后来的 V3 训练只用约 278.8 万 GPU 小时,与这个阶段的积累密不可分。 ## 1.4 成立 DeepSeek:为 AGI 而不是为应用创业 2023 年 5 月,梁文锋宣布进军通用人工智能。同年 7 月,杭州深度求索人工智能基础技术研究有限公司成立,对外名称是 DeepSeek。 这个时间点并不特别有利。当时,国内大模型创业已经进入拥挤阶段,许多公司忙着做行业应用、企业服务或垂直模型,融资和商业化几乎是创业公司的默认目标。DeepSeek 却刻意选择了相反的路线。 梁文锋在公开场合明确表示,DeepSeek 的目标是 AGI,而不是垂直行业模型。他没有把公司定位成“金融 AI 公司”或“量化模型的衍生品”,也没有让 DeepSeek 与幻方的业务绑定。两个组织保持独立,DeepSeek 专注基础模型研究。 早期 DeepSeek 最引人注目的标签是“三不”:不融资、不上市、不商业化。这套原则在互联网公司主导的 AI 竞赛中显得格格不入,却也带来了一种特殊的自由。团队不需要为了季度收入调整研究方向,不需要向投资人解释为什么模型没有盈利,也不需要在一篇论文和一个商业合作之间做妥协。 资金来源来自幻方自有经营收益。梁文锋可以调用幻方多年积累的现金流、GPU 集群和工程人才,这让 DeepSeek 在成立之初就拥有远高于一般创业公司的资源密度。据公开报道,DeepSeek 团队规模一直保持在很小的水平,全公司只有一百多名工程师和研究人员,远少于 OpenAI、Anthropic 等海外公司。 更重要的是团队构成。DeepSeek 的员工几乎全部来自清华、北大、浙大、中山大学、北邮等国内高校,鲜有海归。许多人是在读博士生、博四博五实习生,或毕业一两年的年轻人,平均年龄不到三十岁。梁文锋后来说过,公司里并没有什么高深莫测的奇才,都是一些顶尖高校的应届毕业生、没毕业的博士生和刚工作几年的年轻人。 这段话很容易被简化为“天才少年叙事”,但它真正的含义是关于经验与创新。梁文锋认为,有经验的人会不假思索地告诉你应该怎么做,而没有经验的人会反复摸索,认真想应该怎么做。DeepSeek 的年轻团队因此更愿意挑战传统做法,而不是复制大公司的成熟流程。 在技术路线上,DeepSeek 一开始就选择开源。这个选择在 2023 年并不流行。开源模型通常被看作“追赶者”的武器,闭源模型则被认为更能保护商业价值。梁文锋却说,在颠覆性技术面前,闭源形成的护城河是短暂的,开源更像一种文化行为。 这种判断并不是纯粹的理想主义。开源让 DeepSeek 获得全球开发者反馈,也让它不需要建立庞大的销售和服务体系就能扩大影响力。更重要的是,开源把模型的真实能力暴露在公众面前,迫使团队不断用公开基准证明自己。 2023 年 11 月,DeepSeek 发布开源的代码大模型。这个模型在当时的关注度并不高,但它确立了 DeepSeek 后续的发布节奏:先给出完整技术报告,再公开模型权重,让社区可以下载、测试和复现。与很多只发布 API 的公司相比,DeepSeek 把“可验证”当作默认要求。 这种开放姿态也帮助 DeepSeek 吸引了一批重视技术细节的开发者。大模型领域的信息不对称极其严重,用户很难判断一家公司宣称的指标是否真实。开源权重让第三方可以独立测量,也让模型的能力边界变得透明。对 DeepSeek 来说,透明本身就是一种竞争力。 梁文锋在 2024 年的一次采访中提到,无论 API 还是 AI,都应该是普惠的、人人可以用得起的东西。这种表述很容易被解读为营销话术,但 DeepSeek 后续的定价策略确实与这句话保持一致。V2 发布时,每百万 Token 输入约一元、输出约两元,远低于当时主流闭源模型的价格。 需要说明的是,DeepSeek 并不是从一开始就完全清楚开源会带来什么。它更像是在研究过程中形成了自己的判断:模型能力可以靠技术解决,商业价值可以靠生态放大,唯独封闭的护城河很难在快速变化的技术周期里维持。这个判断后来被 R1 的传播证明。 ## 1.5 一群年轻人与“不融资”的组织实验 DeepSeek 的组织结构是它最不显眼、却最值得研究的创新之一。 据公开报道,公司内部只有两个层级:梁文锋和研究员。没有 KPI,没有固定任务,也不做前置分工。研究员可以自下而上提出想法,每个人随时可以调用训练集群的卡,不需要复杂审批。这种结构牺牲了管理上的确定性,却换来了探索上的自由度。 梁文锋对此有过非常直白的解释。他说,创新需要尽可能少的干预和管理,创新往往是自己产生的,不是刻意安排的,更不是教出来的。这些话放在商业语境里可能显得过于理想,但 DeepSeek 后来的一系列技术动作,确实带有明显的自组织特征。 一个常被提起的人物是罗福莉。她出身四川农村,后来保研北大,曾一年发表八篇顶会论文,并进入阿里达摩院。她参与过 DeepSeek-V2 的核心开发,被媒体称为“DeepSeek 天才少女”。她的经历被反复讲述,一方面是因为人才流动本身具有新闻性,另一方面也说明 DeepSeek 的竞争力建立在具体的人身上,而不是某个不可复制的管理秘方。 除了罗福莉,邵智宏、朱琪豪等年轻研究者也出现在 DeepSeek 核心论文作者名单中。他们来自清华、北大等高校,许多人当时还在读博。DeepSeek 没有等待他们毕业,而是直接让年轻研究者承担核心工作。 这种组织方式与“三不”原则形成了一组自洽的制度设计。不融资,意味着外部资本不能决定研究方向;不上市,意味着短期利润不是目标;不商业化,意味着模型可以优先考虑开放和普惠。三者共同保护了一个很小的研究团队,使它可以长期专注于高难度问题。 2024 年 5 月,DeepSeek-V2 发布。它首次把 MLA 和 DeepSeekMoE 两个架构创新带到开源世界,并以极低的 API 定价引发国内大模型价格战。字节、阿里、百度、腾讯等公司随后跟进降价,行业成本被快速拉低。梁文锋后来说,他们不是有意成为一条鲶鱼,只是不小心成了一条鲶鱼。 这句话在传播中被赋予了太多诗意,但它其实准确描述了 DeepSeek 的位置:这家公司从一开始就不是为了挑战某个对手而存在,而是为了验证一种研究路线。价格战只是路线选择带来的外部结果。 2024 年 12 月 26 日,DeepSeek-V3 发布。总参数 6710 亿,激活参数 370 亿,预训练只用约 278.8 万 H800 GPU 小时,成本约 557.6 万美元。这个数字让硅谷第一次意识到,中国团队不仅能够训练大模型,还能用更少的资源接近前沿水平。 2025 年 1 月 20 日,DeepSeek-R1 发布。它采用 MIT 协议开源,包含 R1-Zero、R1 以及六个蒸馏小模型,数学、代码和推理能力对标 OpenAI 的 o1。发布当天,DeepSeek 同时出现在苹果美国区和中国区免费应用榜首位。 从八万元本金到开源推理模型,从量化交易到通用智能,DeepSeek 的故事并不是一个简单的逆袭叙事。它背后是一套持续了十几年的技术积累:数据工程、算力建设、分布式训练、模型压缩、组织设计,以及一种愿意为长期目标承担风险的态度。 R1 的传播速度超出了所有人的预期。2025 年 1 月 27 日,英伟达单日大跌近 17%,市值蒸发约 6000 亿美元。华尔街第一次意识到,大模型竞争可能不完全是“谁堆的算力多谁就赢”,算法创新同样可以改变成本结构。这个事件被媒体称为“DeepSeek 时刻”,尽管它并不完全等同于 R1 发布当天,而是市场对 R1 能力的延迟反应。 DeepSeek 的团队规模与影响力之间的反差,让外界对它产生了两种截然不同的解读。一种观点认为,它证明了小团队、开源和效率优先可以挑战巨头;另一种观点认为,它只是特殊历史条件下的产物,离不开幻方多年的资金和算力积累。两种解读都有依据,但都忽略了同一件事:DeepSeek 的组织设计、技术路线和资源背景是互相支持的,不能只抽取其中一环。 梁文锋在多个场合强调过好奇心驱动。2025 年爆红之后,他依然极少接受采访。春节返乡时,老家村口拉起横幅,许多人在他熟悉的村庄打卡,他除夕当天到家,大年初一上午便离开。这个细节与他在互联网上消失多年的状态一致:他对公开名声没有太大兴趣,更愿意把注意力放回模型本身。 当然,早期选择并不保证未来成功。不融资的组织模式让 DeepSeek 保持了独立性,但也限制了它扩大基础设施的速度;开源策略让全球开发者受益,却也削弱了模型本身作为商业产品的稀缺性;年轻团队带来了创新活力,同时也要面对工程稳定性和安全治理的考验。这些张力将在后两章中反复出现。 从更宏观的视角看,DeepSeek 的诞生本身就是一次路线实验。它把量化交易中的实证精神、自建基础设施的决心和开源社区的合作方式,组合成一套不同于硅谷大厂的研发模式。这套模式能否持续,取决于它能否在保持技术前沿的同时解决商业可持续、安全合规和地缘政治带来的复杂问题。 需要特别指出的是,DeepSeek 的“不融资”并不是永远不变的承诺,而是一种阶段性的组织策略。在公司成立初期,它保护了研究方向不被资本节奏绑架;当模型进入大规模部署阶段,算力、数据、人才和国际市场都需要更多资源,外部资本也可能成为必要补充。2026 年,DeepSeek 完成首轮外部融资的消息公开,投后估值约 500 亿美元。这说明早期原则的真正价值不是拒绝变化,而是让公司在变化之前拥有足够长的自主窗口。 同样值得留意的是 DeepSeek 与幻方的边界。公开表述中,DeepSeek 与金融业务“无直接关系”,但两家组织共享了创始人的技术理念、部分人才和长期积累的工程经验。量化交易为 DeepSeek 提供了现金流和算力底牌,DeepSeek 又反过来让外界重新认识幻方的技术投入。两者之间的协同不是简单的“母公司孵化子公司”,而更像一次能力迁移。 回看第 1 章,DeepSeek 的诞生具备几个容易被低估的前提:一个愿意长期投入基础研究的创始人,一批合作多年的工程师,一套自己建设并运营的万卡集群,以及一个允许年轻人承担核心任务的扁平组织。这些前提单独出现并不罕见,同时出现在一家公司里却非常难得。正是这种组合,让 DeepSeek 能够在后来用极低的训练成本逼近前沿模型,也让它的故事不能被简化为一次偶然的成功。 梁文锋在 2024 年接受采访时说,中国 AI 不可能永远处在跟随的位置,真实的 gap 是原创和模仿之差。这句话点出了 DeepSeek 真正的野心:它不想只做一家表现优异的中国大模型公司,而是想在基础研究层面定义问题,并给出自己的答案。 当然,早期选择并不保证未来成功。不融资的组织模式让 DeepSeek 保持了独立性,但也限制了它扩大基础设施的速度;开源策略让全球开发者受益,却也削弱了模型本身作为商业产品的稀缺性;年轻团队带来了创新活力,同时也要面对工程稳定性和安全治理的考验。这些张力将在后两章中反复出现。 本章的人物细节与事实主要来自 materials/raw_01history.md 和 materials/raw_04_zhihu_history.md 所整理的公开报道。对于部分场景,比如 2018 年投资者拜访时的穿着和微博互动,素材来源为公开文章转述,未经过当事人逐字确认,书中按“公开报道中的细节”处理。 --- ## 第2章 架构与工程革命:MLA、MoE与低成本训练 # 第 2 章 架构与工程革命:MLA、MoE与低成本训练 ## 2.1 KV Cache 瓶颈与多头潜在注意力 要理解 DeepSeek 的架构创新,先要理解大模型推理中一个非常现实的问题:显存不够。 现代大模型大多基于 Transformer 架构。模型在生成每一个新 Token 时,都需要参考此前已经处理过的 Token 的信息。为了不重复计算,推理框架会把历史输入的 Key 和 Value 缓存下来,这块内存被称为 KV Cache。上下文越长,KV Cache 占用就越大。当用户输入一份长文档,或要求模型处理几十万 Token 的对话时,显存往往会被缓存占满,真正用于计算的资源反而所剩无几。 传统多头注意力中,每个注意力头都保存独立的 Key 和 Value。头数越多、隐层维度越大,缓存开销就越惊人。业界已经提出过多种缓解方案,比如分组查询注意力,让多个查询头共享一组 Key 和 Value,从而减少缓存数量。这类方法有效,但本质上仍然在缓存完整向量。 DeepSeek 在 V2 中提出的 MLA,即多头潜在注意力,采用了不同的思路:把 Key 和 Value 压缩到一个共享的低维潜在向量中,推理时只缓存这个压缩后的向量,而不是缓存完整的 K 和 V。需要计算注意力时,再从潜在空间恢复所需信息。 这个设计可以用一个类比来理解。完整保存一段对话,像把整本笔记逐字抄下来;MLA 则像先写一份浓缩摘要,只有在真正需要时,才根据摘要还原某个章节的关键信息。摘要显然更省空间,但也要求模型具备足够强的压缩和恢复能力。 根据 DeepSeek-V2 论文和官方资料,MLA 把 KV Cache 压缩到传统多头注意力的约八分之一到十六分之一,整体节省约 93.3%。解码阶段的内存带宽需求大幅下降,最大生成吞吐量提升到原来的 5.76 倍。这不是一个可以忽略的性能提升,而是直接改变了大模型推理的经济性。 MLA 的价值并不只在 DeepSeek 内部。论文公开后,社区出现了 TransMLA、Tensor Parallel Latent Attention 等后续研究,专门分析 MLA 的原理和硬件效率。英伟达也在推理框架中增加对 MLA 的支持。一个开源架构创新能够被整个行业吸收,说明它解决的不是某个公司的局部问题,而是普遍存在的技术瓶颈。 为什么 DeepSeek 会首先想到压缩 KV Cache?答案仍然可以追溯到第一章提到的约束:芯片获取受限、算力昂贵,任何能把显存和带宽省下来的方法都值得尝试。幻方时期积累的大规模集群经验让团队清楚,模型论文里的理论复杂度,与真实机器上的内存瓶颈往往相差很远。 MLA 的另一个意义是让长上下文变得可行。上下文长度不仅取决于模型的训练能力,还取决于推理时能不能把历史信息放进显存。如果每生成一个 Token 都因为缓存溢出而中断,再长的训练窗口也无法转化为可用的产品体验。 MLA 之后,DeepSeek 又在 V3 中保留了这一架构,并把它与混合专家模型、多 Token 预测、低精度训练结合起来。MLA 本身不是孤立发明,而是整个 DeepSeek 架构体系的一块基石。 要理解 MLA 为什么能获得行业认可,需要回到一个更基础的问题:注意力机制到底在做什么。Transformer 的注意力让模型根据查询向量,从一组键值对中找出相关信息。Key 决定“我该关注哪里”,Value 决定“找到之后应该读出什么”。在长文本里,每一步生成都可能与很早之前的信息有关,所以系统必须保留足够长的历史。 传统方案里,模型会把每一个历史位置的 Key 和 Value 都完整保存下来。序列长度增加一倍,缓存也大约增加一倍。这种线性增长在几万 Token 内还能接受,到百万 Token 时就会变成天文数字。MLA 用低秩投影把 Key 和 Value 压缩成潜在向量,本质上是在“信息完整”和“存储成本”之间找到了一个更好的折中。 当然,压缩并不免费。MLA 需要在每次注意力计算时从潜在向量恢复 Key 和 Value,这增加了一部分计算开销。但推理阶段的主要瓶颈通常是内存带宽而不是浮点运算,因此省下的显存和带宽远大于恢复过程带来的成本。DeepSeek 的测试表明,整体收益非常显著。 MLA 也改变了大模型推理框架的设计方式。vLLM 和 SGLang 等引擎需要为它开发专门内核,而不是直接使用标准注意力算子。这既是一种挑战,也是一种机会:谁先把 MLA 跑得更快,谁就能在 DeepSeek 模型部署上取得优势。后来围绕 MLA 出现的大量开源实现,进一步验证了这个架构的生命力。 对研究社区来说,MLA 还有一个额外价值:它展示了一种“结构性优化”的可能性。许多人默认模型架构已经接近最优,剩下的空间只能靠数据和算力填充。MLA 却证明,改变信息缓存的粒度可以带来数量级差异。这个启示后来被应用到稀疏注意力、低精度推理等更多方向。 ## 2.2 稀疏专家:用 37B 激活 671B 参数 如果 MLA 解决的是推理显存问题,DeepSeekMoE 解决的就是训练和推理的计算成本问题。 传统稠密模型里,每个 Token 都会经过模型的所有参数。参数量越大,知识容量通常越大,但每一步计算的开销也越大。混合专家模型试图打破这种线性关系:把模型拆成多个专家子网络,每个 Token 只激活其中一部分专家,从而在总参数量很大的情况下保持较低的计算成本。 DeepSeekMoE 的特别之处,在于同时使用共享专家和路由专家。共享专家处理所有 Token 都会遇到的基础模式,路由专家则根据每个 Token 的内容被动态选中。这种设计避免了所有专家都争抢同一类任务,也让不同 Token 可以走不同的计算路径。 DeepSeek-V2 总参数约 236B,每个 Token 激活约 21B。相比当时的 DeepSeek 67B 稠密模型,训练成本节省约 42.5%。到了 V3,总参数提升到 671B,激活参数约 37B。也就是说,一个拥有六千多亿参数的模型,每个 Token 真正参与计算的只有三百多亿参数。 数字上的对比看起来简单,工程上却非常复杂。MoE 模型需要路由网络决定每个 Token 去哪些专家,需要处理不同专家负载不均的问题,还需要设计高效的通信方式让专家并行工作。如果路由失衡,少数专家会过热,多数专家会被浪费;如果通信设计不好,专家并行带来的收益会被网络开销抵消。 V3 在负载均衡上做出了一个重要改进:无辅助损失策略。传统的 MoE 训练通常会给路由网络加一个辅助损失,鼓励专家负载均衡。这个损失会影响模型的学习目标,可能导致性能下降。DeepSeek 改用动态偏置机制,通过调整专家选择的偏置来维持负载均衡,同时避免辅助损失对主任务的干扰。 这一改动让 V3 在 14.8T Token 的预训练中保持稳定,官方技术报告称没有出现不可恢复的损失尖峰。对大规模训练来说,“没有事故”本身就是一种巨大的工程成就。 MoE 也带来了推理侧的新挑战。模型总参数 671B,权重文件非常大,不可能全部放进单张显卡。部署时需要把不同专家分布到多张卡上,并通过高速网络交换 Token 与专家之间的计算结果。DeepSeek 为此开源了 DeepEP 等专家并行通信库,社区也围绕专家并行设计了多种部署方案。 一个更贴近真实世界的案例来自企业工程师。一位署名斌王的技术人员记录了自己所在部门部署 DeepSeek-R1 671B 版本的过程。当请求处理接近 100K Token 时,H20 显卡上的 vLLM 会随机崩溃,报出 illegal memory access,而且每次崩溃位置都不一样。团队把请求温度设为 0,并开启 CUDA_LAUNCH_BLOCKING,才让崩溃点稳定下来,再用 compute-sanitizer 抓取内存错误信息。 这个案例说明,架构创新只是模型能力的上半场。真正把 MoE 模型用起来,还需要处理显存分配、内核兼容、通信拓扑和故障诊断。DeepSeek 的开源价值,不仅在于把模型权重公开,也在于把这类工程经验变成可复现的代码和方案。 MoE 的另一个挑战是显存占用。虽然每个 Token 只激活部分专家,但模型权重仍然需要全部加载到内存中。671B 参数意味着即使使用低精度格式,权重也需要数百 GB 显存,单张卡根本无法容纳。部署时必须把专家分布到多台机器,并在推理过程中动态搬运 Token。 这种“模型大、激活小”的特性,让 MoE 推理的瓶颈从计算转向通信。一个 Token 可能被路由到位于不同节点的专家,计算结果又需要聚合回主路径。如果通信开销过高,稀疏激活带来的计算节省就会被抵消。DeepSeek 的 DeepEP 专门优化了这类通信,SGLang 也提出大规模专家并行方案。 回到企业部署案例,斌王团队遇到的问题正是这些系统级因素的综合体现。100K Token 请求会让显存分配接近边界,非法内存访问可能来自内核 bug、显存碎片或通信超时。他们用固定温度、阻塞启动和内存检查工具逐步缩小范围,本质上是在做最传统的系统排查。这个案例提醒我们,真实世界的大模型部署没有论文里那么干净。 从产业角度看,MoE 的普及还带来硬件设计的连锁反应。GPU 厂商开始关注稀疏模型的内存访问模式,推理芯片厂商则尝试把专家路由和通信逻辑硬件化。DeepSeekMoE 不只影响了一款模型,也在塑造下一代 AI 基础设施的形态。 DeepSeek 还发布了 V2-Lite,一个约 16B 参数的轻量版模型,保留了 MLA 与 DeepSeekMoE 的核心结构,方便学习者和资源有限的团队研究。这个选择体现了 DeepSeek 技术传播的一贯策略:不仅给出理论,还提供可以真正跑起来的参照实现。 ## 2.3 训练工程:FP8、DualPipe 与 557 万美元 DeepSeek-V3 最让外界震惊的数字,是训练成本约 557.6 万美元,预训练仅消耗约 278.8 万 H800 GPU 小时。这个数字低于许多人的直觉,也让“大模型训练一定需要数亿美元”的叙事第一次受到广泛质疑。 成本下降来自多个层面的叠加。首先是低精度训练。V3 使用 FP8 混合精度,在训练的大部分阶段用 8 位浮点数进行矩阵计算,同时保留必要的高精度路径。FP8 能减少显存占用和计算带宽,让每张显卡在同样时间内处理更多 Token。 其次是通信与流水线优化。大规模训练需要把模型切分到上千张卡上,GPU 之间不断交换梯度、激活值和专家输出。DualPipe 是一种双向流水线并行方案,让正向计算和反向计算在同一时间窗口内重叠,减少 GPU 的空闲等待。EPLB 则负责专家负载均衡,让不同卡的算力尽量被均匀使用。 再次是训练目标。V3 引入多 Token 预测,让模型不只预测下一个 Token,还同时预测未来多个 Token。多 Token 预测提供了更密集的训练信号,也提升了推理时的效率。这个想法并不复杂,但需要在模型结构、损失函数和推理采样上做出配套设计。 这些优化叠加在一起,才让 557.6 万美元成为可能。值得注意的是,这个数字是预训练阶段的报告成本,并不等于公司所有研发投入。芯片采购、数据建设、实验试错、员工薪酬和推理服务都没有被完全包含在内。真正重要的是成本结构本身:DeepSeek 证明,前沿模型所需的算力并不必然随参数规模线性膨胀。 DeepSeek 还把大量训练和推理基础设施以开源方式发布。2025 年 2 月的“开源周”期间,团队连续公开 FlashMLA、DeepEP、DeepGEMM、DualPipe、EPLB、3FS 等组件。这些项目名称听起来很技术化,但每一件都对应真实问题:FlashMLA 优化 MLA 的注意力内核,DeepEP 处理 MoE 通信,DeepGEMM 加速矩阵运算,3FS 提供高性能文件系统。 如果只看模型性能,这些工程组件容易被忽略。但正是它们让 278.8 万 GPU 小时成为可能。大模型研究不是只有算法,还需要把算法落到上万张卡上稳定运行。DeepSeek 的小团队之所以能完成这个任务,与幻方阶段自建集群的经验密不可分。 V3 的发布还伴随着一个特殊背景:H800 是中国市场可获得的英伟达芯片,性能比 H100 有所限制,但仍然足够训练大模型。芯片出口管制让 DeepSeek 无法自由使用最前沿硬件,团队只能通过软件和算法把有限硬件的潜力压到极限。这种约束反而促成了后来被大量复用的工程创新。 从宏观产业角度看,V3 改变了市场对“算力竞赛”的理解。此前,行业普遍默认更大参数、更多芯片、更高算力预算才能逼近前沿。DeepSeek 用一次实际训练展示,架构选择、数据质量、并行策略和低精度计算可以共同降低单位模型能力的成本。这个结论后来被多家机构和大模型团队验证,也促使推理引擎和硬件厂商重新思考优化方向。 FP8 训练之所以困难,是因为低精度会放大数值误差。模型参数、梯度和激活值在 8 位浮点数中只能表示有限范围,稍不注意就会导致训练发散。DeepSeek 没有简单地把所有计算降到 FP8,而是在关键路径保留高精度,在主计算路径使用 FP8。这种混合精度策略是 V3 能够稳定训练的原因之一。 DualPipe 的优化同样值得展开。传统流水线并行中,一个 GPU 在计算正向传播时,另一部分 GPU 可能正在等待反向传播。DualPipe 通过让两条流水线同时运行,把不同阶段的计算重叠起来,减少设备空转。它相当于把“单人流水线作业”改成“两条流水线交错作业”,让每张卡都能被更充分地利用。 多 Token 预测则从损失函数层面提高了训练效率。传统语言模型只预测下一个 Token,一个训练样本只能提供一次监督信号。MTP 让模型同时预测多个未来 Token,相当于从同一段文本中提取更多信息。额外预测模块在推理时可以部分共享,因此并不会带来明显的部署负担。 数据质量也是 V3 训练成本下降的隐形因素。14.8T Token 并不是越多越好,过滤、去重和配比决定了模型能在有限算力下学到多少有效知识。DeepSeek 在数据清洗和课程学习上的投入,让同等算力产生了更高的模型能力。这也是为什么单纯复制“278.8 万 GPU 小时”并不能复现 V3。 训练成本报告还需要放在正确语境中理解。557.6 万美元是预训练阶段的直接算力成本,不包括团队为此投入的数千次实验。真正昂贵的是那些没有进入论文的实验:失败的架构尝试、超参数搜索、数据筛选和工程调试。DeepSeek 的贡献不是“用很少的钱做出了模型”,而是把成本控制变成了一种系统工程能力。 开源周发布的组件也并非孤立的炫技项目。FlashMLA 可以看作 MLA 推理内核的生产实现,DeepEP 解决专家并行通信,DeepGEMM 面向低精度矩阵运算,3FS 则为大规模训练提供高性能文件系统。把它们放在一起看,才构成一套完整的训练与推理基础设施。 ## 2.4 R1 与 GRPO:让推理能力自己长出来 如果说 V3 证明了“低成本也能训练出强模型”,R1 则回答了另一个问题:模型如何学会“思考”。 2025 年 1 月 20 日,DeepSeek 发布 R1 和 R1-Zero。R1-Zero 的实验最令人惊讶:团队没有先做监督微调,而是直接对基础模型进行强化学习,只用最终答案是否正确作为奖励信号,就让模型自发产生了更长的推理过程。 传统训练里,要让模型具备复杂推理能力,通常需要大量高质量的人工标注推理轨迹。DeepSeek-R1-Zero 尝试的路线是:不给模型示范解题过程,只告诉它答案对错,让它自己尝试、犯错、反思、修正。论文中记录了一个被称为“顿悟时刻”的现象:模型在训练过程中主动检查自己之前生成的步骤,并输出了类似“等一下,这是一个需要重新检查的地方”的自检信号。 这里的关键算法是 GRPO,即组相对策略优化。传统 PPO 需要训练一个价值网络来估计每个状态的收益,这个价值网络会占用大量内存和计算资源。GRPO 去掉了价值网络,改为让模型对同一个问题生成一组答案,然后用这组答案的相对表现计算优势。 通俗地说,GRPO 让模型在一个小组内部比较“谁更好”,而不是让模型与一个外部标准逐点对比。组内均值相当于当前水平,组内标准差则决定奖励的尺度。这样的设计减少了强化学习的训练开销,也让奖励信号更稳定。 R1-Zero 证明了纯强化学习可以涌现长推理能力,但它生成的推理过程可读性较差,有时会混杂多种语言。R1 因此在 R1-Zero 的基础上加入了多阶段训练:先用少量高质量推理数据做冷启动,再使用面向推理的强化学习,然后通过拒绝采样生成更多训练数据,进行监督微调,最后再做一轮覆盖所有场景的强化学习。 这种“先让能力出现,再让行为规范”的流程,兼顾了推理能力的强度与输出的可用性。R1 在 AIME 2024 上准确率达到 77.9%,自一致性解码后达到 86.7%;MATH-500 达到 97.3%;Codeforces 编程竞赛超过 96.3% 的人类选手。多个基准上与 OpenAI 的 o1 正式版基本持平,部分数学和推理任务甚至更优。 R1 还发布了六个蒸馏小模型,基于 Qwen 和 Llama 构建,参数从 1.5B 到 70B 不等。蒸馏的做法,是用 R1 生成的高质量推理数据去训练小模型。小模型并不具备与 R1 完全相同的参数规模,却能在数学、代码和逻辑任务上继承相当一部分推理能力。其中 7B 级模型已经可以在消费级设备上运行,让“推理平权”从概念变成产品。 Nature 杂志于 2025 年 9 月以封面文章形式刊发了 DeepSeek-R1 论文。这是中国大陆团队首次以“大模型第一作者”身份登上 Nature 封面,也让强化学习训练推理模型从社交媒体话题进入正式学术评价体系。 R1 也引发了关于蒸馏的争议。OpenAI 等公司曾公开质疑,DeepSeek 是否通过大量调用闭源模型来蒸馏能力。DeepSeek 团队回应称,没有使用 OpenAI 的推理示例进行训练。围绕这件事的讨论很难在短时间内得出结论,但至少暴露了一个事实:当模型能力可以被开源权重和高质量数据复制时,闭源模型与开源模型之间的边界会变得模糊。 R1 最重要的技术启示,是“可验证奖励”的力量。数学、代码等任务有明确答案,模型可以通过规则判断对错,因此强化学习可以自动获得奖励信号。团队不需要为每一步推理过程标注,只需要给最终结果打分。这让数据标注成本大幅下降,也意味着推理能力不一定依赖昂贵的人工示范。 强化学习训练还有一个常见陷阱:奖励黑客。模型可能找到一条不真正解题、却能让奖励分数变高的捷径。R1 的规则奖励只关心最终答案,理论上更容易被钻空子。DeepSeek 的应对方式是增加语言一致性约束,并在多阶段训练中引入生成式奖励模型,让模型不仅要答对,还要给出可读、可验证的推理过程。 R1-Zero 的实验也改变了社区对“训练数据”的理解。过去,提升推理能力通常意味着收集更多专家解题样本;R1-Zero 却表明,只要奖励信号足够清晰,模型可以自己生成推理轨迹。这个结论让许多研究团队开始重新设计强化学习环境,而不是继续扩充人工标注数据。 蒸馏小模型的成功进一步放大了 R1 的影响力。一个 7B 参数模型无法承载与 671B 参数模型相同的知识,但在数学、代码等可验证任务上,它通过模仿 R1 的推理模式获得了很高水平。这意味着推理能力并不完全依赖参数规模,训练方法同样重要。 R1 论文进入 Nature 的过程本身也值得记录。它不是一篇快速发表的新闻稿,而是经过正式同行评审的研究成果。审稿过程会要求作者提供更完整的实验细节和可复现性说明,这让 R1 的结论比许多社交媒体上的“复现成功”更有可信度。 从学术角度看,R1 最大的遗产或许是打开了“推理强化学习”的研究方向。Open-Reasoner-Zero、DeepScaler、oat-zero 等项目在 R1 基础上尝试不同算法和奖励设计,验证了纯强化学习在不同规模模型上的表现。图灵奖得主和开源社区领袖也公开肯定 R1 的开源价值,这种认可在短时间内很难被另一家公司复制。 与此同时,R1 也把“推理成本”重新摆上台面。推理模型需要在生成答案前进行更长的思考,这会显著增加输出 Token 和计算时间。DeepSeek 用更低价格提供推理能力,实际上是在告诉行业:推理能力的商业化不能只靠更高的算力账单,还要靠算法与系统优化。 ## 2.5 V4 方向:百万上下文与稀疏注意力 DeepSeek 并没有停留在 V3 和 R1。2026 年 4 月,DeepSeek-V4 预览版发布,主打百万 Token 上下文和更极致的推理效率。 V4 包含两个模型:V4-Pro 总参数约 1.6T,激活约 49B;V4-Flash 总参数约 284B,激活约 13B。两个模型都支持 100 万 Token 上下文,预训练 Token 分别约 33T 和 32T。V4-Pro 在当时成为已知最大的开源权重模型。 支撑百万上下文的是一组新的注意力设计:压缩稀疏注意力、重度压缩注意力和滑动窗口注意力。简单来说,模型既保留一个最近窗口内的精细计算,又通过压缩和稀疏检索保留长程历史,再用一种更激进的压缩注意力提供全局上下文。 与 V3.2 相比,V4-Pro 在 1M 上下文场景下,单 Token 推理算力约为原来的 27%,KV Cache 约为原来的 10%;V4-Flash 的推理算力约为原来的 10%,KV Cache 约为原来的 7%。这些数字说明,稀疏注意力不是简单的近似,而是让百万级上下文真正可部署的关键。 V4 还引入了一些更深层的优化。mHC 是一种流形约束超连接,用于替代传统残差连接,改善深层网络的信号传播;Muon 优化器替代 AdamW,让训练收敛更快、更稳定。后训练则采用“领域专家独立培养,再统一整合”的两阶段方案:先分别训练数学、代码、Agent 等领域专家,再用在线策略蒸馏把多个专家合并成一个统一模型。 这种“分而治之”的后训练方式,与 R1 的强化学习一脉相承:先用可验证奖励训练强能力,再通过蒸馏和对齐整合成可用产品。V4-Flash 作为生产版,总参数只有 284B,激活 13B,却通过后训练优化在多项评测中反超许多更大模型,输出定价也远低于当时主流闭源模型。 开源仍然是 V4 的基本策略。模型权重以 MIT 协议发布在 Hugging Face 和 ModelScope,vLLM、SGLang、TensorRT-LLM 等推理框架在发布后迅速适配。华为昇腾也完成基于国产算力的训练与推理适配,这标志着 DeepSeek 的技术栈正在从单一英伟达生态向多元化硬件生态延伸。 2026 年 8 月,媒体报道 DeepSeek 将整体上调 API 定价,原因是算力成本压力。这一变化说明,低价策略不是没有代价的。模型训练和推理都需要持续投入,单纯依靠低价格无法长期维持基础设施扩张。V4 的价格调整,或许标志着 DeepSeek 从“价格屠夫”向更可持续的商业模式过渡。 从 MLA 到 MoE,从 FP8 到 GRPO,从百万上下文到在线蒸馏,DeepSeek 的技术路线始终围绕同一个目标:用更少的资源获得更强的能力。每一个组件都可以被单独研究,但真正难以复制的,是它们在同一套系统中协同工作的能力。 V4 的稀疏注意力设计并不只是为超长文本准备。它同时降低训练和推理成本,让更大上下文成为默认能力。用户可以把整本技术文档、长期项目记录或大量代码库直接放进上下文,而不必依赖复杂的外部检索系统。这种体验上的变化,可能比基准分数更重要。 后训练的两阶段方案也值得单独解释。传统做法通常是在一个模型上混合多种任务进行统一微调,不同目标之间可能互相干扰。V4 先让数学、代码、Agent 等领域的专家独立成长,再用在线蒸馏统一整合,相当于先专业化再综合。它让每个领域都能获得足够训练,同时避免最终模型因混合任务而失去特长。 在线策略蒸馏与普通蒸馏不同。普通蒸馏通常用教师模型生成的静态数据训练学生;在线蒸馏让学生模型在训练过程中不断生成样本,再让教师模型评估和指导。这种动态反馈让统一模型更容易吸收专家能力,也减少了对海量离线数据的依赖。 V4 发布后,推理框架的适配速度成为行业观察点。vLLM 和 SGLang 相继发布支持版本,华为昇腾完成适配,社区还出现了针对稀疏注意力索引计算的加速补丁。这种“模型发布即生态联动”的新范式,正是 DeepSeek 长期开源策略积累出来的结果。 如果把第 2 章的内容压缩成一句话,那就是:DeepSeek 的成功不是某个单一算法的胜利,而是把注意力架构、专家模型、低精度计算、并行工程、强化学习和数据策略组合成一套高效率系统。这套系统的每一项都可能被其他团队学习,但把它们放在一起并持续迭代,需要组织、资源和时间的共同支撑。 下一章将把视角从模型内部转向模型外部:DeepSeek 如何通过开源改变开发者生态,如何影响企业部署,又如何在全球监管和地缘政治中寻找自己的位置。技术能力只是起点,产业规则与社会接受度同样决定一家 AI 公司的长期命运。 在结束本章之前,还有一个容易被忽略的观察:DeepSeek 的架构论文大多非常坦诚。它们会公开失败尝试、超参数选择、训练不稳定问题和部署注意事项,而不是只展示最好的结果。这种透明度让第三方团队能够更快复现和继续改进,也让 DeepSeek 的技术路线经受了更多外部检验。 技术革命通常由多个层面的微小改进累积而成。MLA 压缩缓存,MoE 节省计算,FP8 降低精度成本,MTP 增强训练信号,GRPO 减少强化学习开销,稀疏注意力让百万上下文成为可能。DeepSeek 没有发明全部技术,却把它们组合成了一个彼此适配、持续进化的系统。这套系统是否足以通向 AGI,仍是未知数,但它已经改变了通往未知数的道路。 本章技术细节主要来自 materials/raw_02_architecture.md、materials/raw_03r1.md、materials/raw_05_zhihu_tech.md 和 materials/raw_08_v4.md。文中关于企业部署 H20 显卡崩溃的案例来自知乎署名文章,属于一线工程师的公开技术复盘,具体环境参数可能与不同部署方案存在差异。 --- ## 第3章 开源、冲击与未来:DeepSeek如何重塑AI产业 # 第 3 章 开源、冲击与未来:DeepSeek如何重塑AI产业 ## 3.1 R1 时刻:一款开源模型引发的全球震动 2025 年 1 月 20 日,DeepSeek-R1 发布。按照当时大多数人的预期,这只会是又一款开源大模型:性能不错,但未必能改变行业格局。 事实很快证明,R1 的影响超出了模型本身。它发布的第三天,DeepSeek 同时登上苹果美国区和中国区免费应用榜首位。此后一周,全球资本市场开始重新评估“算力无限论”。2025 年 1 月 27 日,英伟达股价单日大跌近 17%,市值蒸发约 6000 亿美元,创下当时美股历史上最大的单日市值损失纪录。纳斯达克开盘跌约 3.6%,标普 500 和全球 AI 产业链同步震荡。 市场恐慌的背后,是一个更根本的问题被摆到台面上:如果一家中国公司用约 557.6 万美元的训练成本和 278.8 万 GPU 小时就接近 OpenAI o1 的推理水平,那么此前行业对“堆算力”的巨额投资假设还成立吗? 这个问题没有简单答案。华尔街的剧烈反应并不完全理性,但它揭示了一个真实变化:大模型竞争的成本结构正在被改写。过去,模型能力与算力投入之间的线性关系被当成默认前提;R1 用公开权重证明,算法创新、强化学习和系统优化可以显著压缩单位能力成本。 R1 的冲击还体现在竞争对手的回应上。2025 年,OpenAI 发布 gpt-oss,Meta 更新 Llama 4,Mistral 推出 Large 3,美国 ATOM 项目也明确把开源模型作为方向之一。开放权重从一个“社区偏好”变成了战略选项。更有意味的细节是,美国领先的开放权重模型 Cogito v2.1 本身是 DeepSeek-V3 的微调版本,马来西亚等主权 AI 项目也选择运行在 DeepSeek 之上。 2025 年 9 月,R1 论文以封面文章形式发表于《自然》。这篇论文把纯强化学习驱动的长推理、可复现的后训练流程和开源权重放进了学术主流视野。R1 由此从一次市场事件变成一种可被验证、可被批评、可被继续推进的研究路线。 R1 的开源也让“后训练”第一次成为全球可复现的研究主题。此前的推理模型通常只公开 API 或少量技术报告,训练数据、奖励模型、采样策略和微调流程都是黑箱。R1 把论文、权重和实验路径一起公开,使后来者可以把研究重心从“能不能做”转向“怎样做得更便宜、更可控”。 在中国市场,R1 同样被赋予了超出技术本身的意义。《黑神话:悟空》制作人冯骥将其称为“国运级别的科技成果”。这句话带有强烈的情感色彩,也说明 DeepSeek 已经成为一种公共文化符号。对许多中国开发者来说,R1 意味着他们第一次可以近距离研究一个全球前沿模型的完整技术方案,而不必依赖闭源 API。 但 R1 时刻真正值得记录的,不是股价波动,也不是社交媒体热度,而是三个结构性变化。 这种记录方式并非事后总结。2025 年全年,全球模型发布节奏明显加快,越来越多厂商把“开放权重”写进产品路线图;企业内部也从“能不能用开源模型”转向“如何把开源模型用进生产系统”。R1 真正改变的,不是某一款产品的得分,而是行业默认假设。 第一,推理能力不再是闭源模型的专利。R1-Zero 证明了纯强化学习可以让模型自发产生长推理过程;R1 又把这种能力工程化,让数学、代码和逻辑任务上的推理不再依赖人工标注的海量轨迹。第二,开源权重第一次成为“前沿能力”的默认载体。第三方可以下载、测试、蒸馏、微调和部署 R1,这种开放性把技术研究从少数实验室扩散到全球开发者。第三,AI 竞争的重点从“谁有更多卡”转向“谁把算法和系统做得更好”。算力仍然是必要条件,但已不再是充分条件。 与此同时,R1 也暴露出开源模型的另一面:能力越开放,安全风险越难控制。任何人都可以下载模型权重,自行移除安全限制,用于恶意用途。模型的反滥用机制只能存在于权重或服务层,一旦权重公开,开发者就无法完全阻止下游滥用。这个问题贯穿了后续所有关于开源 AI 的争论。 ## 3.2 推理引擎与开源生态:vLLM、SGLang 和蒸馏 R1 的开源价值不仅体现在模型权重,还体现在它激活了整个推理基础设施生态。 2025 年 2 月,DeepSeek 举办“开源周”,连续发布 FlashMLA、DeepEP、DeepGEMM、DualPipe、EPLB、3FS 等生产级组件。这些组件并不是论文中的概念原型,而是在线服务中实际使用的代码。DeepSeek 随后公开表示,放弃自建完整内部推理引擎,转而与 SGLang、vLLM 两大项目深度协作,并承诺在新模型发布前与社区同步推理工程,实现 Day-0 支持。 这个决定在当时显得反直觉:一家以工程能力著称的公司,为什么要把核心推理引擎交给社区?答案是分工。DeepSeek 的优势在模型架构和训练方法,vLLM 和 SGLang 的优势在通用推理引擎、硬件适配和庞大用户基础。与其维护一个与内部基础设施深度耦合的 fork,不如把标准化工作交给社区,让更多人在同一套代码上迭代。 这种协作很快产生了结果。SGLang 团队开源了基于 96 张 H100 的 DeepSeek-V3/R1 集群部署方案,采用预填充与解码分离、大规模专家并行等技术,在 2000 Token 输入序列上达到接近 DeepSeek 官方博客报告的大规模吞吐性能。vLLM 也持续跟进 MLA、MoE 和稀疏注意力的内核支持。 2026 年,围绕 V4 稀疏注意力的适配竞争进一步加速。vLLM、SGLang、TensorRT-LLM、ROCm AITER 和 ktransformers 同步投入;vLLM 连续发布以稀疏注意力正确性、Hopper 路径稳定性为核心的补丁版本,SGLang 则推出实验版支持。THUDM 团队还公开了 IndexCache 方案,为 SGLang 与 vLLM 提供 DSA 推理加速补丁,最多可消除 75% 的索引计算。围绕一个模型的推理栈更新,已经变成多团队协同的常态化工程。 开发者采用率的变化更加直接。据 Artificial Analysis 的开发者调查,DeepSeek 以 53% 的“使用或考虑使用”率超过 Meta Llama 的 43% 和 Mistral 的 22%,成为最受欢迎的开源模型系列之一。OpenRouter 上,DeepSeek 长期占据较大 Token 份额。到 2025 年 9 月,DeepSeek 开源模型在 Hugging Face 的累计下载量突破 150 万次;R1 相关模型后续下载量超过 1090 万次,衍生模型超过 670 个。 Hugging Face 还发起了 Open-R1 项目,尝试完整复现 R1 的训练数据、代码和强化学习流程。Open-Reasoner-Zero、DeepScaler、oat-zero 等社区项目也从不同角度验证 R1 的技术路线。围绕一个开源模型形成如此密集的二次研究,在当时的开源社区中并不常见。 社区复现的价值在于把论文中的“结果”变成可审计的“过程”。Open-R1 记录训练数据、代码与实验配置,让后来者不必重复猜测超参数;其他项目则分别验证不同奖励设计和策略更新方式。这些项目加在一起,使 R1 的推理能力不再是黑箱,而成为一套可以被拆解和继续改进的研究基础设施。 蒸馏是另一个重要生态现象。R1 发布了 6 个蒸馏小模型,基于 Qwen 和 Llama 构建,其中 7B 级模型已经可以在消费级设备上运行。对于企业来说,蒸馏意味着可以把大模型的推理能力压缩到适合私有化部署的规模,同时保留较高的数学、代码和逻辑能力。 蒸馏也引发了商业与伦理争议。OpenAI 和 Anthropic 曾公开质疑,DeepSeek 等公司可能通过大量查询闭源模型来蒸馏能力。Anthropic 甚至称与其模型进行了超过 1600 万次对话。DeepSeek 团队否认使用 OpenAI 的推理示例进行训练。这个争议至今没有公开定论,但它揭示了一个深刻的行业困境:模型能力一旦通过 API 暴露,就很难被完美保护,而蒸馏既可以是合理学习,也可以是绕过研发投入的捷径。 蒸馏争议背后还有一个事实:小模型的能力边界正在快速上移。7B 级模型已经能在消费级设备上处理不少推理任务,企业可以把“大模型当教师、小模型当员工”变成日常架构。这个趋势让模型部署从云端独占走向云端、边缘与本地混合,也改变了下游硬件的产品形态。 围绕 DeepSeek 的开源生态还推动了国产算力适配。华为昇腾在 DeepSeek-V3.2-Exp 发布当天完成 0Day 适配,vLLM、SGLang 和 TensorRT-LLM 在 V4 发布后同步跟进。开源推理引擎与国产硬件结合,使“国芯加国模”从口号变成可执行的工程路线。 这种适配并不只是把模型跑通,而是围绕新架构重新设计算子、调度器和通信层。稀疏注意力改变了 KV Cache 的布局,MoE 改变了通信模式,推理引擎的每一层都需要重新证明正确性和吞吐边界。正是这些低层工程细节,决定了开源模型在真实负载中是否像论文一样高效。 ## 3.3 企业落地:从开发者工具到安全与工业场景 对于企业用户来说,DeepSeek 最直接的价值不是论文指标,而是可以下载、微调和私有化部署的模型权重。 IBM 是最早将 R1 蒸馏模型引入企业平台的海外厂商之一。2025 年 2 月,IBM watsonx.ai 上线基于 Llama 3.1 8B 和 Llama 3.3 70B 的 R1 蒸馏版本,强调安全、治理与规模化部署。对跨国企业来说,使用可审查权重的开源模型,比把数据发送到外部 API 更容易满足合规要求。 对制造业、金融和能源等行业来说,部署开源模型的首要问题往往不是基准分,而是“能否在自己的硬件、网络和审计制度里运行”。R1 的蒸馏版本提供了从 1.5B 到 70B 的多个尺寸,让企业可以根据保密等级、响应速度和预算选择不同的落点。 国内安全企业的落地案例更具行业代表性。海云安 D10 开发者智能助手通过 R1 优化与蒸馏,在代码缺陷检测、组件风险分析、智能编码等场景中综合效率提升超过 20%,运营成本下降 35%。奇安信通过 R1 蒸馏构建安全大模型,在威胁研判、渗透测试、勒索防护和供应链安全等场景中部署,安全专业问答性能提升约 16%。 大型央企和国企的私有化部署,则展示了 DeepSeek 在严苛环境中的工程适配能力。中国移动助力中国中化完成 R1 671B 完整版及多个蒸馏版本的国产化推理适配;国家能源集团完成 R1 系列本地化部署上线,向各单位提供 API 能力。这些项目涉及数据隔离、网络边界、硬件兼容和长期运维,不是简单调用一个公开 API。 云厂商也在快速补齐标准化方案。腾讯云 TI 平台提供“构造蒸馏数据集、清洗 R1 推理结果、选择并精调目标模型”的完整路径,蒸馏后模型最低只需 1 卡 A10 即可微调。阿里云百炼上线 V3/R1 及其蒸馏版本的多款全尺寸模型,并赠送百万 Token 帮助开发者试用。 部署方式的选择也在增多。对低延迟和离线场景,企业可以用量化后的蒸馏模型跑在边缘设备;对高并发场景,可以租用云上推理服务;对数据敏感场景,则使用私有集群。模型本身只是一层能力,真正决定落地效果的是数据管道、工具链、评测体系和运维流程是否围绕它重新组织。 这些案例的共同点,是把“开源模型”变成了“可工程化产品”。企业不再只是对比基准分数,而是关注部署成本、推理延迟、数据合规、故障恢复和长期维护。DeepSeek 的组件开源,让这些工程问题第一次有了公开可查的解决方案。 除了大模型本身,推理引擎也正在改变企业部署预算。火山引擎对 vLLM、SGLang 做过专门性能调优,并推出自研的预填充与解码分离加专家并行引擎;腾讯云、阿里云、火山引擎等云厂商把 DeepSeek 从免部署 API、知识引擎到精调部署做成完整矩阵。企业采购的决策单位,也从“选一个模型”变成“选一套能落地、能优化、能维护的推理系统”。 当然,企业落地并不总是顺利。R1 671B 版本需要数十张高性能显卡,许多中小企业并不具备部署条件。即使使用蒸馏小模型,也需要理解显存占用、上下文长度、量化精度和任务适配。开源降低了授权门槛,却没有自动降低工程门槛。 这种工程门槛正在被工具链压低,但不会被模型发布自动抹平。企业真正需要的,是一套能从数据治理走到模型评测、从模型评测走到线上监控的完整体系。DeepSeek 的贡献在于提供了足够强的起点,而不是替每个行业完成最后一公里。 ## 3.4 数据安全、监管与地缘政治 DeepSeek 的全球扩张,很快遇到了数据安全与地缘政治的双重阻力。 2025 年 1 月,云安全公司 Wiz Research 发现,DeepSeek 有一套可公开访问的 ClickHouse 数据库,无需身份验证即可连接,暴露了超过 100 万行日志,包括聊天记录、API 密钥、后端细节和服务器元数据。DeepSeek 在收到披露后迅速修复。这个事件本身并不代表 DeepSeek 比其他 AI 公司更不安全,但它发生在公司爆红的同一个月,因此被无限放大。 隐私政策是另一个争议焦点。DeepSeek 的隐私政策声明,用户数据存储在中国境内的服务器上。对欧盟《通用数据保护条例》、美国加州《消费者隐私法案》等数据保护法规而言,跨境数据流动和司法管辖是敏感问题。意大利数据保护局以不符合 GDPR 数据处理安全性为由,紧急封禁 DeepSeek 应用,并要求停止处理意大利用户数据。 隐私争议的核心并不是某一句话,而是数据主权边界。当模型训练数据、用户输入、推理日志和监管管辖分布在不同国家,任何单一承诺都难以覆盖全部场景。企业级用户因此在评估 DeepSeek 时,往往把“数据存储在哪里、谁可访问、删除流程是什么”放在基准分数之前。 此后,多个国家和地区采取了不同措施。美国联邦机构禁用 DeepSeek,参议院和众议院也出现限制提案;澳大利亚禁止在政府设备上使用;韩国多个政府部门屏蔽,数据保护机构暂停新下载;印度财政部禁止员工公务使用;中国台湾禁止公务机关使用。法国、荷兰、爱尔兰、捷克、德国等地也先后发起调查或限制。 这些监管行动并非完全一致。有的基于数据安全,有的基于“国家安全”担忧,有的则更多是政治姿态。中国外交部回应称,中国政府高度重视并依法保护数据隐私和安全,从来没有也不会要求企业以违法形式采集或存储数据,并反对泛化国家安全概念。双方的表述都带有各自立场,但都承认一个事实:AI 大模型已经成为数字主权的竞争载体。 安全争议并没有随热度消退。2026 年 5 月,有用户反映输入特殊字符后偶发返回不可预期内容,DeepSeek 回应称这是特殊字符引发的模型幻觉,不涉及隐私泄露;GitHub 上也有开发者提出训练数据泄露风险。这类事件与数据库暴露一样,说明开源模型公司的安全能力需要与产品扩张速度同步成长。 与此同时,市场选择却在朝另一个方向移动。OpenRouter 数据显示,美国企业调用中国 AI 的 Token 占比自 2026 年 2 月起突破 30%,峰值达到 46%,而 2025 年上半年仅约 4%。禁令和管制没有阻止开发者用脚投票,反而让“可访问、可替换、可部署”成为中国模型最重要的竞争力。 监管的碎片化正在形成新的合规成本。同一套模型权重,在不同市场要面对不同的数据本地化要求、审计义务和内容审查规则;即使模型可以自由下载,企业也要为每个市场准备不同版本的部署方案。开源降低了技术门槛,却把合规工程留给了用户。 芯片出口管制是另一个维度。2022 年起,美国限制英伟达最先进 AI 芯片对华出口;DeepSeek 早期依赖囤积的 A100,后来使用 H800,再后来 H800 也受到限制。2025 年 4 月,H20 被列入出口管制,英伟达被迫取消中国订单并计提约 45 亿美元损失。2026 年 6 月,美国商务部发布新指南,限制中国企业实体在境外购买和使用最先进 Blackwell 及 Rubin 架构芯片。 这些限制并没有让 DeepSeek 停止前进,反而加速了国产算力适配和自研硬件布局。2026 年,媒体报道 DeepSeek 启动自研 AI 推理芯片项目,投资规模约 70 亿美元,旨在减少对英伟达依赖。消息传出后,英伟达股价一度下跌约 2%。与此同时,DeepSeek 从 V4 开始全面适配华为昇腾 950PR,其单卡推理性能据称达到 H20 的 2.87 倍。 从全球视角看,安全与开放之间的边界仍在快速移动。开源模型可以被审查、被审计,也可能被滥用;闭源模型更容易控制使用条款,却把能力锁在少数公司手里。DeepSeek 的处境恰恰处在两者交叉点:它既是被监管者,也是全球开源基础设施的重要提供者。 芯片管制的悖论在于,它试图限制中国 AI 发展,却可能强化中国团队做效率优化和自主硬件的动机。DeepSeek 的低成本训练、开源工程组件和国产算力适配,都可以被理解为对管制环境的工程回应。当然,这种“倒逼”叙事不能掩盖实际损失:无法获得最先进芯片,意味着中国团队在模型规模、训练速度和前沿硬件协同上仍然面临硬约束。 ## 3.5 未来:开源与闭源、算法与算力、AGI 的下一站 DeepSeek 的未来,取决于它如何处理几组长期张力。 第一组张力是开源与商业可持续性。开源模型获得全球开发者和影响力,却很难直接转化为收入。DeepSeek 长期以低价 API 服务用户,梁文锋说过“我们的原则是不贴钱,也不赚取暴利”。2026 年 8 月,媒体报道 DeepSeek 将大幅上调 API 定价,原因是算力成本压力。这说明普惠愿景需要与基础设施成本找到平衡点。 V4 预览版发布时,Flash 输出价约为每百万 Token 0.28 美元,官方称输出成本较当时闭源旗舰低逾 99%。低价让高并发开发场景成为可能,也把“反复调用模型”变成 Agent 应用的默认行为。正是这种高频调用放大了成本压力,使价格调整成为必然。 第二组张力是算法效率与硬件前沿。DeepSeek 用少量 H800 实现了惊人成绩,但前沿模型仍需要大规模算力。自建数据中心、采购芯片和训练更大模型都需要巨额资金。2026 年,DeepSeek 完成首轮外部融资,投后估值约 500 亿美元;随后又启动第二轮融资,计划建设 GW 级数据中心并研发推理芯片。曾经“不融资”的公司,最终还是要进入资本市场的复杂游戏。 第三组张力是开放性与安全治理。开源权重让全球研究者和开发者受益,也让恶意使用更难被阻止。模型可能被用于虚假信息、自动化攻击、生物或网络武器开发等领域。国际社会还没有建立统一的开源模型安全框架。DeepSeek 作为全球最大开源权重模型提供方之一,必须同时回应技术社区的自由诉求和监管机构的治理要求。 如果只看技术指标,DeepSeek 已经在多个维度接近闭源前沿;如果看商业模式,它还需要证明低价 API、开源权重与自研硬件能够形成正循环。两种判断并不矛盾,只是分别回答了“能不能做出来”和“能不能做下去”。 第四组张力是中国市场与全球市场。DeepSeek 在中国拥有极高关注度和政策支持,但多国禁用和芯片限制削弱了它的国际扩张能力。未来它可能形成“中国市场为主、全球开源生态为辅”的双轨模式:通过开源让全球开发者使用,通过云服务和私有化部署在中国及部分发展中国家获得商业收入。 除此之外,模型生态的治理责任也在扩大。开源权重让第三方可以自由修改,但修改后的模型是否保留安全护栏、是否标注数据来源、是否继续遵守许可证,都需要生态规则来约束。DeepSeek 的答案不可能只是“开放就好”,而必须是一套可持续的社区协作、责任分担和商业回流机制。 从产业历史看,DeepSeek 最重要的遗产或许不是某个模型,而是重新定义了“追赶者”的可能性。它证明,在没有最先进芯片、没有巨额融资、没有庞大团队的条件下,一个组织仍然可以通过架构创新、工程优化和开放协作逼近前沿。这个结论对全球 AI 竞赛的参与者都有启示意义。 至于 AGI,DeepSeek 的目标从未改变。V4 的百万上下文、在线蒸馏、Agent 能力和推理效率,都是通向通用智能的阶段性步骤。但 AGI 不是只靠更大模型就能到达,它还需要世界模型、长期记忆、自主行动、多模态感知和可靠对齐。DeepSeek 在这些方向上已经有布局,但距离完整答案仍然遥远。 从短期看,V4-Flash 的 Agent 能力和百万上下文已经让“让模型完成多步骤任务”变得可用;从长期看,记忆、规划、工具调用与真实世界反馈仍需要新的突破。DeepSeek 的价值在于把 AGI 从口号拆成可以迭代的工程问题,而不是给出一个确定的时间表。 梁文锋曾说过,中国 AI 不可能永远处在跟随的位置,真实的差距是原创和模仿之差。DeepSeek 已经证明自己具备原创能力,但原创并不等于正确,更不等于可持续。它选择了一条艰难的道路:开源、低成本、年轻团队、效率优先。这条道路能否通向 AGI,取决于技术、资本、监管和全球地缘环境如何共同演进。 ## 3.6 V4-Flash 正式版与 OpenCode 的爆量 2026 年 4 月,V4 预览版把百万 Token 上下文变成开源模型的标准配置;三个月后,生产级 V4-Flash 正式版于 7 月 31 日上线。OpenCode 的 DeepSeek 实验室页面显示,正式版名称为 DeepSeek V4 Flash 0731,权重在 Hugging Face 以 openWeights 形式提供,上下文仍为 1M,输出扩展到 384K。官方描述强调增强的 Agent 能力与集成的 DSpark 投机解码,Terminal-Bench、NL2Repo、CyberGym、DeepSWE 等评测结果都指向同一个方向:它不只是更快的语言模型,而是为终端、代码库和工具调用优化的 Agent 模型。 真正让这版模型成为产业事件的,是开发者工具中的用量曲线。OpenCode 官方数据页更新于 2026 年 8 月 10 日,在 OpenCode Go 统计的 25 个模型中,DeepSeek V4-Flash 排名第一,Token 份额约 65.07%。统计窗口内累计约 1224.7 万次会话、203.4 万独立用户、130.25T Token,成本约 126.95 万美元,缓存命中率 96.2%,每百万 Token 成本约 0.01 美元。这里要特别说明,65.07% 是 OpenCode Go 自有口径下的份额,不是全球模型市场份额;但即使只看这一个平台,也足以说明一个开源模型如何在一个 Agent 工作流密集的产品中形成压倒性占比。 增速比总量更说明问题。按日 Token 约值看,7 月 30 日为 1.63T,8 月 1 日为 3.01T,8 月 5 日为 6.26T,8 月 9 日达到 8.31T;8 月 9 日单日会话约 47.87 万次。另一个容易被忽略的数字是 Token 构成:缓存 95.3%、输入 3.8%、输出 0.6%、推理 0.4%。高缓存命中意味着大量上下文被反复复用,这正是 Agent 编码工作流的特点:模型反复阅读同一仓库、同一文件、同一工具结果,真正新生成的 Token 只占很小一部分。缓存命中率高,既降低了单次成本,也让 65% 的 Token 份额成为可能。 这些数字也需要放在统计边界里理解。OpenCode Go 是面向开发者、以 Agent 编码为核心的订阅服务,它的用户天然偏好能处理长仓库、高频工具调用的模型;因此 V4-Flash 的高份额并不能直接外推为 DeepSeek 在所有 AI 应用中的份额。但它至少证明一件事:当模型同时具备开源权重、低成本和强工具能力时,Agent 产品可以迅速把采用率转化为真实用量。 从数据形态看,OpenCode 的统计还说明 Agent 工作流正在把 Token 消耗变成新的产品指标。开发者不再只看单次问答延迟,而是关心整个仓库、整个会话、整个团队每月的 Token 预算;模型之间的竞争也不再只是分数竞争,而是单位任务成本竞争。DeepSeek 之所以能在这一维度胜出,正是因为它同时压低了输入、输出和缓存成本。这会进一步推动模型厂商把成本结构作为公开卖点,而不是只谈能力上限。 另一个值得观察的信号是模型之间的替代速度。从 OpenCode 的 peers 数据看,V4-Flash 的 Token 量已经是同站第二名 V4-Pro 的十几倍,也远高于多家闭源旗舰。开发者之所以集中切换,既因为价格,也因为开源权重让切换没有平台锁定;这正是开源生态相对闭源生态最稳定的竞争壁垒。 OpenCode 的 peers 对比进一步放大了这种集中度。近期 Token 量上,DeepSeek V4-Flash 约 49T,V4-Pro 约 2.9T,GPT-5.6-Luna 约 1.3T,Mimo-V2.5 约 1.2T,GLM-5.2 约 571B。一个开源模型把同平台的其他模型远远甩在身后,已经不是“性能差不多所以顺手使用”能解释的,而是成本、上下文、开源权重和工具生态共同作用的结果。地区分布也显示这是一次全球性采用:中国大陆约 25.7%,美国约 13.3%,日本约 5.4%,中国香港约 4.9%,新加坡约 3.8%。 爆量迅速传导到商业规则。2026 年 8 月 7 日,OpenCode 合并 PR #40988,标题为“feat(go): promote DeepSeek V4 Flash usage”,把 DeepSeek V4 Flash 在 Go 套餐用量图中按 2 倍用量计算,并更新宣传横幅。社区随即出现“Go 套餐中 V4-Flash 按两倍用量计费或涨价”的讨论。这个 PR 像一面镜子:模型越受欢迎,服务商越需要用计费规则管理自己的成本;而 DeepSeek 本身也在 8 月被报道将整体上调 API 定价,原因是算力成本压力。 当然,这种集中也带来风险。当一个服务商把大部分算力预算押在一个模型上,模型定价、上游 API 限制或新版本兼容性都会直接影响产品体验。OpenCode 对 V4-Flash 单独调整计费,正是对这种依赖关系做出的市场化回应。 从产业史看,这次爆量的意义不亚于 R1 时刻。R1 改变的是人们对推理能力的认知,V4-Flash 改变的是人们对推理成本的认知。前者让开发者相信开源模型能做到,后者让开发者相信开源模型可以长期作为生产主力。两者叠加,才真正构成 DeepSeek 对 AI 产业的重塑。 V4-Flash 正式版与 OpenCode 的爆量,实际上把第 3 章讨论的几个趋势合并成了一次压力测试。开源权重降低了开发者的迁移成本,百万上下文让 Agent 可以长时间接管真实任务,低价推理让反复调用成为默认习惯;当使用量真正爆发,商业可持续性又成为新的约束。对开发者来说,这是最好的时代:前沿能力的接入成本降到几乎可以忽略。对模型厂商和服务商来说,这也是最直接的考验:普惠价格必须找到可持续的算力结构,否则用户用脚投票形成的优势,也会因为定价、限速和套餐规则的变化而重新洗牌。 本章涉及的人物细节、产业案例、安全事件和政策信息,主要来自 materials/raw_01_history.md、materials/raw_03_r1.md、materials/raw_06_ecosystem.md、materials/raw_07_governance.md、materials/raw_08_v4.md 和 materials/raw_09_v4_flash_opencode.md。部分海外监管措施仍处于提案、调查或政策调整阶段,书中按公开报道时点描述,最终以官方最新文件为准。OpenCode 的 65.07% Token 份额为该平台自有统计口径,不代表全球市场份额。 ---
配图 (可多选)
选择新图片文件或拖拽到此处
标签
更新文章
删除文章