算力受限,国产模型为何越做越大
先进算力仍然受限,国产模型却集体迈入万亿参数。真正的变化,是一条新生产链跨过了临界点。
该文章来自"C哥聊科技"频道,欢迎关注以查看视频版本。
这轮国产模型爆发,最反常的不是能力追上来了,而是它们几乎在同一个时间,集体跨进了万亿参数时代。
DeepSeek V4 Pro,1.6 万亿参数。LongCat 2.0,1.6 万亿。Qwen3.8-Max 预览版,2.4 万亿。刚发布的 Kimi K3,更是直接做到了 2.8 万亿。
一年前,1 万亿参数还是少数团队才会碰的尺度。现在 1.6 万亿已经成了这批旗舰模型的起点,最高直接冲到了 2.8 万亿。
按最朴素的理解,模型越大,应该越吃算力。中国偏偏又是先进算力受限的一方。可现实完全反着走,参数越做越大,迭代反而越来越快。阿里公开披露,Qwen 曾经在三个月内连续更新三次。Kimi K3 在 Artificial Analysis 的智能指数上拿到 57 分,Claude Fable 5 是 60 分。差距还在,但国产模型已经第一次如此密集地进入全球前沿区间。
所以真正的问题来了。
算力越受限,模型为什么反而越做越大?如果这些团队早就能训练 2 万亿参数,为什么去年不做,前年也不做,偏偏在最近集体跨线?更关键的是,如果参数膨胀只是一个账面数字,为什么能力提升和发布速度也同时加快了?
很多人会立刻想到 MoE,也就是每次只激活少数专家。这个方向没错,却只回答了一半。MoE 已经存在很多年,解释不了为什么几家公司偏偏在现在一起把稀疏度和总参数推到这么高。
也有人认为,国内最近只是多了一批算力。可中国在先进 AI 集群上的总量仍然明显落后,多出来的硬件也解释不了为什么研发速度反而提升得更快。
我查完资料之后,看到的是一条已经咬合起来的新生产链。
模型这一端,超稀疏架构把总参数和单次计算拆开。硬件这一端,超节点和大规模集群把大量相对有限的芯片组织成有效算力。研发这一端,训练环境、数据管线和模型辅助研发又把一次昂贵训练,变成可以不断复用的生产平台。
模型侧把计算变稀疏,硬件侧把连接变致密,研发系统再把反馈变得更快。三者首尾相接,才同时制造了参数变大、能力变强和发布变快。
先把 2.8 万亿这个最吓人的数字拆开。
今天这批万亿级模型里,已经披露完整架构的代表,主流采用的都是 MoE,也就是混合专家模型。Qwen3.8-Max 目前仍是预览版,官方还没有公布它的激活参数和完整训练细节,所以这里不对它的计算规模做推断。
可以把它想成一所拥有上百位专科医生的大医院。医院的医生总数非常多,但一个病人来看病时,不需要所有医生同时会诊。系统只会根据病人的问题,调动其中少数几个最合适的专家。
模型也是一样。总参数量代表它拥有多大的容量和专业分工空间,激活参数量更接近每处理一个 token 时,真正参与前向计算的模型规模。
DeepSeek V3 的总参数是 6710 亿,每个 token 激活大约 370 亿。到了 DeepSeek V4 Pro,总参数增加到 1.6 万亿,但激活参数大约是 490 亿。总参数扩大了 2.4 倍,单次激活规模只增加了三成左右。
LongCat 2.0 也是 1.6 万亿总参数,平均只激活约 480 亿。Kimi K3 的总参数达到 2.8 万亿,但每次只路由到 896 个专家中的 16 个。Kimi 没有公布可以直接对照的精确激活参数量,所以不能把 16 除以 896 简单当作它的真实计算比例,但这个架构方向已经很清楚了。
国产模型这轮所谓的“参数爆炸”,首先是总容量爆炸,不是每一个 token 的计算量也跟着等比例爆炸。参数、计算量和时间成本,这三个过去高度绑定的东西,正在被稀疏架构逐渐拆开。
这些参数依然非常昂贵。更多专家带来更大的显存和存储压力、更复杂的通信、更困难的负载均衡。训练中任何一个环节出错,代价都会被整个集群放大。MoE 的概念很多年前就有,真正卡住行业的,是能不能让成千上万张卡把这些专家稳定地跑起来。
当一个 token 被送进模型,它需要被高速分发到不同机器上的专家,再把结果收回来。只要路由稍微不均衡,有些专家排长队,有些专家闲着,整个集群就要等最慢的那一批卡。通信拥塞、单卡故障、显存碎片、训练中断,任何一个问题都可能让理论上的低成本,变成现实中的低效率。
这里还有一个很关键的变化。稠密模型的主要压力是计算,极端稀疏模型把单次计算压下去以后,跨卡通信在整个系统里的占比反而上升了。专家越多、分布得越散,模型就越依赖一个更大、更快的高速互联域。
这正是超节点开始集中出现的原因。它的核心作用,是用高带宽、低延迟的互联,把几十、几百甚至上千张卡组织成一台逻辑上的超大加速器。今年 WAIC,至少八家国内厂商展出了超节点方案。华为 Atlas 950 以 64 卡为基本单元,现场展示了 1024 卡形态,官方规划最大支持 8192 张卡高速互联。
这里不能倒推说,Kimi、Qwen 或 DeepSeek 一定用了某一款没有披露的超节点。真正重要的信号是,模型架构和硬件架构正在朝着同一个方向演进。Kimi K3 每个 token 要从 896 个专家中选择 16 个,官方也建议部署在至少 64 张加速卡构成的超节点上。
所以你看,超节点和万亿参数模型不是两条互不相干的新闻。一个负责把计算变稀疏,一个负责把连接变致密。两边真正咬合之后,扩大专家池才开始从一场昂贵的冒险,变成可以重复的工程方案。
国内团队过去迟迟没有把参数推到现在的规模,关键原因就是做大以后未必划算。模型增加的容量,可能还抵不过通信和稳定性造成的损失。路由、并行、低精度训练、故障恢复和集群调度同时成熟以后,继续增加专家数量才突然变成一笔好生意。
Kimi K3 公布的技术细节很能说明这个转折。它使用了更稳定的潜空间专家架构和分位数负载均衡,让不同专家获得更均匀的任务;训练系统把专家并行做成完全均衡,尽量减少静态形状之外的等待;从后训练阶段开始就引入低精度量化感知训练,降低后续部署成本。官方给出的数据是,相比 K2,K3 的整体扩展效率提高了大约 2.5 倍。
DeepSeek V4 做的是同一方向的另一种推进。在 100 万上下文长度下,V4 Pro 的单 token 推理计算量只有 V3.2 的约 27%,KV 缓存降到约 10%。模型的总容量更大了,但处理长上下文的单位成本反而被压下去了。
还有一道容易被忽略的门槛,是数据。一个巨大的专家池如果吃不到足够多、足够多样的数据,新增专家就可能训练不充分,参数再多也是空架子。DeepSeek V4 的预训练数据超过 32 万亿 token,LongCat 2.0 超过 30 万亿。走到数十万亿 token 这个量级之后,更大的专家池才更有机会形成真实分工,而不是简单重复。
这一点非常关键。过去大家是在算力允许的范围里决定模型有多大,现在工程能力开始改变“多大才划算”这条边界。只要每次激活的专家仍然可控,新增一批没有同时工作的专家,就能够增加模型的知识容量和专业分工,却不必让每次计算的成本同步翻倍。
这就回答了第一个问题。国产模型学会了用相对有限的单次计算,管理一个大得多的参数空间。
但这还解释不了,为什么几家公司会在同一时间做成。
这里就要看第二条曲线,有效算力。
算力从来不只是芯片数量。真正能用于训练的算力,至少要乘上集群利用率、连续稳定运行时间、通信效率和每单位计算能处理的数据量。
一万张卡买回来,不代表立刻拥有一万张卡的训练能力。如果每天都有机器掉线,卡与卡之间传一次数据要等很久,整个任务隔几天就要从检查点恢复,那么账面算力再大,也只是昂贵的机房库存。
过去三年,中国没有在高端单卡性能上追平美国,但在另一条路上积累得非常快,那就是用更多可获得的芯片、更大的高速互联和更强的系统工程,把它们组织成可用的集群。
美团公开的数据很有代表性。它从 2023 年千卡规模的国产集群起步,三年后已经扩展到 5 万张国产加速卡。LongCat 2.0 就是在这个集群上从零训练的,处理了超过 30 万亿 token。它的月均日故障率降低了 70% 以上,模型算力利用率提升到原来的 1.5 倍,稳定训练吞吐超过每天 1 万亿 token。
这几个数字比“有多少张卡”更重要。因为它说明国产芯片不再只是可以把模型跑起来,而是开始能够支撑万亿参数模型持续训练。
Kimi K3 上线之后发生的一件事,也很能说明现在的真实状态。发布 48 小时内,请求量就逼近了现有集群上限,月之暗面不得不暂时停止新的消费者订阅。
这件事证明的不是国产模型从此不缺算力了,恰恰说明算力依然稀缺。真正的变化,是瓶颈正在迁移。过去的问题是模型能不能训练出来,现在模型已经能够训练出来,新的压力变成了爆发之后,能不能为海量用户稳定提供服务。
算力约束没有消失,它只是被更高的系统效率推到了下一道关口。
另一边,阿里在 2025 年宣布,未来三年投入至少 3800 亿元建设云和 AI 基础设施。国内公开的万卡、数万卡集群也在不断增加。这里必须严谨一点,我们不能因为某家公司拥有某种集群,就推断某个具体模型一定使用了这些硬件。很多团队并没有完整披露训练芯片和成本。
把整个行业放到时间线上看,逻辑非常清楚。2023 年到 2025 年,是芯片采购、集群建设、互联改造和训练系统打磨的投入期。到了 2026 年,这些持续两三年的投入开始集中结成果。
一批模型挤在相近的发布窗口,不代表几家公司在最近几个星期才突然开始训练。它们是在相近的产业周期里立项、扩建、试错和迭代,最后又在相近的时间跨过稳定性门槛。
所以大家看到的是“模型突然集体出现”,水面之下却是持续了几年的基础设施建设。它更像一片竹林。雨后冒出来的竹笋看似是一夜长成的,地下的根系其实早已连了很多年。
接下来是第三个问题。即使参数能做大、集群能跑稳,为什么能力提升和发布速度也会一起加快?
因为今天做大模型,已经越来越不像手工打造一个孤立作品,而是在经营一套研发平台。
第一代模型最贵的,不只是那一次预训练,还包括数据清洗、分词器、训练框架、并行策略、评测系统、强化学习环境和部署工具。过去,每做一代模型,很多环节都要重新试错。现在,这些基础设施可以复用,底座参数可以继续训练,编程、推理、智能体等不同能力也可以并行推进,再统一回到同一个版本里。
所以,一家公司推出三个模型,并不需要从零训练三次。更常见的情况,是一个更强的底座,加上一套共享的数据和训练平台,再派生出高速版、深度推理版、编程版和不同成本的服务版本。
真正加速能力进步的,是后训练已经开始工业化。
DeepSeek V4 的训练系统可以同时运行数十万个隔离沙箱,让模型在真实工具、代码和复杂任务里反复尝试。LongCat 此前也公开过上万个训练环境,覆盖二十多个领域。过去工程师人工整理一批题目、检查一批答案,现在系统能够让模型持续执行任务、得到反馈、定位失败,再把失败样本送回训练。
模型能力不再只取决于预训练时看过多少文本,还取决于后面能进行多少轮高质量实践。
推理阶段也在发生变化。研究已经证明,在合适的问题上,把计算动态分配给更困难的步骤,比机械地生成更多答案高效得多。在相同计算预算下,一个较小但会分配思考资源的模型,甚至可能胜过大很多的模型。
因此,今天的能力提升并不只来自“再堆一倍训练算力”。它来自四个杠杆一起用力。更大的专家容量,让模型装得下更多能力;更高的集群利用率,让同样的卡产出更多有效 token;更自动化的训练环境,让每次实验获得更密集的反馈;更聪明的推理计算,让模型把算力花在真正困难的地方。
还有一个加速器正在形成闭环,模型开始参与下一代模型的研发。
Kimi 团队披露,在 K3 研发后期,早期版本的 K3 已经承担了团队大部分算子优化工作。模型可以辅助写训练代码、生成测试、发现失败模式、整理数据和优化底层算子。模型每强一代,研发下一代所需的人力和实验时间就可能进一步下降。
这也是为什么最近的迭代速度,看起来不再是线性增长。我们过去习惯认为,资源少的一方只能更慢地追赶。但当资源的使用效率、研发自动化程度和实验反馈速度同时提高时,追赶速度并不由芯片数量单独决定。
可以把一家模型公司的有效研发能力写成一个乘法公式:可用硬件峰值,乘以集群利用率,乘以单 token 的算法效率,乘以数据效率,乘以自动化实验的并行度,再乘以推理阶段的计算效率。
中国在第一个数字上仍然落后,但后面几个乘数在最近两三年一起提高了。任何一项提升百分之几十,单看都不像革命。可它们相乘之后,研发产出就可能翻几倍。
现在再看国产模型最近的集体跃迁,整条因果链就连起来了。
超稀疏架构成熟,让模型可以用四五百亿级别的激活规模,驾驭一两万亿甚至更大的总参数空间。国产集群成熟,让原本分散、容易中断的卡,变成可以连续训练数十万亿 token 的有效算力。研发平台和自动化后训练成熟,又让同一个底座能够更快地产生新能力和新版本。
参数变大、能力变强、发布变快,看起来是三个现象,其实是同一套生产方式成熟后的三个结果。
这套解释也给我们一个重要的边界。国产模型并没有因此在总算力上超过美国,Kimi K3 接近 Fable 5,也主要体现在智能体、编程和知识工作等公开评测上,并不等于所有能力、所有产品体验都已经全面追平。模型参数越大,也绝不自动代表模型越聪明。
但如果只盯着这些限制,就会错过真正重要的变化。
第一轮 DeepSeek 时刻,证明的是一家中国团队可以用更高的效率,做出接近世界前沿的模型。
而今天正在发生的第二轮变化,证明的不是某一家公司又创造了一次奇迹。它证明超稀疏架构、国产集群、自动化训练和模型辅助研发,正在从少数团队的绝活,变成整个行业可以复制的生产能力。
第一次让世界震动的,是效率奇迹。
第二次真正值得关注的,是效率奇迹正在被工业化。
所以我认为,最近这批 1.6 万亿、2.4 万亿、2.8 万亿参数的模型,最重要的并不是数字有多吓人。它们共同传递了一个信号:中国大模型产业正在从“偶尔做出一个爆款”,进入“持续生产前沿模型”的阶段。
当奇迹变成产线,竞争才真正开始。
我是C哥,点赞关注,咱们下期见。
核心事实与资料来源(不口播)
- Kimi K3 官方技术说明:2.8T 总参数、16/896 专家路由、Stable LatentMoE、量化训练、扩展效率与模型参与算子优化等信息。
https://www.kimi.com/zh-cn/blog/kimi-k3 - Qwen Cloud 官方页面确认 Qwen3.8-Max-Preview 已上线;2.4T 参数来自千问官方发布口径,完整技术细节尚未公布。
https://docs.qwencloud.com/token-plan/personal/token-plan-personal-overview
https://www.ithome.com/0/978/730.htm - 美团 LongCat 2.0 官方发布:1.6T 总参数、平均激活约 48B、超过 30T 训练 token、5 万张国产加速卡、集群稳定性与吞吐数据。
https://www.meituan.com/news/NN260630164005904 - DeepSeek V4 官方发布说明:模型版本、上下文与服务信息。
https://api-docs.deepseek.com/news/news260424/ - DeepSeek V4 官方模型页和 Hugging Face 技术解读:1.6T/49B、超过 32T 训练 token、长上下文效率与大规模沙箱系统。
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
https://huggingface.co/blog/deepseekv4 - 阿里巴巴 2025 年官方公告:未来三年投入至少 3800 亿元建设云计算和 AI 基础设施。
https://www.alibabagroup.com/en-US/document-1830678592242057216 - 阿里巴巴 2026 财年公开信:三个月内更新三次 Qwen,用于交叉验证研发节奏确实在加快。
https://home.alibabagroup.com/en-US/document-1993785120221298688 - 华为昇腾 950 超节点官方资料:64 卡基本单元、WAIC 展出的 1024 卡形态和最大 8192 卡高速互联规划。
https://www.huawei.com/cn/news/2026/7/atlas-950-superpod
https://www.huawei.com/cn/news/2026/3/mwc-superpod-ai - 第一财经 WAIC 现场报道:至少八家国内厂商展示超节点产品,用于说明算力基础设施正在从单卡竞争转向系统竞争。
https://www.yicai.com/news/103283362.html - 美联社关于 Kimi K3 暂停新订阅的报道:发布后 48 小时需求逼近现有算力容量上限。
https://apnews.com/article/4c66a2e0f557ce79d3cc2d769c9a6226 - 美团 LongCat-Flash-Thinking-2601 技术报告:上万个训练环境、20 多个领域和异步训练系统。
https://arxiv.org/abs/2601.16725 - Switch Transformer 论文:MoE 规模化的早期代表性研究,以及通信、稳定性等工程问题。
https://arxiv.org/abs/2101.03961 - Epoch AI 关于算法进步的研究:固定性能所需计算量长期快速下降,用于说明算法效率是独立于芯片数量的关键乘数。
https://arxiv.org/abs/2403.05812 - 测试时计算扩展研究:动态分配推理计算在部分任务上可以显著提高计算效率。
https://arxiv.org/abs/2408.03314 - Artificial Analysis 对 Kimi K3 的独立评测:智能指数、智能体任务和与全球前沿模型的相对位置。
https://artificialanalysis.ai/articles/kimi-k3-achieves-3-in-the-artificial-analysis-intelligence-index-comparable-to-opus-4-8-and-gpt-5-5/ - 2025 年全球 AI 超算数据集:在其可观测样本中,美国约占总性能 75%,中国约占 15%,用于说明总算力差距仍然存在。
https://arxiv.org/abs/2504.16026
口径说明(不口播)
- “总参数”“激活参数”“专家路由比例”不是同一个概念。Kimi K3 未公开可直接横向比较的精确激活参数量,正文没有把 16/896 当成激活参数占比。
- 公开集群规模只能证明国内有效算力供给正在提升,不能据此反推某个模型使用了某种具体芯片。正文已明确区分公开事实与行业判断。
- “接近全球前沿”限定于公开评测中的智能体、编程和知识工作等能力,不代表所有模态、可靠性、上下文体验和商业产品已经全面持平。