DAILY LESSON / 2026-07-23

算力受限,国产模型为何越做越大?

明明是先进算力受限的一方,国产模型却集体跨进万亿参数时代,能力逼近全球前沿。背后是算法架构、算力基建、工程化和商业闭环四条逻辑的乘法效应。

AIAI模型DeepSeekKimi科技产业AI动态

作者:C 哥·C哥介绍 →

难道没有人觉得很反常吗?中美 AI 模型的竞争越来越像一步爽文小说了,最近一两个月的国产模型简直就像开了挂一样,第一次如此密集地进入全球前沿区间。不仅仅能力突飞猛进,几乎都达到了仅次于 GPT 5.6 Sol 和 Claude Fable 的水平,发布节奏也明显加快。同时还集体跨进了万亿参数时代。DeepSeek V4 Pro,1.6 万亿参数。Qwen3.8-Max,2.4 万亿。刚发布的 Kimi K3,更是直接做到了 2.8 万亿。这种性能就连 OpenAI 的战略未来主管迪恩·鲍尔也说现在中国的前沿模型的能力绝不是通过蒸馏就能达到的,他们一定有一些核心的东西。

那么问题来了,我们明明是先进算力受限的一方。但现实完全反着走,参数越做越大,训练和迭代反而越来越快,为什么国产模型偏偏在最近集体跨线?今天我就来和大家讲讲背后的四大逻辑。这里提到的一些技术概念,我都会尽量用小白也听得懂的语言给大家解释一下。

先说算法。今天这批万亿级模型,主流采用的都是 MoE,也就是混合专家模型。这是 DeepSeek 在国内最先大规模应用的一种技术,可以把它想成一所拥有上百位专科医生的大医院。医院的医生总数非常多,但一个病人来看病时,不需要所有医生同时会诊。系统只会根据病人的问题,调动其中少数几个最合适的专家。模型也是一样。总参数量代表它拥有多大的知识容量和专业分工空间,但激活参数量更接近每处理一个 token 时,真正参与计算的模型规模。这让模型在拥有庞大知识容量的同时,保持了相对经济的计算成本。

比如 DeepSeek V4 Pro 在性能提升如此巨大的情况下,比上一代 3.2 模型,推理计算量竟然还低了整整四分之三,这让海外模型怎么玩,性能提升这么大,算力需求还下降了一大半。

当然 MoE 好是好,但还有个大问题。还拿医院来比喻,虽然每次只需要少量医生看病,但通信压力却被放大了,就像你看病需要挂号、查病历一样,MoE 需要在不同专家中进行高效的协调和通信。如果有些专家排长队,有些专家闲着,整个算力集群就要等最慢的那一批算力卡。专家越多、分布得越散,模型就越依赖更快的高速互联。

这正是我要聊的第二点,算力。我们不拼每个卡的计算能力,而是把成千上万的卡用高带宽、低延迟的互联组织成一台逻辑上的超大加速器。今年 WAIC 世界人工智能大会,至少八家国内厂商展出了超节点方案。所以你看,超节点和万亿参数 MoE模型,一个负责把计算变稀疏,一个负责把连接变致密。两边咬合之后,扩大参数量开始从一场昂贵的冒险,变成可以重复的工程方案。

国内团队过去迟迟没有把参数推到现在的规模,关键原因就是因为没有解决海量算力互联的问题,参数做大以后也未必划算。模型增加的容量,可能还抵不过通信和稳定性造成的损失。而现在国产路由、集群调度、低精度训练、故障恢复同时成熟以后,继续增加参数量才突然变成了一笔好生意。

Kimi K3 公布的技术细节很能说明这个转折。它使用了更稳定的潜空间专家架构和分位数负载均衡,让不同专家获得更均匀的任务;训练系统把专家并行做成完全均衡,尽量减少静态形状之外的等待;从后训练阶段开始就引入低精度量化感知训练,降低后续部署成本。官方给出的数据是,相比 K2,K3 的整体扩展效率提高了大约 2.5 倍。也就是说同样多增加一个参数,现在的 Kimi K3 比以前要获得 2.5 倍的性能提升。

当然还有一道容易被忽略的门槛,是数据。一个巨大参数量的模型如果吃不到足够多、足够多样的数据,新增的专家就可能训练不充分,参数再多也是空架子。而过去半年国产模型的训练数据量都在指数级提升,DeepSeek V4 的预训练数据超过 32 万亿 token,LongCat 2.0 超过 30 万亿。走到数十万亿 token 这个量级之后,国产模型在数据上的短板基本上已经被抹平了。

但这还解释不了,为什么几家公司会在同一时间做成。

这里我们就要看这条有效算力曲线。算力从来不只是芯片数量。真正能用于训练的算力,至少要乘上集群利用率、连续稳定运行时间、通信效率和每单位计算能处理的数据量。一万张卡买回来,不代表立刻拥有一万张卡的训练能力。如果每天都有机器掉线,卡与卡之间传一次数据要等很久,那账面算力再大也没用。中国没有在高端单卡性能上追平美国,但在另一条路上积累得非常快,那就是把芯片通过更强的系统工程,把它们组织成巨大的计算集群。