ARTICLE / 2026-07-29

Kimi K3登顶开源第一,靠的是把浪费逼到墙角

连夜读完47页技术报告,Kimi K3没有一招制胜的魔法,它只是让信息、专家、训练和算力都不再白跑。

口播文案 Kimi K3国产大模型开源模型AI Agent

作者:C 哥·C哥介绍 →

该文章来自"C哥聊科技"频道,欢迎关注以查看视频版本。

K3 的“魔法”,是把大模型里的每一种浪费都逼到了墙角——信息不再堵,专家不再闲,训练不再空转,模型甚至被放进五千多万个沙盒里练习真实工作。

这,就是它登顶开放权重第一的真正原因。

Kimi K3 刚刚放出了 47 页技术报告,我连夜全部读完了。架构、训练、算力调度、强化学习、上线部署,他们几乎把自己的家底扒了个精光。

之前我那条“国产模型为什么突然集体跃迁”的视频彻底火了。里面有一个核心判断:中国模型追赶前沿,靠的已经不只是一张更强的卡,而是把每一滴算力都榨出来。

K3 这份报告,直接把这句话画成了施工图。

整整 47 页,我看到的其实就四个字:消灭浪费。

第一种浪费,信息堵车。

让普通模型读一百万 token,就像开一场几千人的全员会。每来一句新发言,你都得把前面一天一夜的内容重新过一遍,才知道他在回应谁、跟什么有关。会议越长,重复计算越夸张。

K3 把它改成了“动态纪要加定期复盘”。平时新发言只需要对照一份实时更新的纪要,不必每次重听全场;每过几轮,再把全部内容串起来校准一次。

前者叫 KDA,后者叫全局注意力。好处就一个:材料可以很长,但不用每来一句都从头算。

但看得长,还不等于记得住。

K3 有 93 层,就像 93 个人排队传话,越传越失真。所以它把前面各阶段的记录放进共享档案柜,后面的人可以直接回查,不只听上一个人转述。这叫注意力残差。

一个少重算,一个少传错,K3 才把一百万 token 的上下文真正做到了可用。

第二种浪费,专家摸鱼。

K3 里有 896 个专家,但一个问题来了,只叫其中 16 个干活。

问题是,如果所有任务都冲向几个热门专家,其他专家闲着,整套系统还是得等最忙的那一批。

K3 像管理 896 个服务窗口。它先把一大摞原始材料压缩成一份关键摘要,再观察每个窗口的排队情况:热门窗口提高门槛,冷门窗口降低门槛,让任务自动分散。

前台分匀以后,后台还会动态复制繁忙专家,保证每张算力卡拿到一样多的活。这样就不会出现一张卡忙到冒烟,旁边十张卡集体喝茶。

这几套技术分别叫潜空间专家、分位数负载均衡和 MoonEP。

术语听起来很复杂,干的却是最朴素的一件事:896 个专家,一个都不许白养;每一张卡,一秒钟都尽量别等。

所以 K3 虽然有 2.8 万亿参数,每次真正干活的只有 1042 亿。报告给出的结果是,整体扩展效率比 K2 提高了大约 2.5 倍。

第三种浪费,是让模型只会刷题。

这是整份报告里最夸张的部分。

K3 的训练和评测,一共创建了 51,219,741 个沙盒,使用了 150 多万个环境镜像。

五千多万个沙盒,相当于五千多万个不会影响现实世界的虚拟办公室。

里面有模拟的 Gmail、Notion、Slack 和 Canvas。模型要在里面收邮件、查资料、写代码、改文件,还要处理连续几天发生的一连串事件。一次任务,可能调用几千次工具,积累几百万 token。

它也不能自己说一句“完成了”就交差。系统会直接查现场:邮件到底发对没有,文件到底生成没有,程序到底跑起来没有。

早期实验里,模型的一些意外操作,甚至把传统容器搞出了内核崩溃和死锁。团队只好给它换上隔离更强的微型虚拟机,既让它大胆折腾,又不能把训练系统一起带崩。

这哪里是在做题?

这分明是在让 AI 上班。做错了返工,做对了得分,想钻空子还会被抓。

连训练任务本身都开始自动生长。Agent 会自己上网探索,把知识拆成一棵越来越细的树,再从论文、网页和代码仓库里生成新任务、验证新答案。

模型既是学生,也开始参与出题。

第四种浪费,是模型练成以后再强行减肥。

很多模型训练时大手大脚,发布前才临时压缩。就像运动员平时穿跑鞋,比赛前突然换成木屐,体重是轻了,动作也全变形了。

K3 从后训练开始,就直接穿着真正上场的“鞋”训练。专家权重用 4 位精度,运行时的数据用 8 位精度,让模型提前适应低精度带来的误差。

这叫量化感知训练。

长任务也一样。一个编程任务可能已经积累了 40 万 token,这一轮只新增 4000 个。K3 会尽量保留前面的计算结果,只处理新来的部分,而不是每次都从第一页重新读。

模型越大,真正烧钱的往往不是一次思考,而是同一件事被重复计算一万遍。

所以你现在再看 K3,就会发现它根本没有一招从天而降的绝世武功。

它只是让信息少绕路,让专家少闲着,让算力少等待,让模型少刷假题,让上线少返工,让已经算过的东西少算一遍。

每一项单独看,都不像奇迹。

但这些效率乘在一起,就把一个 2.8 万亿参数的庞然大物,推到了开放模型的最前面。

我看完这份报告最大的感受是:K3 不只是一个更大的模型,它更像一家管理极其严密的超级公司。

896 个专家不许摸鱼,五千多万个虚拟办公室不停实习,算力卡之间谁也不能干等,连模型将来穿什么鞋上场,都在训练时提前适应。

先进算力受限从来不是优势。但当你没有足够多的资源替浪费买单,消灭浪费本身,就会被逼成一种系统能力。

榜单第一迟早会换人。

但让每一张卡、每一个参数、每一次试错都尽量不白跑,这种能力没有那么容易被超过。

大模型的智商写在榜单上,一家模型公司的成熟度,写在它消灭了多少浪费里。

我是 C哥,点赞关注,咱们下期见。