请叫我峰子:
感受VPS建站的乐趣。

Kimi K3 深度拆解:当 4% 的脑子,打了一场上限对决

开篇:一个尴尬的开局

2026 年,月之暗面因为算力不够,暂停了新用户的 Kimi K2 订阅服务。

这不是什么好事。一个被寄予厚望的国产大模型,走到这一步,不是因为技术不行,而是因为——算力太贵了。

但就在这个尴尬的节点上,月之暗面又做了一件让所有人意外的事情:放出了 Kimi K3。

2.8 万亿参数。其中,只有 1040 亿在训练时被激活。

换句话说,不到 4% 的脑子在工作,剩下 96% 躺平。

听起来像是在省钱?不。这恰恰是 Kimi K3 最核心、也最激进的故事。


一、4%:一场反直觉的赌局

大模型界的潜规则是:参数越多越强,激活越多越强。OpenAI 和 Anthropic 的路线都是——把所有参数拉满,算力砸进去,跑出上限。

月之暗面选了另一条路。

Kimi K3 拥有 2.8 万亿的总参数,但每次前向传播,只激活约 1040 亿。这是一个「MoE(混合专家)」架构,但不是普通意义上的 MoE——它用稀疏性做了一件更狠的事:让 4% 的参数,打出 100% 参数应该有的能力。

这就像一个人同时拥有 28000 个专家的知识库,但每次只请 1000 个专家上桌吃饭。听起来浪费,但好处是——推理成本暴降。

这就是 Kimi K3 的第一个信号:算力焦虑不是靠「堆更多」解决的,是靠「更聪明地少用」解决的。


二、三张牌:4% 是怎么做到不降级的?

如果只做稀疏激活,效果肯定打折。Kimi K3 用三件套技术把这条路走通了。

牌一:KDA 线性注意力

传统注意力机制的复杂度是 O(n²),序列越长,计算越重。KDA(Kernelized Attention for Dynamic scaling)把它降到了线性级别。

意义在哪?Kimi K3 的上下文长度是 256K,相当于 50 万汉字。用传统注意力算这个长度,贵到离谱。KDA 让长上下文不再是奢侈。

牌二:注意力残差

这是一个少有人关注的细节。模型在注意力计算中会丢失一部分信息,Kimi K3 通过注意力残差结构把这部分信息「补回来」,确保稀疏激活不会以丢失信息为代价。

翻译一下:省了算力,但没有省钱省到「变笨」的程度。

牌三:量化感知训练

推理时把模型权重从高精度压缩到低精度,能大幅降低显存占用和推理延迟。但传统做法是「先训练高精度模型,再量化」,这个过程中会损失精度。

Kimi K3 直接「训练时就考虑量化」,让模型天生适应低精度推理。推理成本进一步降低,精度几乎不降。


三、Moon Clip 优化器:20T 数据,跑出 40T 效果

如果说三件套是「省钱的技术」,那 Moon Clip 优化器就是「把钱花在刀刃上」的技术。

传统训练里,数据量和训练效果近似线性关系——想效果好,就喂更多数据。Moon Clip 通过改进优化器的梯度裁剪策略,让模型对「高质量数据」的利用效率翻倍。

月之暗面的说法是:20 万亿 token 的训练数据,打出了 40 万亿 token 的效果。

这不是魔法。核心逻辑是——很多数据是「低质量的」,喂了也白喂。Moon Clip 让模型在训练时更敏感地区分「值得学的数据」和「浪费时间的数据」,把算力花在真正有用的地方。


四、后训练:9 个老师,1 个学生

大模型的训练不是一步到位的。预训练之后,还有一个关键环节——「后训练」(post-training),决定模型最终的表现。

Kimi K3 的后训练策略很特别:9 个专业教师模型,同时在线,实时蒸馏。

不是先让 9 个模型各自输出答案,再汇总。而是在训练过程中,9 个教师同时给信号,学生模型实时整合。这就像 9 个专家同时上课,学生边听边学,而不是听完 9 节课再做笔记。

效果?

  • GPQA Diamond:93.5(科学推理,接近人类专家水平)
  • SWE-Marathon:42.0(代码开发长程任务)
  • WebDev Arena:1678 Elo(网页开发综合评测)

这些成绩放在 1040 亿激活参数的模型里,是顶级的。


五、回到那个开头:算力焦虑的出路在哪?

Kimi K3 的故事,本质上是一个关于「算力焦虑」的故事。

月之暗面暂停 Kimi K2 服务,是因为算力成本压不住了。但这并没有让他们放弃——而是逼出了 Kimi K3 这套「用 4% 的脑子,打 100% 的上限」的技术路线。

这不是个例。整个 AI 行业都在面临同一个问题:参数规模的增长,已经接近物理极限。再往上堆,不是钱的问题,是电的问题、散热的问题、环境的问题。

Kimi K3 给出了一条路:不靠堆参数,靠架构创新。

但这条路能走多远,现在还说不准。稀疏架构的效率优势是确定的,但上限有没有天花板,行业还在争论。


六、普通人怎么看?

如果你是普通用户,Kimi K3 的意义是什么?

短期:长上下文、强推理能力,让 Kimi 在文档分析、代码辅助、复杂问答这些场景里继续保持竞争力。你不用关心它是不是稀疏模型,你关心的是它能不能帮你干活。

中期:如果稀疏架构被更多模型跟进,AI 服务的推理成本会下降,意味着 AI 产品会更便宜、更普及。这可能是下一个 AI 应用爆发的底层驱动。

长期:算力瓶颈是 AI 行业绕不开的问题。谁能先找到「少用算力、多产出能力」的方案,谁就能在这场竞争里站到前面。Kimi K3 是目前这个方向上最值得关注的样本。


写在最后

2026 年的 AI 竞争,已经从「谁的参数多」变成了「谁更会过日子」。

月之暗面用 Kimi K3 告诉我们:算力焦虑的时代,效率就是核心竞争力。4% 的激活率,不是弱点,是武器。

问题是——这个武器能打多久?

时间会给出答案。


铁三角团队 · 峰哥 | write | tech

共同成长 💪

赞(0)
转载请注明:峰网博客 » Kimi K3 深度拆解:当 4% 的脑子,打了一场上限对决

登录

找回密码

注册