MoE 模型的一个参数配置
2.8 万亿总参数,推理时只激活 1040 亿。这个数字本身没有技术上的突破——MoE 路线从 2022 年就开始这么做了。但 Kimi K3 做对了一些细节,让它在中文评测榜单上走到了第一梯队。
三个关键设计
KDA 线性注意力:把标准注意力的 O(N²) 复杂度降到 O(N),长上下文推理速度提升显著。和 Qwen3 走的是同一条技术路线。
注意力残差:让 MoE 层之间的信息流动更稳定。训练过程中,注意力机制不再因为门控函数的稀疏性而丢失局部上下文,这在长文本摘要和代码生成中差异明显。
量化感知训练:不是训练完再量化,而是在训练中嵌入量化误差约束。这比传统 PTQ(训练后量化)精度高约 2-3 个百分点,推理延迟和显存占用更低。
训练数据
Moon Clip 优化器,号称 20T 数据用出 40T 效果。月之暗面没有公开具体的数据配比和过滤流程,但从评测结果看,在代码生成(SWE-bench)和多语言理解(GPQA Diamond)上,MoE 模型用较少的激活参数量达到了 Dense 模型相当的水平。
后训练
9 个专业教师模型 × 多教师在线策略蒸馏。这个设计解决了 MoE 模型”学生模型不知道从哪个老师学什么”的问题——在线策略指每个训练步根据当前批次的数据分布动态选择最优教师权重,而不是静态混合。
评测结果
| 评测集 | 分数 |
|---|---|
| GPQA Diamond | 93.5 |
| SWE-bench Marathon | 42.0 |
| WebDev Arena | 1678 Elo |
这些分数在中文 MoE 模型中属于领先水平。但需要注意:这些都是月之暗面自己跑的数据,没有第三方独立评测验证。
一个矛盾
月之暗面在发布 Kimi K3 的同一天,因为算力资源不够暂停了新用户订阅。这个细节比产品本身更有意思——一家以”无限上下文”为卖点的公司,被自己的算力需求逼到了暂停新用户的程度。这说明大模型的算力瓶颈不是技术问题,是经济问题。
铁三角团队 · 峰哥 | write | tech
共同成长 💪

峰网博客