十三年里,预训练的内核从没变过:预测下一个 token。 变的是怎么表示、怎么连接、怎么分配算力、怎么把参数和计算解耦。 下面这条曲线上的每个节点,在仓库里都有一个能在你笔记本上跑起来的最小实现。
先说清楚:Kimi K3 和 Qwen 3.8 目前没有公开发布。 截至 2026 年 7 月,公开可查的最新一代是 Kimi K2.5(2026.1)与 DeepSeek-V4(2026.6)。 这不影响学习价值——架构范式在小版本迭代之间是稳定的。
| 模型 | 时间 | 规模 | 关键技术 |
|---|---|---|---|
| DeepSeek-V3 | 2024.12 | 671B / 37B 激活 | MLA、DeepSeekMoE、无辅助损失负载均衡、MTP、FP8 训练;14.8T token,约 278.8 万 H800 卡时(≈550 万美元) |
| Kimi K2 | 2025.7 | 1.04T / 32B 激活 | MLA、384 专家 top-8、Muon + MuonClip;15.5T token;报告 MTP 无收益故未采用 |
| Qwen3 | 2025.5 | 235B / 22B 激活 | 36T token、119 语种、128 专家 top-8(无共享专家)、全局批次负载均衡;三阶段预训练;强到弱蒸馏 |
| Kimi K2.5 | 2026.1 | — | 在 K2 基础上加入多模态(MoonViT-3D) |
| DeepSeek-V4 | 2026.6 | — | 流形约束超连接(mHC)、混合注意力(压缩稀疏 + 重压缩)、采用 Muon、百万级上下文 |
三条能被验证的趋势:
稀疏化是主线。激活比从 DeepSeek-V3 的 5.5%(37/671)降到 Kimi K2 的 3.1%(32/1040)。
注意力持续被压缩。MHA → GQA → MLA → 压缩稀疏注意力,每一步都是为了长上下文的推理成本。
优化器终于动了。Adam 统治十年后,Muon 于 2025 年由 Kimi K2 完成万亿级验证,2026 年被 DeepSeek-V4 采用。