2013 → 2026 · 13 个可运行 demo

预训练演化史How LLM Pre-training Got Here

十三年里,预训练的内核从没变过:预测下一个 token。 变的是怎么表示、怎么连接、怎么分配算力、怎么把参数和计算解耦。 下面这条曲线上的每个节点,在仓库里都有一个能在你笔记本上跑起来的最小实现。

点击节点跳到对应里程碑 纵轴为示意,非实测 loss
loss 年份 →

今天的 SOTA

先说清楚:Kimi K3 和 Qwen 3.8 目前没有公开发布。 截至 2026 年 7 月,公开可查的最新一代是 Kimi K2.5(2026.1)与 DeepSeek-V4(2026.6)。 这不影响学习价值——架构范式在小版本迭代之间是稳定的。

模型时间规模关键技术
DeepSeek-V32024.12 671B / 37B 激活 MLA、DeepSeekMoE、无辅助损失负载均衡、MTP、FP8 训练;14.8T token,约 278.8 万 H800 卡时(≈550 万美元)
Kimi K22025.7 1.04T / 32B 激活 MLA、384 专家 top-8、Muon + MuonClip;15.5T token;报告 MTP 无收益故未采用
Qwen32025.5 235B / 22B 激活 36T token、119 语种、128 专家 top-8(无共享专家)、全局批次负载均衡;三阶段预训练;强到弱蒸馏
Kimi K2.52026.1 — 在 K2 基础上加入多模态(MoonViT-3D)
DeepSeek-V42026.6 — 流形约束超连接(mHC)、混合注意力(压缩稀疏 + 重压缩)、采用 Muon、百万级上下文

三条能被验证的趋势:

稀疏化是主线。激活比从 DeepSeek-V3 的 5.5%(37/671)降到 Kimi K2 的 3.1%(32/1040)。

注意力持续被压缩。MHA → GQA → MLA → 压缩稀疏注意力,每一步都是为了长上下文的推理成本。

优化器终于动了。Adam 统治十年后,Muon 于 2025 年由 Kimi K2 完成万亿级验证,2026 年被 DeepSeek-V4 采用。