POST-TRAINING · CHANGELOG
已理解 0/23
Issue #0 · 起点问题

模型是怎么学会讲道理的?

这是一份用问题驱动的方式讲解后训练(Post-Training)的交互课。23 种方法, 没有一种是凭空发明的——每一种都是对上一种方法局限的修复,修复完又带来新的局限, 像一部真实的技术 changelog。跟着"问题 → 解法 → 遗留问题"往下点,你会看清整条演进脉络。

怎么读这页

每张卡片就是一个 issue:先读红色的"问题", 再点"揭示解法"看这个方法怎么解决它——公式、代码、训练数据长什么样,都会展开。 卡片底部的红色"遗留问题"就是它没解决的部分,点一下会跳到解决这个新问题的下一个方法。 公式看不懂也没关系,每张卡片都配了一行"类比",用大白话讲清楚核心思路。

问题 / 局限 已解决 / 方法本身 公式 / 类比 关键数字 / 名称

全局地图 — 一个问题分出的三条演进主线

Issue #0 起点问题 SFT ① 偏好对齐 RLHF→DPO→IPO/KTO /ORPO/SimPO ② 自我提升/蒸馏 RFT→STaR→SPIN /OPD ③ 推理·可验证RL RLVR→GRPO→DAPO →GSPO/CISPO/熵控 点击任一分支跳转 · 或直接向下滚动阅读
根据 100apps/post_train 仓库整理 · 内容截至 2026.07 · 代码片段为教学简化版,完整可运行版本见仓库 posttrain_demo.py