后训练与对齐专题
专题定位
本专题用于串起 SFT 之后的后训练主线:先看为什么模型在 SFT 之后还会出现偏好错位,再看 PPO、DPO、GRPO 分别改的是哪一层问题,最后把偏好数据、评测和项目结论收成同一条对齐闭环。这里聚焦 SFT 之后的方法分化;如果还没有 SFT 基础,应先回监督微调专题。
Infra 层定位
后训练主要落在 L3-L5:L3 负责损失、采样、reference model 和训练运行时,L4 负责在线采样、推理服务与反馈回路,L5 负责偏好数据、评测、实验编排和交付。L1/L2 的显存、算子和通信成本会直接影响 PPO、DPO、GRPO 的可行性,因此最终结论不能只看对齐指标,还要记录系统代价。
推荐入口
推荐从 Part 02 导学 的后训练与对齐路线进入,先完成监督微调基础,再用 Part 02 资产表 定位 84、85、86 三个项目节。本专题适合按问题选择 DPO、GRPO 或在线流程,不要求先完整学习 PPO。
前置阅读
建议先掌握监督微调专题中的数据、训练循环和 LoRA 基础,再阅读 Part 02: 2.4 的偏好数据与对齐内容。进入项目前至少明确 preference pair / group 数据格式、reference model、奖励或偏好指标,以及训练和评测的隔离方式。
主学习线
Task1-6 是学习路线,指向 Part 02 的具体小节;最后一列的 01-06 是专题正文页,只负责解释和串联。
| Task | 学习内容 | 主学习线 | 专题正文 |
|---|---|---|---|
| Task1 | 为什么 SFT 之后还要对齐 | 14 | 01 Why Post-Training Alignment |
| Task2 | RLHF / PPO 的系统代价 | 14 | 02 RLHF and PPO System Cost |
| Task3 | DPO 与偏好优化 | 15 -> 84 -> 86 | 03 DPO and Preference Optimization |
| Task4 | GRPO 与 group-wise 对齐 | 16 -> 85 | 04 GRPO and Groupwise Alignment |
| Task5 | 偏好数据、在线优化与冲突评测 | 50 -> 51 -> 52 | 05 Preference Data and Evaluation |
| Task6 | 项目收口与采用建议 | 84 -> 85 -> 86 | 06 Project Decision and Delivery |
正文与跳转
先按上面的 Task1-6 走 notebook 主线;遇到“为什么 SFT 还不够”“PPO / DPO / GRPO 到底差在哪一层”时,再回来看对应的专题正文。想看汇总版就进 后训练与对齐正文,想按连续故事线走一遍就进 后训练与对齐深入阅读。
如果问题已经跨到别的专题: 监督微调专题 负责 SFT 前置,反向传播与训练机制专题 负责 alignment loss 的 backward 代价,显存优化专题 负责 PPO 等系统成本。
项目结论
推荐的实践闭环是 84 DPO 偏好项目 -> 85 GRPO 组内对齐项目 -> 86 在线 DPO benchmark。学习者最终应比较数据质量、训练稳定性、偏好或任务评测、显存与吞吐,而不是只比较训练 loss;在线项目还要额外记录采样、打分和更新链路的成本。
环境与验证
损失函数、数据格式和小规模离线验证可先用 CPU;完整 SFT、DPO、GRPO 训练通常需要 GPU,在线 benchmark 还需要可用的推理后端或服务接口。应固定数据切分、随机种子、reference 配置和评测集,并保存训练配置、指标曲线和最终决策。
