Skip to content

后训练与对齐专题

专题定位

本专题用于串起 SFT 之后的后训练主线:先看为什么模型在 SFT 之后还会出现偏好错位,再看 PPO、DPO、GRPO 分别改的是哪一层问题,最后把偏好数据、评测和项目结论收成同一条对齐闭环。这里聚焦 SFT 之后的方法分化;如果还没有 SFT 基础,应先回监督微调专题。

Infra 层定位

后训练主要落在 L3-L5:L3 负责损失、采样、reference model 和训练运行时,L4 负责在线采样、推理服务与反馈回路,L5 负责偏好数据、评测、实验编排和交付。L1/L2 的显存、算子和通信成本会直接影响 PPO、DPO、GRPO 的可行性,因此最终结论不能只看对齐指标,还要记录系统代价。

推荐入口

推荐从 Part 02 导学 的后训练与对齐路线进入,先完成监督微调基础,再用 Part 02 资产表 定位 84、85、86 三个项目节。本专题适合按问题选择 DPO、GRPO 或在线流程,不要求先完整学习 PPO。

前置阅读

建议先掌握监督微调专题中的数据、训练循环和 LoRA 基础,再阅读 Part 02: 2.4 的偏好数据与对齐内容。进入项目前至少明确 preference pair / group 数据格式、reference model、奖励或偏好指标,以及训练和评测的隔离方式。

主学习线

Task1-6 是学习路线,指向 Part 02 的具体小节;最后一列的 01-06 是专题正文页,只负责解释和串联。

Task学习内容主学习线专题正文
Task1为什么 SFT 之后还要对齐1401 Why Post-Training Alignment
Task2RLHF / PPO 的系统代价1402 RLHF and PPO System Cost
Task3DPO 与偏好优化15 -> 84 -> 8603 DPO and Preference Optimization
Task4GRPO 与 group-wise 对齐16 -> 8504 GRPO and Groupwise Alignment
Task5偏好数据、在线优化与冲突评测50 -> 51 -> 5205 Preference Data and Evaluation
Task6项目收口与采用建议84 -> 85 -> 8606 Project Decision and Delivery

正文与跳转

先按上面的 Task1-6 走 notebook 主线;遇到“为什么 SFT 还不够”“PPO / DPO / GRPO 到底差在哪一层”时,再回来看对应的专题正文。想看汇总版就进 后训练与对齐正文,想按连续故事线走一遍就进 后训练与对齐深入阅读

如果问题已经跨到别的专题: 监督微调专题 负责 SFT 前置,反向传播与训练机制专题 负责 alignment loss 的 backward 代价,显存优化专题 负责 PPO 等系统成本。

项目结论

推荐的实践闭环是 84 DPO 偏好项目 -> 85 GRPO 组内对齐项目 -> 86 在线 DPO benchmark。学习者最终应比较数据质量、训练稳定性、偏好或任务评测、显存与吞吐,而不是只比较训练 loss;在线项目还要额外记录采样、打分和更新链路的成本。

环境与验证

损失函数、数据格式和小规模离线验证可先用 CPU;完整 SFT、DPO、GRPO 训练通常需要 GPU,在线 benchmark 还需要可用的推理后端或服务接口。应固定数据切分、随机种子、reference 配置和评测集,并保存训练配置、指标曲线和最终决策。

Released under the MIT License.