00 · 后训练全景与三阶段认知
从 base model 到可用模型
预训练模型拥有通用语言和知识能力,但还不等于能稳定完成一个具体任务。后训练的作用,是把这些能力转化为可调用、可评估、可约束的行为接口。
text
Base model
→ SFT:教会任务格式与基本行为
→ 偏好优化:在多个可行答案中选择更符合目标的答案
→ RL / RLVR:利用探索、环境反馈或可验证奖励继续提升能力
→ 独立评估与交付三个阶段分别解决什么问题
| 阶段 | 主要输入 | 主要目标 | 失败时的典型表现 |
|---|---|---|---|
| SFT | 指令、输入、参考回答 | 建立格式、任务接口和基本行为 | 模型不会按要求输出,格式不稳定,训练目标与 labels 不一致 |
| 偏好优化 | chosen / rejected 或 group-wise 候选 | 让模型在多个可行输出中更符合偏好 | 输出可用但价值取向、风格或安全性不稳定 |
| RL / RLVR | rollout、奖励、环境或验证器 | 通过探索和反馈突破静态示例的上限 | 奖励投机、训练不稳定、资源成本过高 |
这三个阶段不是互相替代的算法清单。SFT 解决“模型能不能按任务接口工作”,偏好优化解决“多个可行结果中哪个更好”,RL 解决“能不能通过反馈继续探索并提升”。
为什么通常按这个顺序
如果 SFT 的数据格式、监督范围或基本行为不稳定,偏好优化会把格式错误和数据偏差继续放大;如果偏好数据和评测口径没有建立,RL 的奖励函数就可能把代理指标当成真实目标,产生 reward hacking。
这不是禁止项目跳过某个阶段,而是提供诊断顺序:先检查问题是否能由 prompt、RAG 或工具调用解决,再判断是否需要 SFT;SFT 基线稳定后,再判断偏好优化或 RL 是否值得承担额外成本。
用户感知与工程判断
用户感受到的“模型好不好用”通常来自后训练后的行为接口:是否遵循指令、是否保持格式、是否拒绝不当请求、是否能稳定完成任务。因此后训练评估不能只看训练 loss,还要结合任务质量、安全、鲁棒性、稳定性、显存、吞吐和成本。
方法选择也会随工程约束变化。PPO / RLHF 提供完整的在线对齐基线,但显存和系统代价较高;DPO 和 GRPO 分别简化偏好优化或 critic 依赖;RLVR 则把奖励交给数学、代码等可验证任务的规则检查。具体选择必须回到数据形态、奖励可靠性和目标 workload。
交付物
完成本页后,应能画出一张从 base model 到可用模型的流程图,并在每个阶段标注:输入、输出、核心目标、失败信号和下一阶段的进入条件。
