Skip to content

00 · 后训练全景与三阶段认知 ​

从 base model 到可用模型 ​

预训练模型拥有通用语言和知识能力,但还不等于能稳定完成一个具体任务。后训练的作用,是把这些能力转化为可调用、可评估、可约束的行为接口。

text
Base model
  → SFT:教会任务格式与基本行为
  → 偏好优化:在多个可行答案中选择更符合目标的答案
  → RL / RLVR:利用探索、环境反馈或可验证奖励继续提升能力
  → 独立评估与交付

三个阶段分别解决什么问题 ​

阶段主要输入主要目标失败时的典型表现
SFT指令、输入、参考回答建立格式、任务接口和基本行为模型不会按要求输出,格式不稳定,训练目标与 labels 不一致
偏好优化chosen / rejected 或 group-wise 候选让模型在多个可行输出中更符合偏好输出可用但价值取向、风格或安全性不稳定
RL / RLVRrollout、奖励、环境或验证器通过探索和反馈突破静态示例的上限奖励投机、训练不稳定、资源成本过高

这三个阶段不是互相替代的算法清单。SFT 解决“模型能不能按任务接口工作”,偏好优化解决“多个可行结果中哪个更好”,RL 解决“能不能通过反馈继续探索并提升”。

为什么通常按这个顺序 ​

如果 SFT 的数据格式、监督范围或基本行为不稳定,偏好优化会把格式错误和数据偏差继续放大;如果偏好数据和评测口径没有建立,RL 的奖励函数就可能把代理指标当成真实目标,产生 reward hacking。

这不是禁止项目跳过某个阶段,而是提供诊断顺序:先检查问题是否能由 prompt、RAG 或工具调用解决,再判断是否需要 SFT;SFT 基线稳定后,再判断偏好优化或 RL 是否值得承担额外成本。

用户感知与工程判断 ​

用户感受到的“模型好不好用”通常来自后训练后的行为接口:是否遵循指令、是否保持格式、是否拒绝不当请求、是否能稳定完成任务。因此后训练评估不能只看训练 loss,还要结合任务质量、安全、鲁棒性、稳定性、显存、吞吐和成本。

方法选择也会随工程约束变化。PPO / RLHF 提供完整的在线对齐基线,但显存和系统代价较高;DPO 和 GRPO 分别简化偏好优化或 critic 依赖;RLVR 则把奖励交给数学、代码等可验证任务的规则检查。具体选择必须回到数据形态、奖励可靠性和目标 workload。

交付物 ​

完成本页后,应能画出一张从 base model 到可用模型的流程图,并在每个阶段标注:输入、输出、核心目标、失败信号和下一阶段的进入条件。

Released under the MIT License.