Skip to content

后训练与对齐正文

这页只做对齐问题的判断框架:不重复 intro 的路线入口,也不写 walkthrough 的连续故事。

使用顺序

先确认问题确实超出 SFT,再比较 PPO、DPO、GRPO 的训练闭环;随后审计偏好数据和评测口径,最后回到项目交付。不要只按 loss 或方法流行度选择路线。

判断表

先分清问题在方法选择、偏好数据、评测口径还是项目交付,再判断它是不是已经退化成训练或系统代价问题。

现象优先判断先看哪条线常见动作
SFT 后结果仍然偏离偏好alignment gap01先确认是不是对齐问题而不是 SFT 基础问题
方法很强,但系统代价太重ppo system cost02看 rollout、reward、显存和多卡代价
偏好数据有了,但结论不稳dpo / data mismatch03, 05看 chosen / rejected 和评测口径
group-wise 路线不稳定grpo mismatch04看候选组构造和比较口径
项目页能跑,但采用建议站不住delivery gap06回到方法、数据、评测一起收口
检查项主要回答什么常见误判
方法选择当前是 PPO、DPO 还是 GRPO 问题只按流行度选方法
偏好数据chosen / rejected 或 group 数据是否可信只要有 pair 就能训练
评测口径结果是不是和目标行为一致只看 loss,不看偏好评测
项目收口是否能落成 adopt / tune / reject能跑就等于值得上

本节要点

这页的职责不是再讲一遍对齐方法名,而是把后训练里最常见的判断点压成一张表。路线入口留给 intro,连续故事留给 walkthrough

最小决策模板

记录 SFT 基线 -> 对齐缺口 -> 方法与数据形态 -> 评测指标 -> 系统成本 -> adopt / tune / reject。训练指标、偏好指标和在线指标不一致时,必须明确说明差异。

Released under the MIT License.