Skip to content

Group 2.4: Preference and Alignment | 2.4: 偏好与对齐 ​

本组聚焦 RLHF、DPO 和 GRPO,目标是理解偏好优化与对齐链路。14 节承担 RLHF/PPO 的资源桥接,连接对齐目标与训练内存代价;50 承接偏好数据与对齐评测,51 保留在线 DPO 机制入口,52 的冲突与阈值内容已迁移到后训练专题的项目决策正文并保留历史占位。如果想把对齐方法、数据和项目闭环串成完整路线,也可以直接看 后训练与对齐专题。

Group Overview | 组概览 ​

这一组把偏好优化和对齐的核心方法讲清楚,是训练侧进一步收束到对齐目标的入口。阅读顺序和组内资产见下表:先用 14 认识 PPO/RLHF 的训练对象与资源代价,再进入 15-16 比较 DPO 和 GRPO,最后用 50 补齐偏好数据与评测。

2.3 -> 2.4 -> 2.5 这个顺序是合理的:先在 2.3 里把训练闭环跑通,再在 2.4 里把训练目标推进到对齐,最后在 2.5 里回到底层的梯度和激活机制。14 是 2.4 内部的桥接页,不把 2.4 变成显存优化组;它只帮助学习者理解 PPO/RLHF 为什么比 SFT 更重。

Group Asset Overview | 组内资产总览 ​

页职责作用推荐实现入口定位
14连接 PPO/RLHF 对齐目标与多模型资源代价PyTorch / Transformers资源桥接页
15理解 DPO 的偏好优化PyTorch / TRL主线页
16理解 GRPO 的组级奖励PyTorch / TRL主线页
50认识偏好数据与对齐评测Transformers / TRL延伸页
51在线 DPO 变体占位TRL占位页
52通用预留与后训练项目决策迁移入口后训练项目决策正文迁移占位页

Learning Path | 学习路径 ​

  • 先看 14 -> 15 -> 16 -> 50,把资源桥接、偏好优化、组级奖励、偏好数据与对齐评测串起来。
  • 后续机制入口看 51;冲突、阈值和 accept / tune / reject 进入后训练项目决策正文,52 仅保留历史占位入口。

Next Steps | 后续衔接 ​

  • 看完本组后,先进入 50 把偏好数据与对齐评测补厚,再按需要进入 2.5 把对齐训练接到反向传播和显存优化上。
  • 如果想先看横向整理后的路线,可以直接进入 后训练与对齐专题。

Environment Notes | 环境说明 ​

  • 默认按 CPU-first 阅读,优先把对齐概念和损失函数看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.