Group 2.4: Preference and Alignment | 2.4: 偏好与对齐
本组聚焦 RLHF、DPO 和 GRPO,目标是理解偏好优化与对齐链路。14 节承担 RLHF/PPO 的资源桥接,连接对齐目标与训练内存代价;50 承接偏好数据与对齐评测,51 保留在线 DPO 机制入口,52 的冲突与阈值内容已迁移到后训练专题的项目决策正文并保留历史占位。如果想把对齐方法、数据和项目闭环串成完整路线,也可以直接看 后训练与对齐专题。
Group Overview | 组概览
这一组把偏好优化和对齐的核心方法讲清楚,是训练侧进一步收束到对齐目标的入口。阅读顺序和组内资产见下表:先用 14 认识 PPO/RLHF 的训练对象与资源代价,再进入 15-16 比较 DPO 和 GRPO,最后用 50 补齐偏好数据与评测。
2.3 -> 2.4 -> 2.5 这个顺序是合理的:先在 2.3 里把训练闭环跑通,再在 2.4 里把训练目标推进到对齐,最后在 2.5 里回到底层的梯度和激活机制。14 是 2.4 内部的桥接页,不把 2.4 变成显存优化组;它只帮助学习者理解 PPO/RLHF 为什么比 SFT 更重。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 推荐实现入口 | 定位 |
|---|---|---|---|
| 14 | 连接 PPO/RLHF 对齐目标与多模型资源代价 | PyTorch / Transformers | 资源桥接页 |
| 15 | 理解 DPO 的偏好优化 | PyTorch / TRL | 主线页 |
| 16 | 理解 GRPO 的组级奖励 | PyTorch / TRL | 主线页 |
| 50 | 认识偏好数据与对齐评测 | Transformers / TRL | 延伸页 |
| 51 | 在线 DPO 变体占位 | TRL | 占位页 |
| 52 | 通用预留与后训练项目决策迁移入口 | 后训练项目决策正文 | 迁移占位页 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
- 先看 14 -> 15 -> 16 -> 50,把资源桥接、偏好优化、组级奖励、偏好数据与对齐评测串起来。
- 后续机制入口看 51;冲突、阈值和
accept / tune / reject进入后训练项目决策正文,52仅保留历史占位入口。
Next Steps | 后续衔接
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把对齐概念和损失函数看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional,以后续单页说明为准。
