Skip to content

Group 2.4: Preference Optimization and Alignment | 2.4: 偏好优化与对齐

本组聚焦 RLHF、DPO 和 GRPO,目标是理解偏好优化与对齐链路。当前 50 继续承接偏好数据与对齐评测,51-52 负责后续占位;如果想把对齐方法、数据和项目闭环串成完整路线,也可以直接看 后训练与对齐专题

Group Overview | 组概览

这一组把偏好优化和对齐的核心方法讲清楚,是训练侧进一步收束到对齐目标的入口。阅读顺序和组内资产见下表,先看 14,再进入 15-16。

2.3 -> 2.4 -> 2.5 这个顺序是合理的:先在 2.3 里把训练闭环跑通,再在 2.4 里把训练目标推进到对齐,最后在 2.5 里回到底层的梯度和激活机制。这样读的好处是先知道“怎么训”,再知道“怎么对齐”,最后再知道“为什么会贵”。

Group Asset Overview | 组内资产总览

职责作用定位
14估算 PPO 的显存开销主线页
15理解 DPO 的偏好优化主线页
16理解 GRPO 的组级奖励主线页
50认识偏好数据与对齐评测延伸页
51在线 DPO 变体占位占位页
52对齐冲突与阈值判断轻量专题页

Learning Path | 学习路径

  • 先看 14 -> 15 -> 16,把偏好优化和对齐链路串起来。
  • 如果要继续往后扩展,再看 50,把偏好数据与对齐评测补全。
  • 后续补页按 51 -> 52 的顺序接上。

Next Steps | 后续衔接

  • 看完本组后,先进入 50 把偏好数据与对齐评测补厚,再按需要进入 2.5 把对齐训练接到反向传播和显存优化上。
  • 如果想先看横向整理后的路线,可以直接进入 后训练与对齐专题

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,优先把对齐概念和损失函数看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.