Group 2.3: Training and Fine-Tuning | 2.3: 训练与微调
本组聚焦 SFT、LoRA、优化器更新、effective batch、学习率调度和训练闭环,目标是把“能跑”变成“能训”。
Group Overview | 组概览
这一组先把微调、参数更新和训练实验的链路讲清楚,是训练侧工程的重要主干。这里的“训练闭环”不只包括前向和反向,还包括 optimizer.step() 如何更新参数、micro-batch 如何形成 effective batch,以及 scheduler 如何随 optimizer step 调整学习率。阅读顺序和组内资产见下表,先看 09,再进入 11、12、10,最后用 13 收口。
2.3 -> 2.4 -> 2.5 这个顺序是按“先把训练跑起来,再把目标改成对齐,最后回到底层机制”来排的。2.3 负责把训练闭环立住,2.4 负责把训练目标扩展到偏好优化,2.5 负责解释梯度和激活为什么会成为训练侧的资源约束。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 推荐实现入口 | 定位 |
|---|---|---|---|
| 09 | 跑通 SFT 训练循环 | PyTorch / Transformers | 主线页 |
| 11 | 理解 optimizer update 与学习率调度的关系 | PyTorch Optim | 主线页 |
| 12 | 用 micro-batch 累积形成 effective batch,并控制更新频率 | PyTorch / Accelerate | 主线页 |
| 10 | 理解 LoRA 的低秩适配及其训练参数 | Transformers / PEFT | 主线页 |
| 13 | 固定 optimizer、effective batch 和 scheduler,完成端到端微调实验 | Transformers / Accelerate | 主线页 |
Extended Assets | 扩展资产
| 页 | 职责作用 | 推荐实现入口 | 定位 |
|---|---|---|---|
| 30 | 长上下文微调的长度、预算与方案比较 | PyTorch / attention models | 扩展页 |
| 31 | LoRA 变体的规格与训练行为比较 | PEFT / Transformers | 扩展页 |
| 32 | SFT 数据清洗、审计与样本落地 | Datasets / Transformers | 扩展页 |
| 33 | 微调计划、预算与评测准入判断 | Transformers / evaluation | 决策页 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
- 看完本组后,继续进入 2.4,把训练链路接到偏好优化与对齐技术上。
- 扩展资产按
30 -> 31 -> 32 -> 33的顺序阅读:先处理长度问题,再比较 LoRA 变体,随后整理数据,最后做启动准入判断。 - 如果想先把微调闭环和对齐路线串起来,也可以回看 监督微调专题 和 后训练与对齐专题。
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把训练流程和参数关系看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional或更大内存,以后续单页说明为准。
