Skip to content

Group 2.3: Training and Fine-Tuning | 2.3: 训练与微调 ​

本组聚焦 SFT、LoRA、优化器更新、effective batch、学习率调度和训练闭环,目标是把“能跑”变成“能训”。

Group Overview | 组概览 ​

这一组先把微调、参数更新和训练实验的链路讲清楚,是训练侧工程的重要主干。这里的“训练闭环”不只包括前向和反向,还包括 optimizer.step() 如何更新参数、micro-batch 如何形成 effective batch,以及 scheduler 如何随 optimizer step 调整学习率。阅读顺序和组内资产见下表,先看 09,再进入 11、12、10,最后用 13 收口。

2.3 -> 2.4 -> 2.5 这个顺序是按“先把训练跑起来,再把目标改成对齐,最后回到底层机制”来排的。2.3 负责把训练闭环立住,2.4 负责把训练目标扩展到偏好优化,2.5 负责解释梯度和激活为什么会成为训练侧的资源约束。

Group Asset Overview | 组内资产总览 ​

页职责作用推荐实现入口定位
09跑通 SFT 训练循环PyTorch / Transformers主线页
11理解 optimizer update 与学习率调度的关系PyTorch Optim主线页
12用 micro-batch 累积形成 effective batch,并控制更新频率PyTorch / Accelerate主线页
10理解 LoRA 的低秩适配及其训练参数Transformers / PEFT主线页
13固定 optimizer、effective batch 和 scheduler,完成端到端微调实验Transformers / Accelerate主线页

Extended Assets | 扩展资产 ​

页职责作用推荐实现入口定位
30长上下文微调的长度、预算与方案比较PyTorch / attention models扩展页
31LoRA 变体的规格与训练行为比较PEFT / Transformers扩展页
32SFT 数据清洗、审计与样本落地Datasets / Transformers扩展页
33微调计划、预算与评测准入判断Transformers / evaluation决策页

Learning Path | 学习路径 ​

  • 先看 09 -> 11 -> 12 -> 10 -> 13,把训练循环、optimizer update、effective batch、学习率调度和微调实验串起来。

Next Steps | 后续衔接 ​

  • 看完本组后,继续进入 2.4,把训练链路接到偏好优化与对齐技术上。
  • 扩展资产按 30 -> 31 -> 32 -> 33 的顺序阅读:先处理长度问题,再比较 LoRA 变体,随后整理数据,最后做启动准入判断。
  • 如果想先把微调闭环和对齐路线串起来,也可以回看 监督微调专题 和 后训练与对齐专题。

Environment Notes | 环境说明 ​

  • 默认按 CPU-first 阅读,优先把训练流程和参数关系看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional 或更大内存,以后续单页说明为准。

Released under the MIT License.