Skip to content

监督微调专题

专题定位

本专题用于串起训练微调主线:先把模型结构和 PyTorch 基础接到 SFT / LoRA,再进入训练控制、数据工程、readiness 和项目交付。这里聚焦“结构前置 -> SFT / LoRA -> 训练控制 -> 项目收口”;如果问题已经转到偏好优化或对齐算法,应转到后训练与对齐专题。

Infra 层定位

监督微调主要落在 L3,并以 L1 的计算、显存和存储条件为边界:框架与训练运行时负责数据、梯度和优化器,算子与通信库属于 L2,多卡训练和服务化交付会延伸到 L4-L5。LoRA、QLoRA 和梯度累积不是孤立技巧,应放回模型负载、显存预算、吞吐和评测结果中判断。

推荐入口

推荐从 Part 02 的 2.3 训练与微调闭环 开始;结构基础不足时回补 2.1 基础算子2.2 模型架构

前置阅读

  • Part 00:Python、PyTorch 和训练循环基础。
  • Part 01:GPU、显存和性能基本概念。
  • Part 02:优先完成 2.1-2.3,再进入本专题的项目路线。

主学习线

Task1-6 是学习路线,指向 Part 00 / Part 01 / Part 02 的具体小节;最后一列主要对应 01-05 的专题正文页,分支补充放在工程与交付附录。

Task学习内容主学习线专题正文
Task1PyTorch 与模型结构入口00 -> 01 -> 0201 SFT Data and Loss
Task2位置编码、注意力与 block 前置03 -> 04 -> 05 -> 0802 LoRA PEFT Design
Task3SFT 与 LoRA 闭环09 -> 1002 LoRA PEFT Design
Task4训练控制与端到端实验11 -> 12 -> 1303 Training Control
Task5长上下文、数据工程、readiness 与项目交付30 -> 32 -> 33 -> 60 -> 62 -> 63 -> 6405 Project Delivery and Decision
Task6小显存、LoRA 变体与量化选型26 -> 31 -> 65 -> 15 -> 16训练工程附录, 项目交付附录

正文与跳转

先按上面的 Task1-6 走 notebook 主线;遇到“LoRA 为什么挂在这些层上”“训练控制和项目交付怎么接起来”时,再回来看对应的专题正文。想看汇总版就进 监督微调正文,想按连续故事线走一遍就进 监督微调深入阅读。工具层补充放在 训练工程附录,项目证据链补充放在 项目交付附录

如果问题已经跨到别的专题: 大模型架构专题 负责结构地基,后训练与对齐专题 负责 DPO / GRPO 分叉,量化与压缩专题 负责 QLoRA 与压缩路线,显存优化专题 负责 OOM 与显存账本,Profiling 专题 负责训练证据链,通信与并行专题 负责多卡边界。

项目结论

核心项目为 60 LoRA 微调62 指令微调63 LoRA 变体对比;扩展项目包括 64 数据质量65 QLoRA 选型

环境与验证

基础阅读和多数 Notebook 可 CPU-first;真实训练项目建议使用单 GPU。运行前先查看对应 Notebook 的环境说明,结果和结论以项目 Notebook 的输出为准。

Released under the MIT License.