Task0:SFT / LoRA 基础与后训练接口
所属专题:后训练优化 模块定位:监督微调、参数高效训练与项目接口
模块定位
本模块建立进入后训练对齐所需的最小训练接口:数据如何进入 loss,LoRA 如何改变更新对象,训练结果如何成为后续偏好优化的起点。
这里不追求覆盖所有训练工程工具,而是先形成可解释、可复查的 SFT / LoRA 基线。偏好数据、DPO、GRPO 和在线对齐在上一级专题的 Task1–6 展开。
推荐顺序
text
数据与 labels → SFT loss → LoRA / PEFT → 训练控制 → 端到端实验 → 项目交付| 顺序 | 学习内容 | 正文入口 | 主要产出 |
|---|---|---|---|
| 1 | 数据、tokenization 与 loss 对齐 | 01 SFT 数据与 Loss | input_ids / attention_mask / labels 契约 |
| 2 | LoRA 与 PEFT 设计 | 02 LoRA / PEFT Design | adapter 配置、target modules 与参数预算 |
| 3 | 训练控制 | 03 Training Control | scheduler、梯度累积、effective batch 和 checkpoint 口径 |
| 4 | 端到端微调实验 | 04 End-to-End Experiment | 训练、评测、资源和回归证据 |
| 5 | 项目交付与决策 | 05 Project Delivery and Decision | accept / tune / reject 与可交付 artifact |
Part 02 学习入口
- 基础训练循环:09 SFT Training Loop
- LoRA 机制:10 LoRA Tutorial
- 数据与 readiness:32 SFT 数据工程、33 微调准备度
- 训练接口:13 端到端微调实验
- 项目入口:60 LoRA 微调项目
- 扩展分支:61–65 训练与微调项目
前置与后续
结构基础不足时回补大模型架构;训练显存和 step time 异常时进入性能优化;QLoRA 和低比特训练进入量化与压缩。完成 Task0 后,再回到后训练优化主入口学习 PPO、DPO、GRPO 和在线对齐。
环境与证据
数据格式、loss、状态转移和小规模验证可以 CPU-first;真实 SFT / LoRA 项目通常需要单 GPU。实验至少固定模型、数据切分、dtype、batch、sequence length、seed 和评测口径,并保存 checkpoint、adapter、配置、指标和失败记录。
