Skip to content

Task0:SFT / LoRA 基础与后训练接口 ​

所属专题:后训练优化 模块定位:监督微调、参数高效训练与项目接口

模块定位 ​

本模块建立进入后训练对齐所需的最小训练接口:数据如何进入 loss,LoRA 如何改变更新对象,训练结果如何成为后续偏好优化的起点。

这里不追求覆盖所有训练工程工具,而是先形成可解释、可复查的 SFT / LoRA 基线。偏好数据、DPO、GRPO 和在线对齐在上一级专题的 Task1–6 展开。

推荐顺序 ​

text
数据与 labels → SFT loss → LoRA / PEFT → 训练控制 → 端到端实验 → 项目交付
顺序学习内容正文入口主要产出
1数据、tokenization 与 loss 对齐01 SFT 数据与 Lossinput_ids / attention_mask / labels 契约
2LoRA 与 PEFT 设计02 LoRA / PEFT Designadapter 配置、target modules 与参数预算
3训练控制03 Training Controlscheduler、梯度累积、effective batch 和 checkpoint 口径
4端到端微调实验04 End-to-End Experiment训练、评测、资源和回归证据
5项目交付与决策05 Project Delivery and Decisionaccept / tune / reject 与可交付 artifact

Part 02 学习入口 ​

前置与后续 ​

结构基础不足时回补大模型架构;训练显存和 step time 异常时进入性能优化;QLoRA 和低比特训练进入量化与压缩。完成 Task0 后,再回到后训练优化主入口学习 PPO、DPO、GRPO 和在线对齐。

环境与证据 ​

数据格式、loss、状态转移和小规模验证可以 CPU-first;真实 SFT / LoRA 项目通常需要单 GPU。实验至少固定模型、数据切分、dtype、batch、sequence length、seed 和评测口径,并保存 checkpoint、adapter、配置、指标和失败记录。

训练工程细节见训练工程附录,项目证据协议见项目交付附录。

Released under the MIT License.