02. LoRA / PEFT Design | LoRA 与参数高效微调
页面目标
这一页回答的是:在不改动全部参数的前提下,LoRA 为什么能把微调接进来,以及应该把 adapter 挂在哪些层上。
你要先确认什么
- target modules 是否选对。
r / alpha / dropout是否和目标任务匹配。- 可训练参数比例是否足够。
- merge 之后推理路径是否一致。
演化路径
LoRA 不是“加一个小模块”这么简单,它本质上是在冻结 base model 的前提下,给关键线性层加一个低秩旁路。
- 先冻结主模型,降低训练成本。
- 再挑选最关键的线性层挂 adapter。
- 用低秩矩阵表达参数增量。
- 通过
r / alpha / dropout控制容量和稳定性。 - 训练结束后决定是否 merge 回主模型。
这条线的关键不是“有 LoRA”,而是“LoRA 挂在哪、挂多大、怎么合并”。
常见误区
- target modules 选太少,导致可学习容量不足。
- target modules 选太多,训练代价接近全参微调。
- 只盯 rank,不看数据规模和任务难度。
- merge 后没有核对推理路径,导致结果和训练阶段不一致。
经典阅读入口
前置关系
- 先看
01,确认监督口径。 - 再看
02,理解 LoRA 是怎么接进这个监督闭环的。
本节要点
LoRA 的核心价值是把微调成本压下来,但它不是默认正确的。 挂载位置、秩和合并策略都需要和任务一起判断。
