03. Low-Bit Training Adaptation | 低比特训练适配
页面目标
这一页回答的是:当纯 PTQ 不够时,为什么会出现 QAT、LoRA / QLoRA 这类“训练适配量化”的路线。
本页的输出是训练适配边界:质量损失是否值得通过额外训练恢复,以及训练显存、时间和稳定性是否被纳入收益计算。
问题起点
很多量化问题并不是“压不下去”,而是“压下去后效果掉太多”。一旦进入这个阶段,量化就不再只是部署动作,而开始和训练、微调、参数高效适配绑在一起。
你要先确认什么
- PTQ 失败的根因是误差太大,还是目标任务本来就需要继续适配。
- 你还有没有继续训练或微调预算。
- 你需要的是 full QAT,还是更轻的低比特适配路线。
核心矛盾
低比特训练适配的核心矛盾是:系统希望把模型表示压低,但模型本身又需要重新吸收这部分误差。于是,量化不再只是表示问题,而会变成训练稳定性和微调效率问题。
演化路径
- 先判断 PTQ 是否已经足够。
- 如果不够,再判断是 full QAT 还是 LoRA / QLoRA 这类更轻量路线。
- 最后再回到部署验证,看训练适配后的收益是否值得新增成本。
关键取舍
- full QAT 更完整,但成本最高。
- LoRA / QLoRA 更像“低比特前提下的适配折中”。
- 如果任务本身变化不大,继续训练未必比更好的 PTQ / AWQ / GPTQ 更划算。
文献锚点
- QAT 经典资料:理解量化误差如何被训练过程显式吸收。
- QLoRA / PEFT 资料:理解为什么低比特和参数高效微调常一起出现。
对应 Part 02
26QLoRA and 4bit Quantization60LoRA Fine-Tuning Project
典型阅读入口
本节要点
低比特训练适配是量化路线和微调路线的交叉区,重点不是“多做训练”,而是“多做训练是否真能换回可接受收益”。
进入下一页
若目标是压缩模型驻留并尽量保持推理路径稳定,进入 04 权重量化与后训练压缩;若目标是缓存预算,则进入 05 FP8 与 KV Cache 量化。
