04. Weight-Only Compression | 权重量化与后训练压缩
页面目标
本节回答的是:GPTQ、AWQ 和 weight-only 路线在解决什么问题,为什么它们经常成为后训练量化的主轴。
本节的输出是权重量化候选:模型权重、校准数据、量化粒度、backend 支持和精度风险是否匹配当前部署目标。
问题起点
很多部署场景的首要问题不是激活,而是权重驻留太大。于是,最先被问到的问题往往是:
- 能不能先把权重压下来,让模型装进目标卡;
- 压下来以后,精度损失能不能控制在可接受范围内。
GPTQ / AWQ 就是在这个问题上出现的。
你要先确认什么
- 权重驻留是不是预算主因。
- 你更看重极限压缩率,还是更稳的精度保持。
- 你有没有继续训练预算;如果没有,权重量化通常应先进入候选。
核心矛盾
权重量化的核心矛盾是:低比特能显著降低模型驻留成本,但某些层、通道和矩阵对误差异常敏感。GPTQ / AWQ 的存在,就是为了在后训练阶段尽量保住这些敏感位置。
机制链
权重量化通常保留低比特权重,并额外保存分组或通道级量化参数。执行时,矩阵乘法可能在 kernel 内完成反量化,也可能先生成更高精度临时值;这决定了模型常驻显存下降后,实际 workspace、带宽和延迟是否仍然可接受。
| 方法 | 误差控制思路 | 依赖的输入 | 不能忽略的代价 |
|---|---|---|---|
| GPTQ | 根据权重重建误差逐步调整量化值 | 校准样本、权重统计和量化配置 | 校准耗时、格式与执行 kernel 绑定 |
| AWQ | 利用激活敏感性保护重要通道或权重 | 代表性激活、分组和缩放配置 | 激活分布变化、backend 支持和额外参数 |
两种方法都不是单独的 runtime backend。最终收益还取决于导出的格式、加载器和目标硬件。
GPTQ / AWQ 的质量回归应同时覆盖“量化误差”和“真实任务行为”。校准阶段可以使用代表性激活,但最终评测应使用独立的验证集或业务样例,并覆盖目标服务中的长输入、结构化输出和高频敏感任务。
| 回归层 | 对照内容 | 主要指标 | 结论用途 |
|---|---|---|---|
| 权重层 | 浮点权重 vs 量化权重 | 误差、scale、敏感层变化 | 检查量化是否按预期完成 |
| logits 层 | 相同输入下的输出分布 | max error、KL 或一致性指标 | 定位数值偏移 |
| 任务层 | 浮点模型 vs 量化模型 | 准确率、格式成功率、任务质量 | 判断质量是否达标 |
| 服务层 | 同 workload 的 baseline / candidate | 显存、TTFT、TPOT、吞吐、P99 | 判断部署收益是否成立 |
演化路径
- 最基础的是 W8A16 这类易落地的权重量化。
- 如果压缩还不够或精度退化太大,再看 GPTQ / AWQ。
- 最后再回到部署和 benchmark,确认收益是否真的匹配硬件和服务目标。
关键取舍
- GPTQ 更偏误差补偿和近似最优重建。
- AWQ 更偏激活感知,优先保护敏感通道。
- 两者都属于后训练路线,但侧重点不同,不是简单替换关系。
证据边界
CPU 或机制模拟可以验证分组量化、权重重建误差和敏感性排序;它不能证明真实 GPTQ / AWQ artifact 能被目标 backend 加载,也不能证明使用了预期的低比特 kernel。部署结论必须比较未量化 baseline 与量化候选,并记录质量、显存、延迟、吞吐和失败原因。
正文暂不嵌入未审核图示;相关图册与占位说明见 视觉资产页。
文献锚点
- GPTQ:理解后训练权重量化为何能用误差补偿稳住精度。
- AWQ:理解为什么激活感知会影响权重量化的保精度能力。
对应 Part 02
25W8A16 量化40GPTQ / AWQ 权重量化67量化推理与部署
典型阅读入口
本节要点
权重量化的主问题不是“能不能压”,而是“压完以后能不能还值这个部署收益”。
进入下一页
如果瓶颈转向推理执行或 KV cache,进入 05 FP8 与 KV Cache 量化;否则带着权重量化候选进入 06 部署与 Benchmark 决策。
