Skip to content

04. Weight-Only Compression | 权重量化与后训练压缩

页面目标

本节回答的是:GPTQ、AWQ 和 weight-only 路线在解决什么问题,为什么它们经常成为后训练量化的主轴。

本节的输出是权重量化候选:模型权重、校准数据、量化粒度、backend 支持和精度风险是否匹配当前部署目标。

问题起点

很多部署场景的首要问题不是激活,而是权重驻留太大。于是,最先被问到的问题往往是:

  • 能不能先把权重压下来,让模型装进目标卡;
  • 压下来以后,精度损失能不能控制在可接受范围内。

GPTQ / AWQ 就是在这个问题上出现的。

你要先确认什么

  • 权重驻留是不是预算主因。
  • 你更看重极限压缩率,还是更稳的精度保持。
  • 你有没有继续训练预算;如果没有,权重量化通常应先进入候选。

核心矛盾

权重量化的核心矛盾是:低比特能显著降低模型驻留成本,但某些层、通道和矩阵对误差异常敏感。GPTQ / AWQ 的存在,就是为了在后训练阶段尽量保住这些敏感位置。

机制链

权重量化通常保留低比特权重,并额外保存分组或通道级量化参数。执行时,矩阵乘法可能在 kernel 内完成反量化,也可能先生成更高精度临时值;这决定了模型常驻显存下降后,实际 workspace、带宽和延迟是否仍然可接受。

方法误差控制思路依赖的输入不能忽略的代价
GPTQ根据权重重建误差逐步调整量化值校准样本、权重统计和量化配置校准耗时、格式与执行 kernel 绑定
AWQ利用激活敏感性保护重要通道或权重代表性激活、分组和缩放配置激活分布变化、backend 支持和额外参数

两种方法都不是单独的 runtime backend。最终收益还取决于导出的格式、加载器和目标硬件。

GPTQ / AWQ 的质量回归应同时覆盖“量化误差”和“真实任务行为”。校准阶段可以使用代表性激活,但最终评测应使用独立的验证集或业务样例,并覆盖目标服务中的长输入、结构化输出和高频敏感任务。

回归层对照内容主要指标结论用途
权重层浮点权重 vs 量化权重误差、scale、敏感层变化检查量化是否按预期完成
logits 层相同输入下的输出分布max error、KL 或一致性指标定位数值偏移
任务层浮点模型 vs 量化模型准确率、格式成功率、任务质量判断质量是否达标
服务层同 workload 的 baseline / candidate显存、TTFT、TPOT、吞吐、P99判断部署收益是否成立

演化路径

  1. 最基础的是 W8A16 这类易落地的权重量化。
  2. 如果压缩还不够或精度退化太大,再看 GPTQ / AWQ。
  3. 最后再回到部署和 benchmark,确认收益是否真的匹配硬件和服务目标。

关键取舍

  • GPTQ 更偏误差补偿和近似最优重建。
  • AWQ 更偏激活感知,优先保护敏感通道。
  • 两者都属于后训练路线,但侧重点不同,不是简单替换关系。

证据边界

CPU 或机制模拟可以验证分组量化、权重重建误差和敏感性排序;它不能证明真实 GPTQ / AWQ artifact 能被目标 backend 加载,也不能证明使用了预期的低比特 kernel。部署结论必须比较未量化 baseline 与量化候选,并记录质量、显存、延迟、吞吐和失败原因。

正文暂不嵌入未审核图示;相关图册与占位说明见 视觉资产页

文献锚点

  • GPTQ:理解后训练权重量化为何能用误差补偿稳住精度。
  • AWQ:理解为什么激活感知会影响权重量化的保精度能力。

对应 Part 02

  • 25 W8A16 量化
  • 40 GPTQ / AWQ 权重量化
  • 67 量化推理与部署

典型阅读入口

本节要点

权重量化的主问题不是“能不能压”,而是“压完以后能不能还值这个部署收益”。

进入下一页

如果瓶颈转向推理执行或 KV cache,进入 05 FP8 与 KV Cache 量化;否则带着权重量化候选进入 06 部署与 Benchmark 决策

Released under the MIT License.