Skip to content

Group 2.8: Quantization and Low-Bit Adaptation | 2.8:量化与低比特适配 ​

本组聚焦量化与低比特适配,目标是把“压缩什么、何时介入、如何执行、怎样证明值得部署”串成一条路线。当前主线覆盖 W8A16、QLoRA、GPTQ/AWQ、FP8 和 KV Cache Quantization;剪枝、蒸馏与一般稀疏化暂作为后续扩展,不混入当前核心路径。

Group Overview | 组概览 ​

这一组围绕“怎么更省地存和算”展开:先建立量化对象、误差和证据等级的全局视野,再分别进入权重量化、低比特训练、后训练压缩、运行时低精度和部署 benchmark。训练适配入口是 26/65,推理部署入口是 66/67,不能用 adapter 可加载替代量化 backend 可运行。

本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。

Group Asset Overview | 组内资产总览 ​

页职责作用推荐实现入口定位
25判断 W8A16 的对象、表示与收益边界PyTorch / Transformers核心机制
26理解 QLoRA 和 4bit 训练适配Transformers / bitsandbytes核心机制
40理解校准、误差与 GPTQ/AWQ artifactTransformers / quantization backend核心机制
41区分激活量化、FP8 与 KV Cache 量化PyTorch / Transformers / backend核心机制
65训练适配后的质量与资源选择Transformers / PEFT项目分支
66建立浮点 baseline 与统一 workloadPyTorch / serving backend项目基线
67验证 artifact、backend 与部署收益serving backend项目收口

Learning Path | 学习路径 ​

  • 先建立量化对象、误差、介入时机和证据等级的全局视野,再进入 25。
  • 需要训练适配时进入 26 或项目 65。
  • 需要推理压缩时依次看 40 和 41,最后回到 66 与 67。

Next Steps | 后续衔接 ​

  • 看完本组后,可以进入 2.9,把并行与通信边界接起来。
  • 如果目标是项目验证或显存调优,也可以继续进入 2.10,或回看 43 与 75;自动调优方法见算子优化 Task5。

Environment Notes | 环境说明 ​

  • 默认按 CPU-first 阅读,优先把压缩与量化策略看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.