Group 2.8: Quantization and Low-Bit Adaptation | 2.8:量化与低比特适配
本组聚焦量化与低比特适配,目标是把“压缩什么、何时介入、如何执行、怎样证明值得部署”串成一条路线。当前主线覆盖 W8A16、QLoRA、GPTQ/AWQ、FP8 和 KV Cache Quantization;剪枝、蒸馏与一般稀疏化暂作为后续扩展,不混入当前核心路径。
Group Overview | 组概览
这一组围绕“怎么更省地存和算”展开:先建立量化对象、误差和证据等级的全局视野,再分别进入权重量化、低比特训练、后训练压缩、运行时低精度和部署 benchmark。训练适配入口是 26/65,推理部署入口是 66/67,不能用 adapter 可加载替代量化 backend 可运行。
本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 推荐实现入口 | 定位 |
|---|---|---|---|
| 25 | 判断 W8A16 的对象、表示与收益边界 | PyTorch / Transformers | 核心机制 |
| 26 | 理解 QLoRA 和 4bit 训练适配 | Transformers / bitsandbytes | 核心机制 |
| 40 | 理解校准、误差与 GPTQ/AWQ artifact | Transformers / quantization backend | 核心机制 |
| 41 | 区分激活量化、FP8 与 KV Cache 量化 | PyTorch / Transformers / backend | 核心机制 |
| 65 | 训练适配后的质量与资源选择 | Transformers / PEFT | 项目分支 |
| 66 | 建立浮点 baseline 与统一 workload | PyTorch / serving backend | 项目基线 |
| 67 | 验证 artifact、backend 与部署收益 | serving backend | 项目收口 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
- 看完本组后,可以进入 2.9,把并行与通信边界接起来。
- 如果目标是项目验证或显存调优,也可以继续进入 2.10,或回看 43 与 75;自动调优方法见算子优化 Task5。
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把压缩与量化策略看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional,以后续单页说明为准。
