Group 2.8: Model Compression and Quantization | 2.8:模型压缩与量化
本组聚焦量化、低比特权重和低秩适配这些压缩路径,目标是把“更省显存、更低位宽、更适合部署”的主线立住。当前主线已经覆盖 W8A16、QLoRA、GPTQ/AWQ、FP8,以及 KV Cache Quantization。
Group Overview | 组概览
这一组围绕“怎么更省地存和算”展开:先用 W8A16 和 QLoRA 建立 weight-only 与 4-bit 微调的基础直觉,再用 GPTQ/AWQ、FP8 和 KV cache 量化补齐部署侧的压缩家族。
本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 定位 |
|---|---|---|
| 25 | 判断 W8A16 量化的收益边界 | 主线页 |
| 26 | 理解 QLoRA 和 4bit 量化 | 主线页 |
| 40 | 补齐 GPTQ 和 AWQ 的权重量化方法 | 扩展页 |
| 41 | 理解 FP8 推理与 KV Cache 量化 | 扩展页 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把压缩与量化策略看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional,以后续单页说明为准。
