Skip to content

2. 7B | 2.7B:模型压缩与量化

本组聚焦量化、低比特权重和低秩适配这些压缩路径,目标是把“更省显存、更低位宽、更适合部署”的主线立住。当前主线已经覆盖 W8A16、QLoRA、GPTQ/AWQ、FP8,以及 KV Cache Quantization。

Group Overview | 组概览

这一组围绕“怎么更省地存和算”展开:先用 W8A16 和 QLoRA 建立 weight-only 与 4-bit 微调的基础直觉,再用 GPTQ/AWQ、FP8 和 KV cache 量化补齐部署侧的压缩家族。

Page Template | 页面模板

这一组非项目页统一对齐 26 的 notebook-first 结构,保证阅读、填空和脚本校验一致:

  • 标题区:编号、标题、难度、环境、标签、目标人群、关键词。
  • 前置阅读:先放最小必要前置,优先保证正文主线可读。
  • 相关阅读:放工程背景或后续扩展,不抢正文主线。
  • Step 1:先讲问题、收益或核心机制。
  • Step 2:给出代码实现框架或关键数据结构。
  • Step 3:展开模拟机制、对比关系或关键细节。
  • Step 4:动手实战,完成一个最小可运行实现。
  • STOP HERE:保留自练区。
  • 参考代码与解析:统一收束答案和解析。

Group Asset Overview | 组内资产总览

职责作用定位
25判断 W8A16 量化的收益边界主线页
26理解 QLoRA 和 4bit 量化主线页
39补齐 GPTQ 和 AWQ 的权重量化方法扩展页
40理解 FP8 推理与 KV Cache 量化扩展页

Learning Path | 学习路径

  • 先看 25 -> 26,把压缩与量化的基础链路先串起来。
  • 再看 39 -> 40,把权重量化、FP8 推理和 KV cache 量化接到部署边界上。

Next Steps | 后续衔接

  • 看完本组后,可以进入 2.8,把并行与通信边界接起来。
  • 如果目标是项目验证,也可以继续进入 2.9,把量化策略放进推理性能对比和部署项目中。

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,优先把压缩与量化策略看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.