Skip to content

Group 2.7 Hub: Inference and Compression Tracks | 2.7:推理与压缩双轨入口

本页是 2.7A2.7B 的总入口。当前双轨结构已经完成:2.7A 收束高级推理策略与缓存调度,2.7B 收束模型压缩与量化家族。2.7 负责说明两条子线如何衔接到 2.8 并行通信和 2.9 项目验证。

Group Overview | 组概览

2.7 分成两条子线:

  • 2.7A:高级推理策略,覆盖 Speculative DecodingRadixAttentionPrefix CachingChunked PrefillMulti-Token DecodingDecode SchedulingKV Cache Scheduling
  • 2.7B:模型压缩与量化,覆盖 W8A16QLoRAGPTQAWQFP8KV Cache Quantization

Page Template | 页面模板

2.7A2.7B 的非项目页统一对齐 26 的 notebook-first 结构:

  • 标题区:编号、标题、难度、环境、标签、目标人群、关键词。
  • 前置阅读:只放真正服务正文主线的最小必要前置。
  • 相关阅读:只放能帮助理解工程背景或后续扩展的链接。
  • Step 1:先讲问题、痛点或核心机制。
  • Step 2:再给实现框架或数据结构。
  • Step 3:展开模拟机制或关键细节。
  • Step 4:动手实战,给出最小可运行的代码骨架。
  • STOP HERE:保留自练区,方便读者先自己补全。
  • 参考代码与解析:最后给出答案和简短解析。

Subgroup Entry | 子线入口

子线主要内容当前状态入口
2.7A高级推理策略已完成高级推理与缓存调度线2.7A
2.7B模型压缩与量化已完成压缩与量化扩展线2.7B

Learning Path | 学习路径

  • 先看 2.7A,把高级推理策略的主线先串起来。
  • 再看 2.7B,把压缩与量化的主线接上。

Next Steps | 后续衔接

  • 看完这两条子线后,再进入 2.8,把并行与通信边界接起来。
  • 之后继续回到 2.9,把前面的能力放进项目里验证。

Completed Extension Map | 已完成扩展映射

2.7A 高级推理与缓存调度

  • 36 Prefix Caching and Chunked Prefill:观察前缀缓存命中、切块预填充和复用机制。
  • 37 Multi-Token Decoding:理解多 token 生成和草稿-验证链路。
  • 38 Decode Scheduling:评估 prefill / decode 调度、批次排布和优先级规则。
  • 41 KV Cache Scheduling:补齐 KV cache 复用、驱逐和调度边界。

2.7B 压缩与量化扩展

  • 39 GPTQ and AWQ Weight Quantization:补齐权重量化、校准和误差控制。
  • 40 FP8 and KV Cache Quantization:理解 FP8 推理和 KV cache 量化。

Environment Notes | 环境说明

  • 当前这页只是总入口,不承担具体题目的展开。
  • 组内资产已按 2.7A / 2.7B 分别收束。
  • 少数页面如需 GPU optional 或更完整工具链,以对应子线页面说明为准。

Released under the MIT License.