Group 2.7 Hub: Inference and Compression Tracks | 2.7:推理与压缩双轨入口
本页是 2.7A 与 2.7B 的总入口。当前双轨结构已经完成:2.7A 收束高级推理策略与缓存调度,2.7B 收束模型压缩与量化家族。2.7 负责说明两条子线如何衔接到 2.8 并行通信和 2.9 项目验证。
Group Overview | 组概览
2.7 分成两条子线:
2.7A:高级推理策略,覆盖Speculative Decoding、RadixAttention、Prefix Caching、Chunked Prefill、Multi-Token Decoding、Decode Scheduling和KV Cache Scheduling。2.7B:模型压缩与量化,覆盖W8A16、QLoRA、GPTQ、AWQ、FP8和KV Cache Quantization。
Page Template | 页面模板
2.7A 和 2.7B 的非项目页统一对齐 26 的 notebook-first 结构:
- 标题区:编号、标题、难度、环境、标签、目标人群、关键词。
- 前置阅读:只放真正服务正文主线的最小必要前置。
- 相关阅读:只放能帮助理解工程背景或后续扩展的链接。
- Step 1:先讲问题、痛点或核心机制。
- Step 2:再给实现框架或数据结构。
- Step 3:展开模拟机制或关键细节。
- Step 4:动手实战,给出最小可运行的代码骨架。
- STOP HERE:保留自练区,方便读者先自己补全。
- 参考代码与解析:最后给出答案和简短解析。
Subgroup Entry | 子线入口
| 子线 | 主要内容 | 当前状态 | 入口 |
|---|---|---|---|
2.7A | 高级推理策略 | 已完成高级推理与缓存调度线 | 2.7A |
2.7B | 模型压缩与量化 | 已完成压缩与量化扩展线 | 2.7B |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
Completed Extension Map | 已完成扩展映射
2.7A 高级推理与缓存调度
36 Prefix Caching and Chunked Prefill:观察前缀缓存命中、切块预填充和复用机制。37 Multi-Token Decoding:理解多 token 生成和草稿-验证链路。38 Decode Scheduling:评估 prefill / decode 调度、批次排布和优先级规则。41 KV Cache Scheduling:补齐 KV cache 复用、驱逐和调度边界。
2.7B 压缩与量化扩展
39 GPTQ and AWQ Weight Quantization:补齐权重量化、校准和误差控制。40 FP8 and KV Cache Quantization:理解 FP8 推理和 KV cache 量化。
Environment Notes | 环境说明
- 当前这页只是总入口,不承担具体题目的展开。
- 组内资产已按
2.7A/2.7B分别收束。 - 少数页面如需
GPU optional或更完整工具链,以对应子线页面说明为准。
