Group 2.7: Advanced Inference Strategies | 2.7:高级推理策略
本组聚焦生成加速、缓存复用与多请求 Serving。学习路径先区分投机式生成和 Cache 复用,再进入 Chunked Prefill、Decode 调度、PD 分离与异构资源决策。
Group Overview | 组概览
这一组围绕“怎样减少生成等待、重复计算和服务争用”展开:23、35 构成投机式生成策略链;22、24、34 构成 Cache 复用链;36–39 则把单步调度推进到 Chunked Prefill、PD 分离与异构服务决策。
本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 推荐实现入口 | 定位 |
|---|---|---|---|
| 23 | 评估 Speculative Decoding 的收益 | Transformers / vLLM | 主线页 |
| 24 | 看清 RadixAttention 的缓存复用 | SGLang | 主线页 |
| 34 | 观察 Prefix Cache 的匹配、复用与新增工作账本 | vLLM / SGLang | Cache 复用页 |
| 35 | 理解多 Token 投机式推进的候选、验证与回退 | Transformers / vLLM | 投机策略页 |
| 36 | 评估 Decode Scheduling 的调度收益 | vLLM / SGLang | 扩展页 |
| 37 | 观察 KV Cache 的复用与调度边界 | vLLM / SGLang | 边界页 |
| 38 | 用 Chunked Prefill、分池和交接预算组织 Prefill / Decode | vLLM / SGLang | Serving 调度页 |
| 39 | 决定异构 PD 的路由、KV 交接与服务分层 | vLLM / SGLang | Serving 决策页 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
- 先看 23 -> 35,建立经典 draft / target 与多 Token 推进两条投机式生成路径。
- 再看 22 -> 24 -> 34,理解 Cache 的分页、树状匹配与前缀复用。
- 最后看 36 -> 37 -> 38 -> 39,把调度从单步选择推进到异构 PD 服务决策。
Next Steps | 后续衔接
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把推理路径和缓存行为看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional,以后续单页说明为准。
