Skip to content

Group 2.7: Advanced Inference Strategies | 2.7:高级推理策略 ​

本组聚焦生成加速、缓存复用与多请求 Serving。学习路径先区分投机式生成和 Cache 复用,再进入 Chunked Prefill、Decode 调度、PD 分离与异构资源决策。

Group Overview | 组概览 ​

这一组围绕“怎样减少生成等待、重复计算和服务争用”展开:23、35 构成投机式生成策略链;22、24、34 构成 Cache 复用链;36–39 则把单步调度推进到 Chunked Prefill、PD 分离与异构服务决策。

本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。

Group Asset Overview | 组内资产总览 ​

页职责作用推荐实现入口定位
23评估 Speculative Decoding 的收益Transformers / vLLM主线页
24看清 RadixAttention 的缓存复用SGLang主线页
34观察 Prefix Cache 的匹配、复用与新增工作账本vLLM / SGLangCache 复用页
35理解多 Token 投机式推进的候选、验证与回退Transformers / vLLM投机策略页
36评估 Decode Scheduling 的调度收益vLLM / SGLang扩展页
37观察 KV Cache 的复用与调度边界vLLM / SGLang边界页
38用 Chunked Prefill、分池和交接预算组织 Prefill / DecodevLLM / SGLangServing 调度页
39决定异构 PD 的路由、KV 交接与服务分层vLLM / SGLangServing 决策页

Learning Path | 学习路径 ​

  • 先看 23 -> 35,建立经典 draft / target 与多 Token 推进两条投机式生成路径。
  • 再看 22 -> 24 -> 34,理解 Cache 的分页、树状匹配与前缀复用。
  • 最后看 36 -> 37 -> 38 -> 39,把调度从单步选择推进到异构 PD 服务决策。

Next Steps | 后续衔接 ​

  • 看完本组后,可以进入 2.8,把压缩与量化的主线接上。
  • 如果目标是系统性能分析,也可以继续进入 2.9 和 2.10,把推理策略放进并行通信和项目验证中。

Environment Notes | 环境说明 ​

  • 默认按 CPU-first 阅读,优先把推理路径和缓存行为看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.