Skip to content

Group 2.7: Advanced Inference Strategies | 2.7:高级推理策略

本组聚焦更快的解码和缓存复用路径,目标是把推理侧的效率提升思路从单次生成扩展到多请求调度。当前主线已经覆盖 Speculative Decoding、RadixAttention、Prefix Caching、Chunked Prefill、Multi-Token Decoding、Decode Scheduling,以及 KV Cache Scheduling。

Group Overview | 组概览

这一组围绕“怎么更快生成”展开:先用 Speculative Decoding 和 RadixAttention 建立高级推理的基础直觉,再用前缀缓存、多 token 解码、decode 调度和 KV cache 调度补齐 serving 场景中的效率边界。

本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。

Group Asset Overview | 组内资产总览

职责作用定位
23评估 Speculative Decoding 的收益主线页
24看清 RadixAttention 的缓存复用主线页
34观察前缀缓存与分块预填充的收益扩展页
35理解 Multi-Token Decoding 的草稿-验证链路扩展页
36评估 Decode Scheduling 的调度收益扩展页
37观察 KV Cache 的复用与调度边界边界页
38预留给 PD 分离与 serving 调度拆分占位页
39推理分层与回退策略轻量专题页

Learning Path | 学习路径

  • 先看 23 -> 24,把高级推理策略的基础链路先串起来。
  • 再看 34 -> 35 -> 36 -> 37,把缓存复用、多 token 解码和调度边界补齐。
  • 后续补页按 38 -> 39 的顺序接上。

Next Steps | 后续衔接

  • 看完本组后,可以进入 2.8,把压缩与量化的主线接上。
  • 如果目标是系统性能分析,也可以继续进入 2.92.10,把推理策略放进并行通信和项目验证中。

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,优先把推理路径和缓存行为看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.