Group 2.7: Advanced Inference Strategies | 2.7:高级推理策略
本组聚焦更快的解码和缓存复用路径,目标是把推理侧的效率提升思路从单次生成扩展到多请求调度。当前主线已经覆盖 Speculative Decoding、RadixAttention、Prefix Caching、Chunked Prefill、Multi-Token Decoding、Decode Scheduling,以及 KV Cache Scheduling。
Group Overview | 组概览
这一组围绕“怎么更快生成”展开:先用 Speculative Decoding 和 RadixAttention 建立高级推理的基础直觉,再用前缀缓存、多 token 解码、decode 调度和 KV cache 调度补齐 serving 场景中的效率边界。
本组非项目页统一沿用 26 的 notebook-first 结构,组页只负责阅读路径与资产导航。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 定位 |
|---|---|---|
| 23 | 评估 Speculative Decoding 的收益 | 主线页 |
| 24 | 看清 RadixAttention 的缓存复用 | 主线页 |
| 34 | 观察前缀缓存与分块预填充的收益 | 扩展页 |
| 35 | 理解 Multi-Token Decoding 的草稿-验证链路 | 扩展页 |
| 36 | 评估 Decode Scheduling 的调度收益 | 扩展页 |
| 37 | 观察 KV Cache 的复用与调度边界 | 边界页 |
| 38 | 预留给 PD 分离与 serving 调度拆分 | 占位页 |
| 39 | 推理分层与回退策略 | 轻量专题页 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把推理路径和缓存行为看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional,以后续单页说明为准。
