Skip to content

部署与异构系统(Deployment and Heterogeneous Systems)

专题类型:横切支撑专题(建设中) 主服务目标:理解模型产物如何进入 backend,以及 CPU、GPU、NPU 与多级资源如何协同完成部署

页面导语

一个模型能够在 Notebook 中运行,并不等于它已经完成部署。部署阶段还要回答:模型以什么产物交付、由哪个 backend 加载、计算和数据搬运分别发生在哪里,以及这些选择是否满足延迟、吞吐、显存和可维护性要求。

本专题用于组织部署与异构执行的共同问题。它与量化专题有交叉,但量化只负责其中一种模型压缩和表示路径;本专题关注模型产物、运行时、设备协同、资源编排和端到端交付证据。

当前先建立专题边界和 Task 占位,具体 Notebook、硬件矩阵、backend 适配和真实部署项目将在后续逐步补齐。

如何开始

  • 已有推理基础:先阅读推理优化专题,理解请求、KV Cache、Serving 和 benchmark 的共同口径。
  • 已有量化基础:再阅读量化与压缩专题,区分量化方法、模型格式和部署 backend。
  • 已有多卡基础:补读通信与并行专题,理解设备间通信、分片和资源协同。

Task 占位

Task核心问题后续内容方向验证出口
Task0模型、部署产物、推理框架和 backend 分别负责什么?模型权重、量化文件、编译产物、运行时与服务层能画出从模型产物到请求服务的链路
Task1同一个模型为什么需要不同的 backend?Transformers、vLLM、SGLang、TensorRT-LLM、llama.cpp记录加载格式、执行路径和适用硬件
Task2CPU、GPU、NPU 如何分工,数据在哪里搬运?主机—设备协同、PCIe、显存、统一内存和异构执行记录搬运、计算、同步和端到端时间
Task3多设备如何共享模型状态和服务资源?分片、通信、调度、拓扑和故障边界在固定 workload 下比较资源利用率与服务指标
Task4如何形成可交付的部署结论?环境矩阵、版本锁定、回归测试、监控和发布输出部署报告与 accept / tune / reject 决策

与现有专题的关系

现有专题本专题复用什么本专题不替代什么
推理优化请求指标、KV Cache、Serving 和 benchmark不重新讲完整的推理机制路线
量化与压缩模型格式、低比特表示和量化部署输入不把所有量化方法都归入部署问题
通信与并行设备拓扑、通信原语和并行策略不替代多卡训练和通信专题
性能分析trace、资源账本和回归证据不以单次 smoke test 代替稳定 benchmark
多模态多模态模型的部署输入和视觉 token 成本不把视觉语言模型机制并入本专题

当前建设状态

  • 已完成:专题占位、核心问题和与推理、量化、通信、多模态专题的边界说明。
  • 待补齐:backend 对比、异构执行 Notebook、部署环境矩阵、真实 GPU / NPU 实验和发布检查清单。
  • 当前不输出:没有固定模型、硬件、backend 和 workload 前,不给出部署性能排名。

Released under the MIT License.