Skip to content

Group 2.9: Distributed Parallel Strategy | 2.9: 分布式并行策略 ​

本组聚焦 ZeRO、Pipeline 和 Tensor Parallelism,目标是理解大模型训练规模化的并行边界,并为 2.10 里的 79 -> 80 -> 81 通信并行项目线提供上游基础。

Group Overview | 组概览 ​

这一组把分布式并行的核心策略讲清楚,是进入项目实战之前的并行基础层。阅读顺序和组内资产见下表,先看 27,再进入 28-29;MoE 专家并行扩展页 47 和通信 profiling 扩展页 46 已完成,可在三类并行策略之后继续看,并继续承接到 2.10 的 79 -> 80 -> 81。若训练并行之外还要继续看训练内存账本,可回看 43 和 75;自动调优见算子优化 Task5,通信与并行的后续补页再看 48 -> 49。

Group Asset Overview | 组内资产总览 ​

页职责作用推荐实现入口定位
27估算 ZeRO 的显存分摊PyTorch Distributed / Accelerate主线页
28处理 Pipeline 的 microbatch 时序PyTorch Distributed主线页
29对比 Tensor Parallelism 的通信开销PyTorch Distributed主线页
46剖析 NCCL 通信热点与等待时间torch.distributed / NCCL扩展页
47看懂 MoE 专家并行的 dispatch 与通信代价torch.distributed扩展页
48通信热点与缓解策略torch.profiler / NCCL轻量专题页
49并行策略选型PyTorch Distributed / Accelerate轻量专题页
79把并行策略放回项目 benchmark 做选型PyTorch Distributed / Accelerate项目衔接
80把 MoE 专家并行拉到项目决策层PyTorch Distributed / NCCL项目衔接
81把服务侧结论迁移到分布式推理验证PyTorch Distributed / vLLM项目衔接

Learning Path | 学习路径 ​

  • 先看 27 -> 28 -> 29,把三类并行策略先串起来。
  • 再看 46 -> 47,把通信热点和 MoE 专家并行边界补齐。
  • 如果要顺着项目线继续推进,就接 79 -> 80 -> 81。

Next Steps | 后续衔接 ​

  • 看完本组后,继续进入 2.10,把并行策略接到 79 -> 80 -> 81 这条项目线上。
  • 如果后续问题转向训练内存账本或调优,也可以回看 43、75 和算子优化 Task5,再进入 48 -> 49。

Environment Notes | 环境说明 ​

  • 默认按 CPU-first 阅读,优先把并行边界和切分代价看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional 或多卡环境,以后续单页说明为准。

Released under the MIT License.