Skip to content

Group 2.9: Distributed Parallel Strategy | 2.9: 分布式并行策略

本组聚焦 ZeRO、Pipeline 和 Tensor Parallelism,目标是理解大模型训练规模化的并行边界,并为 2.10 里的 79 -> 80 -> 81 通信并行项目线提供上游基础。

Group Overview | 组概览

这一组把分布式并行的核心策略讲清楚,是进入项目实战之前的并行基础层。阅读顺序和组内资产见下表,先看 27,再进入 28-29;MoE 专家并行扩展页 47 和通信 profiling 扩展页 46 已完成,可在三类并行策略之后继续看,并继续承接到 2.1079 -> 80 -> 81。若训练并行之外还要继续压显存或做自动调优,可顺带回看 43 -> 44 -> 45;如果想看通信与并行的后续补页,再看 48 -> 49

Group Asset Overview | 组内资产总览

职责作用定位
27估算 ZeRO 的显存分摊主线页
28处理 Pipeline 的 microbatch 时序主线页
29对比 Tensor Parallelism 的通信开销主线页
46剖析 NCCL 通信热点与等待时间扩展页
47看懂 MoE 专家并行的 dispatch 与通信代价扩展页
48通信热点与缓解策略轻量专题页
49并行策略选型轻量专题页
79把并行策略放回项目 benchmark 做选型项目衔接
80把 MoE 专家并行拉到项目决策层项目衔接
81把服务侧结论迁移到分布式推理验证项目衔接

Learning Path | 学习路径

  • 先看 27 -> 28 -> 29,把三类并行策略先串起来。
  • 再看 46 -> 47,把通信热点和 MoE 专家并行边界补齐。
  • 如果要顺着项目线继续推进,就接 79 -> 80 -> 81

Next Steps | 后续衔接

  • 看完本组后,继续进入 2.10,把并行策略接到 79 -> 80 -> 81 这条项目线上。
  • 如果后续问题转向调优或补页扩展,也可以回看 43 -> 44 -> 4548 -> 49

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,优先把并行边界和切分代价看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional 或多卡环境,以后续单页说明为准。

Released under the MIT License.