Group 2.9: Distributed Parallel Strategy | 2.9: 分布式并行策略
本组聚焦 ZeRO、Pipeline 和 Tensor Parallelism,目标是理解大模型训练规模化的并行边界,并为 2.10 里的 79 -> 80 -> 81 通信并行项目线提供上游基础。
Group Overview | 组概览
这一组把分布式并行的核心策略讲清楚,是进入项目实战之前的并行基础层。阅读顺序和组内资产见下表,先看 27,再进入 28-29;MoE 专家并行扩展页 47 和通信 profiling 扩展页 46 已完成,可在三类并行策略之后继续看,并继续承接到 2.10 的 79 -> 80 -> 81。若训练并行之外还要继续看训练内存账本,可回看 43 和 75;自动调优见算子优化 Task5,通信与并行的后续补页再看 48 -> 49。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 推荐实现入口 | 定位 |
|---|---|---|---|
| 27 | 估算 ZeRO 的显存分摊 | PyTorch Distributed / Accelerate | 主线页 |
| 28 | 处理 Pipeline 的 microbatch 时序 | PyTorch Distributed | 主线页 |
| 29 | 对比 Tensor Parallelism 的通信开销 | PyTorch Distributed | 主线页 |
| 46 | 剖析 NCCL 通信热点与等待时间 | torch.distributed / NCCL | 扩展页 |
| 47 | 看懂 MoE 专家并行的 dispatch 与通信代价 | torch.distributed | 扩展页 |
| 48 | 通信热点与缓解策略 | torch.profiler / NCCL | 轻量专题页 |
| 49 | 并行策略选型 | PyTorch Distributed / Accelerate | 轻量专题页 |
| 79 | 把并行策略放回项目 benchmark 做选型 | PyTorch Distributed / Accelerate | 项目衔接 |
| 80 | 把 MoE 专家并行拉到项目决策层 | PyTorch Distributed / NCCL | 项目衔接 |
| 81 | 把服务侧结论迁移到分布式推理验证 | PyTorch Distributed / vLLM | 项目衔接 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
- 看完本组后,继续进入 2.10,把并行策略接到
79 -> 80 -> 81这条项目线上。 - 如果后续问题转向训练内存账本或调优,也可以回看 43、75 和算子优化 Task5,再进入 48 -> 49。
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把并行边界和切分代价看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional或多卡环境,以后续单页说明为准。
