Group 2.9: Distributed Parallel Strategy | 2.9: 分布式并行策略
本组聚焦 ZeRO、Pipeline 和 Tensor Parallelism,目标是理解大模型训练规模化的并行边界,并为 2.10 里的 79 -> 80 -> 81 通信并行项目线提供上游基础。
Group Overview | 组概览
这一组把分布式并行的核心策略讲清楚,是进入项目实战之前的并行基础层。阅读顺序和组内资产见下表,先看 27,再进入 28-29;MoE 专家并行扩展页 47 和通信 profiling 扩展页 46 已完成,可在三类并行策略之后继续看,并继续承接到 2.10 的 79 -> 80 -> 81。若训练并行之外还要继续压显存或做自动调优,可顺带回看 43 -> 44 -> 45;如果想看通信与并行的后续补页,再看 48 -> 49。
Group Asset Overview | 组内资产总览
| 页 | 职责作用 | 定位 |
|---|---|---|
| 27 | 估算 ZeRO 的显存分摊 | 主线页 |
| 28 | 处理 Pipeline 的 microbatch 时序 | 主线页 |
| 29 | 对比 Tensor Parallelism 的通信开销 | 主线页 |
| 46 | 剖析 NCCL 通信热点与等待时间 | 扩展页 |
| 47 | 看懂 MoE 专家并行的 dispatch 与通信代价 | 扩展页 |
| 48 | 通信热点与缓解策略 | 轻量专题页 |
| 49 | 并行策略选型 | 轻量专题页 |
| 79 | 把并行策略放回项目 benchmark 做选型 | 项目衔接 |
| 80 | 把 MoE 专家并行拉到项目决策层 | 项目衔接 |
| 81 | 把服务侧结论迁移到分布式推理验证 | 项目衔接 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Next Steps | 后续衔接
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把并行边界和切分代价看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional或多卡环境,以后续单页说明为准。
