Skip to content

Group 1D: Heterogeneous Scheduling and Operator Programming | 1D: 异构调度与算子编程

本组回答一个工程问题:程序如何从 CPU/GPU 的任务分配,落到线程、内存和算子执行。学习者会依次接触 CUDA/Triton 编程模型、Stream 异步调度、动态形状和算子融合,并用执行路径解释性能变化。

Group Goal | 组定位与学习目标

先从 1C 接入多卡通信和运行时条件,再进入本组的执行模型与编程模型。完成本组后,学习者应能回答:任务放在哪个执行单元、数据如何在层级之间移动、异步任务能否重叠,以及算子融合是否改变了实际瓶颈。19 同时连接执行映射和编译优化,因此会在相邻组复用。

1D 异构调度与算子编程路线

Group Asset Overview | 组内资产总览

核心职责Q 数代码块数已有码的 Q待补代码的 Q定位
07分配 CPU/GPU 的执行边界44Q1, Q2, Q3, Q4主线页
08选择合适的编程与映射方式44Q1, Q2, Q3, Q4主线页
29压低 Stream 调度开销56全部基础节
30处理动态形状带来的波动33全部基础节
31评估 GPU 虚拟化与隔离收益33全部基础节
15理解 CUDA 执行层级33Q1, Q2, Q3主线页
16用 Warp / Block / Shared Memory 提升复用33Q1, Q2, Q3主线页
17看懂异步执行和重叠收益33Q1, Q2, Q3主线页
18把程序块映射到执行块33Q1, Q2, Q3主线页
19减少算子间中间张量往返33Q1, Q2, Q3主线页

Learning Path | 学习路径

  • 先读 0708,建立任务放置、线程映射和 block / tile 表达的共同语境。
  • 再读 1516171819,把执行层级、片上复用、异步重叠和融合连接起来。
  • 最后按需要阅读 293031,分别处理高级 Stream、动态 shape 和 GPU 隔离问题。

这些内容直接衔接 Part 3 的 Triton kernel、系统调度和算子优化;具体页面是否需要 CUDA 工具链或 GPU,以单页环境说明为准。

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,先把执行模型和调度关系想清楚;07 / 08 的 Q 都配了验证代码,适合边读边核对。
  • 组页只说明统一阅读条件;需要 CUDA 工具链或 GPU required 的页面,以单页环境说明为准。

Released under the MIT License.