ALPHA教程正在持续完善,部分内容仍待补充。反馈问题 ↗
Skip to content

HELLO GPU / 从理解到优化

看懂 GPU,亲手优化
每一次计算。

从第一个 Kernel,到经典算子优化,再到算子优化 Agent。
沿着理解、测量、优化与自动化的路径动手实践。

带 Hello-GPU 标志的银色与石墨色分层芯片,透明背景的抽象计算结构
Hello-GPU · 计算结构示意
向下探索,每一次计算的可能
当前环境Radeon RX 9070 XT·ROCm 10.0·原生 Ubuntu 24.04

HELLO-GPU · 从理解到优化

每一步,都离硬件更近。

01理解

看懂一次计算, 怎样在 GPU 上发生。

从线程、wavefront 到片上存储,跟着一个元素的旅程,把抽象的硬件概念变成看得见的过程。

走进 GPU 的工作方式

02测量

先找到瓶颈, 再谈优化。

学会可信计时、读懂 kernel trace 和 Roofline。让每一次修改,都有测量和证据作为起点。

建立第一个可信基准

03优化

把理解, 写进每一个 Kernel。

从逐元素计算到归约、矩阵乘与融合,用 HIP 或 Triton 实现同一个算子,逐步理解性能取舍。

开始经典算子实战

04自动化

让每次尝试, 成为下一次的起点。

把编译、测量和分析封装成工具,让 Agent 在可验证的反馈中迭代,留下能回看的优化轨迹。

搭建算子优化 Agent
查看完整学习路线
01 学习路线5 篇正文 · 20 章从基础概念到自动化优化,系统掌握 GPU 计算探索完整路线

LEARNING PATH

从第一步,
到独立优化。
循序渐进,
走完优化闭环。

5 篇正文 · 20 章

准备实验环境

GPU ATLAS

换一个视角,看懂 GPU。

从架构演进到芯片内部,让教程中的概念有迹可循。

进入 GPU 图谱

社区共建

一起,把 GPU 讲清楚。

由 Datawhale 社区发起,与每一位贡献者共同完善。

查看全部贡献

每一次纠错、复现与分享,都让下一位读者少走一步弯路。