Skip to content

Group 1B: Single-GPU Hardware and Memory Optimization | 1B: 单卡硬件与访存优化

本组解决“单张 GPU 怎么算得快”的问题,核心是理解 GPU 架构、内存层次和 Attention 访存优化。

Group Goal | 组定位与学习目标

这一组建立单卡性能判断所需的三条线索:GPU 执行单元负责什么,数据经过哪些内存层级,以及模型工作集如何形成。学习者先用硬件和访存关系解释 Attention、KV Cache 与 Tensor Core 的成本,再把计算、带宽和容量假设交给 profiling 验证。阅读顺序和 Part 级前导路径见 intro,建议从 1A 进入后再学习本组。

1B 单卡硬件与访存优化路线

Group Assets and Reading Order | 组内资产与阅读顺序

核心职责Q 数代码块数已有码的 Q待补代码的 Q定位
03识别 GPU 层次结构与访存瓶颈55全部主线页
04压低 Attention 的显存压力44全部主线页
11解释 KV Cache 为什么增长33Q1, Q2, Q3延展主线页
12判断混合精度怎样影响吞吐33Q1, Q2, Q3延展主线页
13找到性能瓶颈并定位来源33Q1, Q2, Q3profiling 主线页
14看懂 FlashAttention 的显存收益33Q1, Q2, Q3延展主线页
23看清 TensorCore 的加速边界44全部基础节
24利用 Shared Memory 降低回流44全部基础节
25判断稀疏何时真正有效44全部基础节
  • 主线先看 0304,分别回答“计算由哪些执行单元完成”和“数据如何在内存层级之间移动”;其中 04 进一步解释 KV Cache 与注意力显存的关系,并用少量代码核对关键机制。
  • 再看 11121314,分别分析显存随序列增长的原因、混合精度对计算路径的影响、如何用 profiling 定位瓶颈,以及 FlashAttention 如何改变中间结果的存储方式。
  • 最后按需要继续看 232425,把 TensorCore、shared memory 和稀疏 Attention 的实现层理解补完;这三页都给前 3 个 Q 配了验证代码,第 4 个 Q 保留纯原理收口。

Follow-up Use | 后续用途

本组内容为 Part 2 的推理、显存和性能分析项目提供单卡基础:03 / 04 建立硬件与 Attention 访存直觉,11 / 12 / 14 补充 KV Cache、混合精度和 FlashAttention,13 负责把瓶颈假设转成 profiling 证据;23–25 再进入 Tensor Core、SRAM 和稀疏实现。显存优化路线中的真实峰值、吞吐和策略收益,仍在对应项目中用固定 workload 验证。

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,先把硬件关系、数量级和访存账本算清楚。
  • 这里只写组级统一前提,不点到具体节号。
  • 少量页面如需 GPU optionalGPU required,以后续单页说明为准,不在组页重复展开。

Released under the MIT License.