Skip to content

Group 2.5: Backpropagation and Training Memory Optimization | 2.5: 反向传播与显存优化

本组覆盖反向传播、激活重计算和显存卸载,是 Part 2 的训练侧工程重点;如果想把 backward、梯度流和训练调度串成一条横向基础线,也可以直接看 反向传播与训练机制专题

Group Overview | 组概览

这一组把反向传播和显存优化的核心机制讲清楚,是训练侧理解内存压力和优化手段的关键一层。阅读顺序和组内资产见下表:先用 Part00 07 建立通用 Autograd 语言,再看 18 的局部梯度;17 是 Attention backward 的进阶扩展,随后进入 19,最后按需看 42。

2.3 -> 2.4 -> 2.5 的主线是先训练、再对齐、后机制。这样安排不是把 2.5 降级,而是把它放在读者已经知道“梯度和激活为什么重要”的位置上,再去看 Autograd、反向链路和 checkpointing/offload,会更容易把机制和工程动机对上。

Group Asset Overview | 组内资产总览

职责作用定位
P0 07建立通用 Autograd、计算图与 backward 语言前置页
18追踪激活与损失的局部反向主线页
17推导 Attention backward 并实现自定义 Autograd进阶扩展
19看懂 checkpointing主线页
42看懂 activation offload 的搬运路线扩展页

Forward Placeholders | 后续占位

职责作用定位
43统一内存管理占位占位页
44自动调优框架占位占位页
45显存裁剪与预算规划轻量专题页

Learning Path | 学习路径

  • 先看 P0 07 -> 18 -> 19;需要理解 Attention 反向时,再插入 17,最后按需看 42

Next Steps | 后续衔接

  • 看完本组后,继续进入 2.6,把训练侧的显存问题接到推理加速和缓存直觉上。
  • 后续占位页则按 43 -> 44 -> 45 的顺序补齐。
  • 如果想先看横向整理后的路线,可以直接进入 反向传播与训练机制专题

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,优先把梯度流和内存账本看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.