Skip to content

Group 0D: Training and Model Intuition | 0D: 训练与模型直觉

本组把模型构建延伸到训练循环、激活函数、归一化和 Attention。学习者将从一次训练步开始,逐步检查非线性变换、统计归一化、QKV 形状和 mask 如何共同决定模型行为。

Group Overview | 组概览

这一组按“训练闭环 -> 非线性 -> 稳定性 -> Attention”的顺序组织:13 说明一次训练步如何运行,14 说明激活函数如何改变输出分布,15 说明归一化如何影响统计量,16 说明 QKV、mask 和 shape contract 如何约束注意力计算。

对 Part 2 来说,这一组提供训练、激活、归一化和 Attention 的可检查关系:loss.backward() / optimizer.step()、激活函数的输入输出形状、归一化层的统计维度、Attention 的 QKV 形状、mask 以及 shape contract。后续的 RMSNormSwiGLURoPEAttention 页面会直接使用这些变量和接口。

0C 负责对象和接口连接,0D 负责解释这些接口背后的训练与模型结构。

0D 训练与模型结构路线

Group Asset Overview | 组内资产总览

核心职责Q 数验证数覆盖 Q定位
13最小训练循环与保存骨架66Q1, Q2, Q3, Q4, Q5, Q6起步页
14激活函数与分布控制66Q1, Q2, Q3, Q4, Q5, Q6主线页
15归一化、统计稳定性与训练动态66Q1, Q2, Q3, Q4, Q5, Q6核心页
16Attention、mask 与 shape contract88Q1, Q2, Q3, Q4, Q5, Q6, Q7, Q8收口页

Learning Path | 学习路径

  • 13 -> 14 -> 15 -> 16 阅读,依次检查训练闭环、非线性、统计稳定性和 Attention 形状;这也是进入 Part 2 相关模型结构页的直接顺序。

Part 2 重点 | Part 2 Focus

  • 13:检查训练闭环、保存骨架和最小调试读法,解决“训练代码怎么跑起来”的问题;后面做 SFT 或监督微调时,可复用这套执行顺序。
  • 14:先补激活函数和输出分布,解决“非线性为什么会影响训练”的问题。
  • 15:先补归一化、统计维度和稳定性,解决“为什么要做 RMSNorm / LayerNorm 类处理”的问题。
  • 16:先补 Attention、mask 和 shape contract,解决“QKV 和注意力矩阵怎么对齐”的问题;后面进入 Transformer、LLM 和 SFT 的模型结构页时,这一节就是最常回看的结构锚点。

Next Steps | 后续衔接

  • 完成本组后进入 0E,继续学习 profiling、显存、调试和协作工作流;如果 Part 2 中出现训练稳定性问题,可回看 14、15 或 16 对应的机制。
  • 阅读顺序可以概括为:0C 处理对象和接口,0D 解释训练与模型结构。

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,优先把训练闭环和数值直觉看懂。
  • 这里只写组级统一前提,不点到具体节号。
  • 少数页面如需 GPU optional,以后续单页说明为准。

Released under the MIT License.