Group 0D: Training and Model Intuition | 0D: 训练与模型直觉
本组把模型构建延伸到训练循环、激活函数、归一化和 Attention。学习者将从一次训练步开始,逐步检查非线性变换、统计归一化、QKV 形状和 mask 如何共同决定模型行为。
Group Overview | 组概览
这一组按“训练闭环 -> 非线性 -> 稳定性 -> Attention”的顺序组织:13 说明一次训练步如何运行,14 说明激活函数如何改变输出分布,15 说明归一化如何影响统计量,16 说明 QKV、mask 和 shape contract 如何约束注意力计算。
对 Part 2 来说,这一组提供训练、激活、归一化和 Attention 的可检查关系:loss.backward() / optimizer.step()、激活函数的输入输出形状、归一化层的统计维度、Attention 的 QKV 形状、mask 以及 shape contract。后续的 RMSNorm、SwiGLU、RoPE 和 Attention 页面会直接使用这些变量和接口。
0C 负责对象和接口连接,0D 负责解释这些接口背后的训练与模型结构。
Group Asset Overview | 组内资产总览
| 页 | 核心职责 | Q 数 | 验证数 | 覆盖 Q | 定位 |
|---|---|---|---|---|---|
| 13 | 最小训练循环与保存骨架 | 6 | 6 | Q1, Q2, Q3, Q4, Q5, Q6 | 起步页 |
| 14 | 激活函数与分布控制 | 6 | 6 | Q1, Q2, Q3, Q4, Q5, Q6 | 主线页 |
| 15 | 归一化、统计稳定性与训练动态 | 6 | 6 | Q1, Q2, Q3, Q4, Q5, Q6 | 核心页 |
| 16 | Attention、mask 与 shape contract | 8 | 8 | Q1, Q2, Q3, Q4, Q5, Q6, Q7, Q8 | 收口页 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
Part 2 重点 | Part 2 Focus
- 13:检查训练闭环、保存骨架和最小调试读法,解决“训练代码怎么跑起来”的问题;后面做 SFT 或监督微调时,可复用这套执行顺序。
- 14:先补激活函数和输出分布,解决“非线性为什么会影响训练”的问题。
- 15:先补归一化、统计维度和稳定性,解决“为什么要做 RMSNorm / LayerNorm 类处理”的问题。
- 16:先补 Attention、mask 和 shape contract,解决“QKV 和注意力矩阵怎么对齐”的问题;后面进入 Transformer、LLM 和 SFT 的模型结构页时,这一节就是最常回看的结构锚点。
Next Steps | 后续衔接
- 完成本组后进入 0E,继续学习 profiling、显存、调试和协作工作流;如果 Part 2 中出现训练稳定性问题,可回看 14、15 或 16 对应的机制。
- 阅读顺序可以概括为:0C 处理对象和接口,0D 解释训练与模型结构。
Environment Notes | 环境说明
- 默认按
CPU-first阅读,优先把训练闭环和数值直觉看懂。 - 这里只写组级统一前提,不点到具体节号。
- 少数页面如需
GPU optional,以后续单页说明为准。
