大模型架构专题
专题定位
本专题用于串起大模型结构主线:先看 token 怎样进入 block,再看 norm、attention、RoPE、MLP、MoE 和结构技巧分别放在什么位置,最后把这些结构差异接回训练、推理和显存路线。这里聚焦“组件在 block 里怎么组织、为什么这样组织”;如果问题已经转到训练微调、推理服务或显存 trade-off,应转到对应主路线专题。
本专题属于基础支撑专题,不采用主学习路线的六节正文结构;正文按 01-09 组织,10_visual_assets.md 作为图册补充。建议把它作为 Part 02 的结构回补路线,而不是一次性从头读完的独立项目线。
Infra 层定位
模型架构是运行在五层 Infra 之上的负载面,不等同于某一个软件层:结构决定计算图、参数规模、激活和 KV cache 形态,L1-L3 决定它如何被执行,L4 决定它如何被服务,L5 决定它如何被评测和部署。阅读本专题时,应把结构判断落回计算、内存、通信和质量指标。
推荐入口
推荐从 Part 02 导学 的结构与训练前置进入;如果目标是推理,可从 attention、RoPE、KV cache 相关小节切入。需要完整结构验证时,再连接 61 模型架构探索项目。
前置阅读
建议先具备 Part 00 的张量和模块基础,再回看 Part 02 的 01-04 组件 notebook。05 和 08 适合作为 block 组装与架构变体的收束,MoE 相关内容按需扩展即可。
主学习线
Task1-6 是学习路线,指向 Part 02 和相关扩展页的具体小节;最后一列主要对应 01-09 的专题正文页,10 是图册补充。
| Task | 学习内容 | 主学习线 | 专题正文 |
|---|---|---|---|
| Task1 | decoder-only 总览与 token、embedding 入口 | 01 -> 02 | 01 Transformer Decoder, 02 Tokenization and Embedding |
| Task2 | norm、attention 与位置编码 | 03 -> 04 -> 05 | 03 Norm Evolution, 04 Attention Evolution, 05 RoPE Position Encoding |
| Task3 | block 组装与 residual 主干 | 06 | 06 Block Residual Path |
| Task4 | MLP / SwiGLU 演化 | 07 | 07 MLP FFN Evolution |
| Task5 | MoE、router 与稀疏化 | 09 | 09 MoE Sparsity Evolution |
| Task6 | 代表模型、结构对照与架构验证项目 | 08 -> 61 | 08 Representative Models |
正文与跳转
先按上面的 Task1-6 走结构主线;遇到“这些组件到底在 block 的哪一段”“真实模型和教科书结构差在哪”时,再回来看对应的专题正文。想看汇总版就进 大模型结构和原理正文,想按连续故事线走一遍就进 大模型结构和原理深入阅读。图册补充放在 10 Visual Assets。
如果问题已经跨到别的专题: 监督微调专题 负责 LoRA 和训练闭环,推理优化专题 负责 attention、KV cache 和服务链路,显存优化专题 负责结构带来的资源代价。
环境与验证
结构阅读、参数统计和大多数组件实验可先用 CPU;若要比较真实模型的显存、吞吐或服务行为,需要 GPU 和对应推理后端。架构结论应回到参数量、计算量、显存、质量或延迟等可观测指标,不能只凭结构图判断优劣。
