Skip to content

大模型架构专题

专题定位

本专题用于串起大模型结构主线:先看 token 怎样进入 block,再看 norm、attention、RoPE、MLP、MoE 和结构技巧分别放在什么位置,最后把这些结构差异接回训练、推理和显存路线。这里聚焦“组件在 block 里怎么组织、为什么这样组织”;如果问题已经转到训练微调、推理服务或显存 trade-off,应转到对应主路线专题。

本专题属于基础支撑专题,不采用主学习路线的六节正文结构;正文按 01-09 组织,10_visual_assets.md 作为图册补充。建议把它作为 Part 02 的结构回补路线,而不是一次性从头读完的独立项目线。

Infra 层定位

模型架构是运行在五层 Infra 之上的负载面,不等同于某一个软件层:结构决定计算图、参数规模、激活和 KV cache 形态,L1-L3 决定它如何被执行,L4 决定它如何被服务,L5 决定它如何被评测和部署。阅读本专题时,应把结构判断落回计算、内存、通信和质量指标。

推荐入口

推荐从 Part 02 导学 的结构与训练前置进入;如果目标是推理,可从 attention、RoPE、KV cache 相关小节切入。需要完整结构验证时,再连接 61 模型架构探索项目。

前置阅读

建议先具备 Part 00 的张量和模块基础,再回看 Part 02 的 01-04 组件 notebook。0508 适合作为 block 组装与架构变体的收束,MoE 相关内容按需扩展即可。

主学习线

Task1-6 是学习路线,指向 Part 02 和相关扩展页的具体小节;最后一列主要对应 01-09 的专题正文页,10 是图册补充。

Task学习内容主学习线专题正文
Task1decoder-only 总览与 token、embedding 入口01 -> 0201 Transformer Decoder, 02 Tokenization and Embedding
Task2norm、attention 与位置编码03 -> 04 -> 0503 Norm Evolution, 04 Attention Evolution, 05 RoPE Position Encoding
Task3block 组装与 residual 主干0606 Block Residual Path
Task4MLP / SwiGLU 演化0707 MLP FFN Evolution
Task5MoE、router 与稀疏化0909 MoE Sparsity Evolution
Task6代表模型、结构对照与架构验证项目08 -> 6108 Representative Models

正文与跳转

先按上面的 Task1-6 走结构主线;遇到“这些组件到底在 block 的哪一段”“真实模型和教科书结构差在哪”时,再回来看对应的专题正文。想看汇总版就进 大模型结构和原理正文,想按连续故事线走一遍就进 大模型结构和原理深入阅读。图册补充放在 10 Visual Assets

如果问题已经跨到别的专题: 监督微调专题 负责 LoRA 和训练闭环,推理优化专题 负责 attention、KV cache 和服务链路,显存优化专题 负责结构带来的资源代价。

环境与验证

结构阅读、参数统计和大多数组件实验可先用 CPU;若要比较真实模型的显存、吞吐或服务行为,需要 GPU 和对应推理后端。架构结论应回到参数量、计算量、显存、质量或延迟等可观测指标,不能只凭结构图判断优劣。

Released under the MIT License.