Skip to content

大模型结构和原理正文

这页只做结构问题的判断框架:不重复 intro 的路线入口,也不写 walkthrough 的连续故事。

使用顺序

先确认 token 和 decoder 主干,再定位 norm、attention、RoPE、MLP 与 MoE 在 block 中的位置,最后用代表模型和 61 项目验证结构差异。不要从模型名称直接跳到结论。

判断表

先分清问题出在 token / embedding、norm、attention、RoPE、MLP、MoE 还是真实模型实现差异,再判断它会影响训练、推理还是显存判断。

现象优先判断先看哪条线常见动作
知道模块名字,但说不清在 block 哪一段block placement mismatch01, 06先画清 hidden state 在 block 里的路径
attention 会算,但结构关系不清楚attention structure mismatch04, 05看 Q/K/V 关系、RoPE 位置、head 组织
MLP / SwiGLU 只会背名词ffn mismatch07看 gate / up / down 的职责
MoE 看起来只是“大一点的 MLP”moe mismatch09看 router、Top-K、负载均衡和 expert 路由
真实模型源码和教程图对不上implementation gap08看 norm 位置、命名、局部 trick 和变体
检查项主要回答什么常见误判
block 路径hidden state 到底怎么穿过结构主干只背组件名,不看顺序
norm / residual稳定性和主干信号怎么维持把 norm 当成独立小技巧
attention / RoPE上下文交互和位置信息怎么进入RoPE 只是额外 patch
MLP / MoEdense 和 sparse 路径分别怎么扩展容量MoE 只是多几个 FFN
代表模型不同模型到底改了哪里模型名不同就等于结构完全不同

本节要点

这页的职责不是重复组件定义,而是把结构理解里最常见的判断点压成一张表。路线入口留给 intro,连续故事留给 walkthrough

最小结构审计模板

记录 输入表示 -> block 路径 -> 组件替换 -> dense / sparse 分支 -> 真实模型差异 -> 可观测指标。至少说明结构变化影响的是训练稳定性、推理成本、显存,还是模型质量。

Released under the MIT License.