5.3 主流模型家族
核心问题: 模型家族能告诉我们哪些训练路线和工程取舍?开源和闭源模型有什么区别?
在线 Notebook
对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明。
为什么要了解模型家族
了解模型家族的价值,不是背模型名单,而是识别训练路线和工程约束:
- 理解能力来源:规模化、数据配比、对齐、多模态和推理增强分别解决什么问题
- 选型依据:微调、部署、API 调用时,需要权衡能力、成本、许可证、隐私和运维责任
GPT 系列(OpenAI):规模化与对齐路线
GPT 系列适合作为理解 decoder-only、规模化、指令对齐和推理增强的案例。
2018 GPT-1(1.17 亿参数)
— Decoder-only 预训练语言模型
— 证明:预训练 + 微调 在 NLP 任务上有效
— 局限:需要针对每个任务微调
2019 GPT-2(15 亿参数)
— 规模扩大 10 倍
— 发现:足够大的模型可以 zero-shot 完成任务
— 里程碑:第一次展示"规模带来泛化"
2020 GPT-3(1750 亿参数)
— 规模再扩大 100 倍
— 涌现能力:few-shot learning,无需微调
— 开放 API,LLM 应用生态开始形成
2022 InstructGPT / ChatGPT
— GPT-3 + RLHF 对齐
— 从"预测文字"变成"听从指令"
— 引爆 LLM 应用浪潮,月活用户 1 亿
2023 GPT-4
— 多模态(支持图像输入)
— 推理能力大幅提升(通过律师考试前 10%)
— 上下文窗口扩展到 128K tokens
2024+ GPT-4o、o1、o3
— GPT-4o:更快、更便宜,原生多模态
— o1/o3:推理时计算(Chain-of-Thought 强化学习)关键演化主线: 规模 → 对齐 → 多模态 → 推理能力
LLaMA 系列(Meta):开源基础模型路线
LLaMA 系列适合作为理解开源基础模型、社区微调和私有部署的案例。
2023.2 LLaMA-1(7B/13B/33B/65B)
— 第一个高质量开源基础模型
— 遵循 Chinchilla 定律:用更多数据训练更小模型
— 7B 模型性能接近 GPT-3(175B)
— 许可证限制:仅学术使用
2023.7 LLaMA-2(7B/13B/70B)
— 开放商业使用(Meta 许可证)
— 同时发布 Base 和 Chat(对齐)版本
— 引入 RLHF 对齐,安全性大幅提升
— 成为开源微调的主流基础模型
2024.4 LLaMA-3(8B/70B)
— 词表扩大到 128K(支持更多语言和代码)
— 上下文窗口 8K(后扩展到 128K)
— 8B 模型性能接近 GPT-3.5
2024.7 LLaMA-3.1(8B/70B/405B)
— 405B 模型性能接近 GPT-4
— 支持 128K 上下文
— 多语言能力显著提升LLaMA 的生态意义: LLaMA 发布后,社区基于它微调出大量专用模型(Alpaca、Vicuna、WizardLM 等),推动了开源微调和本地部署生态。
Qwen 系列(阿里巴巴):中文与专用能力路线
Qwen(通义千问)适合作为理解中文、多语言、代码、数学和多模态专用能力的案例。
2023.8 Qwen-7B/14B
— 强中文能力,同时支持英文
— 代码和数学能力突出
2023.11 Qwen-72B
— 开源模型中首个 72B 规模
— 中文能力超越大多数同规模模型
2024.3 Qwen1.5 系列(0.5B 到 110B)
— 覆盖从边缘设备到服务器的全规模
— 多语言支持(29 种语言)
2024.9 Qwen2.5 系列
— 代码专用:Qwen2.5-Coder(7B/72B)
— 数学专用:Qwen2.5-Math
— 多模态:Qwen2.5-VL(见第7章)
— 72B 模型在多项 Benchmark 上超越 LLaMA-3.1-405BQwen 的特点: 中文能力、规模覆盖和专用模型是它的主要观察点。实际选型仍要结合任务、许可、部署方式和当下可用模型重新评估。
其他主要模型家族
Mistral(Mistral AI)
2023.9 Mistral-7B
— 7B 参数,性能超越 LLaMA-2-13B
— 引入 Sliding Window Attention(处理长文本)
— Apache 2.0 许可,商业友好
2023.12 Mixtral-8x7B(MoE 架构)
— 混合专家模型(Mixture of Experts)
— 8 个专家,每次激活 2 个
— 实际参数 46B,但推理只用 13B,效率高
2024 Mistral-Large、Mistral-Small
— 闭源 API 模型,对标 GPT-4Mixtral 的意义: 证明了 MoE 架构在 LLM 中的可行性,用更少的计算达到更大模型的效果。
DeepSeek(深度求索)
2024.1 DeepSeek-V2(MoE,236B 总参数,21B 激活)
— 极低推理成本(比 GPT-4 便宜 100 倍)
— 引入 MLA(Multi-head Latent Attention)降低 KV Cache
2025.1 DeepSeek-R1
— 推理模型,用 GRPO 强化学习训练
— 数学、代码推理能力接近 o1
— 完全开源(包括训练细节)Claude(Anthropic)
Claude 1/2/3 系列(闭源)
— 以安全性和有用性著称
— Constitutional AI:用 AI 反馈替代部分人工标注
— Claude 3 Opus 在多项 Benchmark 上超越 GPT-4
— 超长上下文(200K tokens)Gemini(Google DeepMind)
Gemini 1.0/1.5/2.0 系列(闭源)
— 原生多模态(文本、图像、音频、视频)
— Gemini 1.5 Pro:100 万 tokens 上下文
— 与 Google 搜索、Workspace 深度集成开源 vs 闭源
| 维度 | 开源(LLaMA、Qwen、Mistral) | 闭源(GPT-4、Claude、Gemini) |
|---|---|---|
| 能力上限 | 接近顶级闭源,取决于任务和模型 | 通常能力上限高,更新快 |
| 成本 | 自部署,按硬件计费 | 按 token 计费,可能更贵 |
| 可控性 | 完全控制,可微调 | 黑盒,无法修改 |
| 数据隐私 | 数据不出本地 | 数据发送到第三方 |
| 部署灵活性 | 可离线、边缘部署 | 需要网络连接 |
| 维护成本 | 需要自己运维 | 零运维 |
选择原则:
- 数据敏感、需要定制或离线部署 → 优先评估开源模型
- 快速验证、少运维、追求能力上限 → 优先评估闭源 API
- 中文、多语言、代码、数学等场景 → 结合任务基准重新评估候选模型
- 商业部署 → 明确许可证、服务稳定性、成本和合规边界
模型能力演化趋势
2018-2020:规模化(参数量 1B → 175B)
2021-2022:对齐(RLHF,从"预测"到"助手")
2023:开源化(LLaMA 推动开源生态)
2024:专业化(代码、数学、多模态专用模型)
2025:推理化(o1/R1,强化学习提升推理能力)代码实验

图5.3a:主流 LLM 家族演化时间线——GPT、LLaMA、Qwen 等系列的发布节点与参数规模对比。
代码文件: code/ch05_llm_basics/model_families_evolution.py
运行方式: python code/ch05_llm_basics/model_families_evolution.py
本节小结
- 模型家族应该作为训练路线和工程取舍的案例,而不是固定排行榜
- GPT 系列展示了规模、对齐、多模态和推理增强如何逐步组合
- LLaMA 系列展示了开源基础模型如何推动微调和私有部署
- Qwen、Mistral、DeepSeek、Claude、Gemini 等家族提供了不同语言、架构、成本和产品路线的参考
- 开源 vs 闭源 的选择取决于数据隐私、定制需求、成本、能力、许可证和维护责任
下一节: 5.4 微调
