⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

5.3 主流模型家族

核心问题: 模型家族能告诉我们哪些训练路线和工程取舍?开源和闭源模型有什么区别?

在线 Notebook

对应的交互式版本可在 Google Colab 打开,统一使用方式见 第0章说明


为什么要了解模型家族

了解模型家族的价值,不是背模型名单,而是识别训练路线和工程约束:

  1. 理解能力来源:规模化、数据配比、对齐、多模态和推理增强分别解决什么问题
  2. 选型依据:微调、部署、API 调用时,需要权衡能力、成本、许可证、隐私和运维责任

GPT 系列(OpenAI):规模化与对齐路线

GPT 系列适合作为理解 decoder-only、规模化、指令对齐和推理增强的案例。

2018  GPT-1(1.17 亿参数)
      — Decoder-only 预训练语言模型
      — 证明:预训练 + 微调 在 NLP 任务上有效
      — 局限:需要针对每个任务微调

2019  GPT-2(15 亿参数)
      — 规模扩大 10 倍
      — 发现:足够大的模型可以 zero-shot 完成任务
      — 里程碑:第一次展示"规模带来泛化"

2020  GPT-3(1750 亿参数)
      — 规模再扩大 100 倍
      — 涌现能力:few-shot learning,无需微调
      — 开放 API,LLM 应用生态开始形成

2022  InstructGPT / ChatGPT
      — GPT-3 + RLHF 对齐
      — 从"预测文字"变成"听从指令"
      — 引爆 LLM 应用浪潮,月活用户 1 亿

2023  GPT-4
      — 多模态(支持图像输入)
      — 推理能力大幅提升(通过律师考试前 10%)
      — 上下文窗口扩展到 128K tokens

2024+ GPT-4o、o1、o3
      — GPT-4o:更快、更便宜,原生多模态
      — o1/o3:推理时计算(Chain-of-Thought 强化学习)

关键演化主线: 规模 → 对齐 → 多模态 → 推理能力


LLaMA 系列(Meta):开源基础模型路线

LLaMA 系列适合作为理解开源基础模型、社区微调和私有部署的案例。

2023.2  LLaMA-1(7B/13B/33B/65B)
        — 第一个高质量开源基础模型
        — 遵循 Chinchilla 定律:用更多数据训练更小模型
        — 7B 模型性能接近 GPT-3(175B)
        — 许可证限制:仅学术使用

2023.7  LLaMA-2(7B/13B/70B)
        — 开放商业使用(Meta 许可证)
        — 同时发布 Base 和 Chat(对齐)版本
        — 引入 RLHF 对齐,安全性大幅提升
        — 成为开源微调的主流基础模型

2024.4  LLaMA-3(8B/70B)
        — 词表扩大到 128K(支持更多语言和代码)
        — 上下文窗口 8K(后扩展到 128K)
        — 8B 模型性能接近 GPT-3.5

2024.7  LLaMA-3.1(8B/70B/405B)
        — 405B 模型性能接近 GPT-4
        — 支持 128K 上下文
        — 多语言能力显著提升

LLaMA 的生态意义: LLaMA 发布后,社区基于它微调出大量专用模型(Alpaca、Vicuna、WizardLM 等),推动了开源微调和本地部署生态。


Qwen 系列(阿里巴巴):中文与专用能力路线

Qwen(通义千问)适合作为理解中文、多语言、代码、数学和多模态专用能力的案例。

2023.8  Qwen-7B/14B
        — 强中文能力,同时支持英文
        — 代码和数学能力突出

2023.11 Qwen-72B
        — 开源模型中首个 72B 规模
        — 中文能力超越大多数同规模模型

2024.3  Qwen1.5 系列(0.5B 到 110B)
        — 覆盖从边缘设备到服务器的全规模
        — 多语言支持(29 种语言)

2024.9  Qwen2.5 系列
        — 代码专用:Qwen2.5-Coder(7B/72B)
        — 数学专用:Qwen2.5-Math
        — 多模态:Qwen2.5-VL(见第7章)
        — 72B 模型在多项 Benchmark 上超越 LLaMA-3.1-405B

Qwen 的特点: 中文能力、规模覆盖和专用模型是它的主要观察点。实际选型仍要结合任务、许可、部署方式和当下可用模型重新评估。


其他主要模型家族

Mistral(Mistral AI)

2023.9  Mistral-7B
        — 7B 参数,性能超越 LLaMA-2-13B
        — 引入 Sliding Window Attention(处理长文本)
        — Apache 2.0 许可,商业友好

2023.12 Mixtral-8x7B(MoE 架构)
        — 混合专家模型(Mixture of Experts)
        — 8 个专家,每次激活 2 个
        — 实际参数 46B,但推理只用 13B,效率高

2024    Mistral-Large、Mistral-Small
        — 闭源 API 模型,对标 GPT-4

Mixtral 的意义: 证明了 MoE 架构在 LLM 中的可行性,用更少的计算达到更大模型的效果。

DeepSeek(深度求索)

2024.1  DeepSeek-V2(MoE,236B 总参数,21B 激活)
        — 极低推理成本(比 GPT-4 便宜 100 倍)
        — 引入 MLA(Multi-head Latent Attention)降低 KV Cache

2025.1  DeepSeek-R1
        — 推理模型,用 GRPO 强化学习训练
        — 数学、代码推理能力接近 o1
        — 完全开源(包括训练细节)

Claude(Anthropic)

Claude 1/2/3 系列(闭源)
  — 以安全性和有用性著称
  — Constitutional AI:用 AI 反馈替代部分人工标注
  — Claude 3 Opus 在多项 Benchmark 上超越 GPT-4
  — 超长上下文(200K tokens)

Gemini(Google DeepMind)

Gemini 1.0/1.5/2.0 系列(闭源)
  — 原生多模态(文本、图像、音频、视频)
  — Gemini 1.5 Pro:100 万 tokens 上下文
  — 与 Google 搜索、Workspace 深度集成

开源 vs 闭源

维度开源(LLaMA、Qwen、Mistral)闭源(GPT-4、Claude、Gemini)
能力上限接近顶级闭源,取决于任务和模型通常能力上限高,更新快
成本自部署,按硬件计费按 token 计费,可能更贵
可控性完全控制,可微调黑盒,无法修改
数据隐私数据不出本地数据发送到第三方
部署灵活性可离线、边缘部署需要网络连接
维护成本需要自己运维零运维

选择原则:

  • 数据敏感、需要定制或离线部署 → 优先评估开源模型
  • 快速验证、少运维、追求能力上限 → 优先评估闭源 API
  • 中文、多语言、代码、数学等场景 → 结合任务基准重新评估候选模型
  • 商业部署 → 明确许可证、服务稳定性、成本和合规边界

模型能力演化趋势

2018-2020:规模化(参数量 1B → 175B)
2021-2022:对齐(RLHF,从"预测"到"助手")
2023:开源化(LLaMA 推动开源生态)
2024:专业化(代码、数学、多模态专用模型)
2025:推理化(o1/R1,强化学习提升推理能力)

代码实验

Model Families Evolution

图5.3a:主流 LLM 家族演化时间线——GPT、LLaMA、Qwen 等系列的发布节点与参数规模对比。

代码文件: code/ch05_llm_basics/model_families_evolution.py
运行方式: python code/ch05_llm_basics/model_families_evolution.py


本节小结

  • 模型家族应该作为训练路线和工程取舍的案例,而不是固定排行榜
  • GPT 系列展示了规模、对齐、多模态和推理增强如何逐步组合
  • LLaMA 系列展示了开源基础模型如何推动微调和私有部署
  • Qwen、Mistral、DeepSeek、Claude、Gemini 等家族提供了不同语言、架构、成本和产品路线的参考
  • 开源 vs 闭源 的选择取决于数据隐私、定制需求、成本、能力、许可证和维护责任

下一节: 5.4 微调

本教程采用 CC BY-NC-SA 4.0 许可协议