流行模型架构 & 工具链速览
学习时间: 10-15分钟
本节帮你快速了解:当前LLM生态中的主流模型架构,以及如何选择适合的工具链(本地推理 vs API调用 vs 云部署)。
本节导览
🎯 快速定位
我想快速选择工具链(用API还是本地?) → 直接跳到 工具链选择决策表(3分钟)
我想了解当前有哪些主流模型 → 阅读 当前LLM生态的主流模型(5分钟)
我想知道各个模型之间的演进关系 → 查看 模型架构演进(3分钟)
我想立即开始使用(最快上手) → 跳到 第一次开始:建议的工具链(5分钟)
我想深入了解原理和细节 → 查看 关键概念 + 链接到附录B(后续阅读)
📚 本节结构
| 部分 | 内容 | 时间 | 用途 |
|---|---|---|---|
| 当前LLM生态 | 闭源模型对比表 + 开源模型对比表 | 5min | 了解有什么可用 |
| 模型架构演进 | 从RNN→Transformer→GPT→Claude的演进图 | 3min | 理解发展脉络 |
| 工具链决策 | 决策树 + 详细对比表 + 具体建议 | 4min | 快速做出选择 |
| 第一次开始 | 三个快速开始方案 | 2min | 立即行动 |
| 关键概念 | 闭源vs开源、模型文件、量化等 | 3min | 理解基础术语 |
⏱️ 根据可用时间选择
- 有5分钟? → 看决策树 + 具体建议
- 有10分钟? → 看模型对比 + 工具链决策
- 有15分钟? → 完整阅读全部内容
当前LLM生态的主流模型
1. 闭源商用模型(推荐新手)
这些模型由大公司维护,通过API调用使用,最简单可靠。
| 模型 | 公司 | 特点 | 适合场景 | 成本 |
|---|---|---|---|---|
| Claude 3.5 Sonnet | Anthropic | 推理强、安全性高 | 任务执行、代码生成 | $3/M输入、$15/M输出 |
| GPT-4o | OpenAI | 多模态、通用能力强 | 图像理解、复杂任务 | $5/M输入、$15/M输出 |
| GPT-4o mini | OpenAI | 快速、便宜 | 简单任务、高吞吐 | $0.15/M输入、$0.6/M输出 |
| Gemini 2.0 Flash | 快速推理 | 实时应用、低成本 | $0.075/M输入、$0.3/M输出 |
新手推荐: 从 Claude 3.5 Sonnet 或 GPT-4o mini 开始
2. 开源模型(推荐本地部署)
这些模型可以下载到本地运行,适合有隐私需求、自定义微调的场景。
通用型(最常用)
| 模型系列 | 参数 | 特点 | 下载源 | 本地推理成本 |
|---|---|---|---|---|
| Qwen 2.5 | 7B/32B/72B | 中文最强 | HuggingFace/ModelScope | CPU/单GPU可行 |
| Llama 3.1 | 8B/70B/405B | 英文最强、开放可商用 | HuggingFace/Meta | CPU/单GPU可行 |
| Mistral 7B | 7B/22B/72B | 均衡、快速 | HuggingFace | CPU可行 |
| Deepseek-V3 | 671B | 国内最强、可商用 | HuggingFace/ModelScope | 需多GPU |
专用型(垂直领域)
| 模型 | 专长 | 参数 | 用途 |
|---|---|---|---|
| CodeLlama | 代码生成 | 7B/34B/70B | 代码补全、编程问答 |
| Phi-4 | 小模型、推理 | 4B | 边缘设备、快速推理 |
| LLaVA | 多模态 | 7B/13B | 图像理解(本地) |
| Whisper | 语音转文字 | small/base/medium | 本地语音识别 |
本地推荐: Qwen 2.5 7B (中文场景) 或 Llama 3.1 8B (英文场景)
3. 模型架构演进
这四个图展示了各章涉及的模型是如何演进的:
RNN/LSTM
↓
└─→ GRU(更快)
Transformer(2017)
├─→ BERT(双向编码器)
├─→ GPT(单向解码器)← LLM的主要架构
└─→ T5(编码器-解码器)
GPT-1 (2018)
↓
GPT-2(大规模预训练显示威力)
↓
GPT-3(少样本学习、上下文学习)
↓
GPT-3.5 / ChatGPT(指令微调、人类反馈)
↓
GPT-4 / Claude 2 (更大规模、能力涌现)
↓
GPT-4o / Claude 3.5 / Deepseek V3(多模态、长上下文)本教程的关键模型映射:
| 章节 | 涉及模型 | 架构特点 | 学习重点 |
|---|---|---|---|
| 第4章:Transformer | Transformer | 自注意力、多头、位置编码 | 理解自注意力机制 |
| 第5章:LLM基础 | GPT系列 | 因果卷积、大规模预训练 | 理解预训练和缩放律 |
| 第6章:LLM应用 | Claude/GPT-4 | 指令微调 + RLHF | 实战应用和微调 |
| 第7章:多模态 | GPT-4V / Claude Vision | ViT + LLM | 视觉-语言融合 |
工具链选择决策表
你需要做第一个选择:用API还是本地部署?
快速决策树
我想做什么?
├─ 学习和理解LLM原理
│ └─ 用API调用即可(便宜、简单)
│
├─ 生产应用(对可靠性要求高)
│ └─ 优先用商用API(Claude/GPT-4)
│
├─ 有隐私需求(数据不出本地)
│ └─ 本地部署开源模型
│
├─ 想微调模型(定制化)
│ ├─ 小数据量 → LoRA微调(API厂商)
│ └─ 大数据量 → 本地微调(开源模型)
│
└─ 成本最优化
├─ 如果调用量大 → 本地部署
└─ 如果调用量小 → API调用详细对比表
| 维度 | API调用 | 本地部署 | 云端推理 |
|---|---|---|---|
| 上手难度 | 最简单 | 中等 | 中等 |
| 成本 | 按次计费 | 初期高,用量大时便宜 | 按计算力计费 |
| 隐私性 | 低(上传到服务器) | 最高 | 中等 |
| 自定义程度 | 低 | 最高 | 中等 |
| 推理速度 | 取决于API厂商 | 取决于本地硬件 | 中等 |
| 可用模型 | 有限 | 海量开源模型 | 中等 |
| 适合场景 | 学习、原型、生产应用 | 定制、隐私、研究 | 生产(需要GPU) |
具体选择建议
你是学生/初学者? → 推荐:API调用 + Qwen/Llama 本地小模型对比
你在写毕业设计/科研项目? → 推荐:本地部署 + 开源模型(可微调、可发表)
你在做商业应用? → 推荐:API调用(Claude/GPT-4)+ 本地推理(边缘设备/隐私场景)
你想学习LLM工程实践? → 推荐:三个都试试 —— API、本地、云部署各体验一下
第一次开始:建议的工具链
最快开始(5分钟)
# 1. 获取API Key
# Claude: https://console.anthropic.com
# OpenAI: https://platform.openai.com
# 2. 安装SDK
pip install anthropic openai
# 3. 运行第一个实验
python code/ch05_llm_basics/hello_llm.py→ 详见 附录B:环境配置
体验本地推理(10分钟)
# 1. 安装Ollama
# 下载: https://ollama.ai
# 2. 运行一个模型
ollama run qwen:7b # 中文
# 或
ollama run llama2 # 英文
# 3. 调用本地模型
python -c "
import requests
response = requests.post('http://localhost:11434/api/generate', json={
'model': 'qwen:7b',
'prompt': 'Hello, how are you?'
})
print(response.json())
"→ 详见 附录B:本地推理(待补充)
完整工具链配置(30分钟)
- 环境准备 → 附录B:快速开始
- 配置API → 附录B:API配置
- 本地推理 → 附录B:本地推理(待补充)
- 模型下载 → 附录B:模型获取(待补充)
- Docker部署 → 附录B:Docker和CNB(待补充)
常见问题
API 还是本地? 推荐先用API(简单、无需配置),后续再试本地部署。
本地推理需要什么硬件? 7B模型需要8GB内存或6GB显存。具体见 附录B。
可以免费试用吗? 可以。Claude/OpenAI提供免费额度,本地模型完全免费。
更多概念问题? 闭源/开源模型的区别、模型文件格式、量化等,详见 附录B:模型基础。
下一步
- 想立即开始? → 去 附录B:环境配置
- 想了解更多原理? → 继续阅读 第4章:Transformer详解
- 想看具体代码? → 去 第5章:LLM基础
版本: v1.2 (2026-06-03) — 精简冗长部分,保留核心内容 v1.1: 增加导览部分便于快速定位 v1.0: 初版
