⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

流行模型架构 & 工具链速览

学习时间: 10-15分钟

本节帮你快速了解:当前LLM生态中的主流模型架构,以及如何选择适合的工具链(本地推理 vs API调用 vs 云部署)。


本节导览

🎯 快速定位

我想快速选择工具链(用API还是本地?) → 直接跳到 工具链选择决策表(3分钟)

我想了解当前有哪些主流模型 → 阅读 当前LLM生态的主流模型(5分钟)

我想知道各个模型之间的演进关系 → 查看 模型架构演进(3分钟)

我想立即开始使用(最快上手) → 跳到 第一次开始:建议的工具链(5分钟)

我想深入了解原理和细节 → 查看 关键概念 + 链接到附录B(后续阅读)

📚 本节结构

部分内容时间用途
当前LLM生态闭源模型对比表 + 开源模型对比表5min了解有什么可用
模型架构演进从RNN→Transformer→GPT→Claude的演进图3min理解发展脉络
工具链决策决策树 + 详细对比表 + 具体建议4min快速做出选择
第一次开始三个快速开始方案2min立即行动
关键概念闭源vs开源、模型文件、量化等3min理解基础术语

⏱️ 根据可用时间选择

  • 有5分钟? → 看决策树 + 具体建议
  • 有10分钟? → 看模型对比 + 工具链决策
  • 有15分钟? → 完整阅读全部内容

当前LLM生态的主流模型

1. 闭源商用模型(推荐新手)

这些模型由大公司维护,通过API调用使用,最简单可靠。

模型公司特点适合场景成本
Claude 3.5 SonnetAnthropic推理强、安全性高任务执行、代码生成$3/M输入、$15/M输出
GPT-4oOpenAI多模态、通用能力强图像理解、复杂任务$5/M输入、$15/M输出
GPT-4o miniOpenAI快速、便宜简单任务、高吞吐$0.15/M输入、$0.6/M输出
Gemini 2.0 FlashGoogle快速推理实时应用、低成本$0.075/M输入、$0.3/M输出

新手推荐: 从 Claude 3.5 Sonnet 或 GPT-4o mini 开始


2. 开源模型(推荐本地部署)

这些模型可以下载到本地运行,适合有隐私需求、自定义微调的场景。

通用型(最常用)

模型系列参数特点下载源本地推理成本
Qwen 2.57B/32B/72B中文最强HuggingFace/ModelScopeCPU/单GPU可行
Llama 3.18B/70B/405B英文最强、开放可商用HuggingFace/MetaCPU/单GPU可行
Mistral 7B7B/22B/72B均衡、快速HuggingFaceCPU可行
Deepseek-V3671B国内最强、可商用HuggingFace/ModelScope需多GPU

专用型(垂直领域)

模型专长参数用途
CodeLlama代码生成7B/34B/70B代码补全、编程问答
Phi-4小模型、推理4B边缘设备、快速推理
LLaVA多模态7B/13B图像理解(本地)
Whisper语音转文字small/base/medium本地语音识别

本地推荐: Qwen 2.5 7B (中文场景) 或 Llama 3.1 8B (英文场景)


3. 模型架构演进

这四个图展示了各章涉及的模型是如何演进的:

RNN/LSTM

    └─→ GRU(更快)
    
Transformer(2017)
    ├─→ BERT(双向编码器)
    ├─→ GPT(单向解码器)← LLM的主要架构
    └─→ T5(编码器-解码器)

GPT-1 (2018)

GPT-2(大规模预训练显示威力)

GPT-3(少样本学习、上下文学习)

GPT-3.5 / ChatGPT(指令微调、人类反馈)

GPT-4 / Claude 2 (更大规模、能力涌现)

GPT-4o / Claude 3.5 / Deepseek V3(多模态、长上下文)

本教程的关键模型映射:

章节涉及模型架构特点学习重点
第4章:TransformerTransformer自注意力、多头、位置编码理解自注意力机制
第5章:LLM基础GPT系列因果卷积、大规模预训练理解预训练和缩放律
第6章:LLM应用Claude/GPT-4指令微调 + RLHF实战应用和微调
第7章:多模态GPT-4V / Claude VisionViT + LLM视觉-语言融合

工具链选择决策表

你需要做第一个选择:用API还是本地部署?

快速决策树

我想做什么?
├─ 学习和理解LLM原理
│  └─ 用API调用即可(便宜、简单)

├─ 生产应用(对可靠性要求高)
│  └─ 优先用商用API(Claude/GPT-4)

├─ 有隐私需求(数据不出本地)
│  └─ 本地部署开源模型

├─ 想微调模型(定制化)
│  ├─ 小数据量 → LoRA微调(API厂商)
│  └─ 大数据量 → 本地微调(开源模型)

└─ 成本最优化
   ├─ 如果调用量大 → 本地部署
   └─ 如果调用量小 → API调用

详细对比表

维度API调用本地部署云端推理
上手难度最简单中等中等
成本按次计费初期高,用量大时便宜按计算力计费
隐私性低(上传到服务器)最高中等
自定义程度最高中等
推理速度取决于API厂商取决于本地硬件中等
可用模型有限海量开源模型中等
适合场景学习、原型、生产应用定制、隐私、研究生产(需要GPU)

具体选择建议

你是学生/初学者? → 推荐:API调用 + Qwen/Llama 本地小模型对比

你在写毕业设计/科研项目? → 推荐:本地部署 + 开源模型(可微调、可发表)

你在做商业应用? → 推荐:API调用(Claude/GPT-4)+ 本地推理(边缘设备/隐私场景)

你想学习LLM工程实践? → 推荐:三个都试试 —— API、本地、云部署各体验一下


第一次开始:建议的工具链

最快开始(5分钟)

bash
# 1. 获取API Key
# Claude: https://console.anthropic.com
# OpenAI: https://platform.openai.com

# 2. 安装SDK
pip install anthropic openai

# 3. 运行第一个实验
python code/ch05_llm_basics/hello_llm.py

→ 详见 附录B:环境配置

体验本地推理(10分钟)

bash
# 1. 安装Ollama
# 下载: https://ollama.ai

# 2. 运行一个模型
ollama run qwen:7b  # 中文
# 或
ollama run llama2   # 英文

# 3. 调用本地模型
python -c "
import requests
response = requests.post('http://localhost:11434/api/generate', json={
    'model': 'qwen:7b',
    'prompt': 'Hello, how are you?'
})
print(response.json())
"

→ 详见 附录B:本地推理(待补充)

完整工具链配置(30分钟)

  1. 环境准备附录B:快速开始
  2. 配置API附录B:API配置
  3. 本地推理附录B:本地推理(待补充)
  4. 模型下载附录B:模型获取(待补充)
  5. Docker部署附录B:Docker和CNB(待补充)

常见问题

API 还是本地? 推荐先用API(简单、无需配置),后续再试本地部署。

本地推理需要什么硬件? 7B模型需要8GB内存或6GB显存。具体见 附录B

可以免费试用吗? 可以。Claude/OpenAI提供免费额度,本地模型完全免费。

更多概念问题? 闭源/开源模型的区别、模型文件格式、量化等,详见 附录B:模型基础


下一步


版本: v1.2 (2026-06-03) — 精简冗长部分,保留核心内容 v1.1: 增加导览部分便于快速定位 v1.0: 初版

本教程采用 CC BY-NC-SA 4.0 许可协议