⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

为什么是LLM时代?

学习时间: 15-20分钟

从信号处理的历史视角,理解为什么大语言模型(LLM)成为了当今AI的中心。


一个简单的问题

如果你在2015年问一个AI研究者:"未来10年,什么技术会最重要?"

他们可能会说:

  • 计算机视觉(CNN已经在ImageNet上超越人类)
  • 强化学习(AlphaGo刚刚战胜李世石)
  • 自动驾驶(特斯拉、Waymo在快速进展)

但没人会预测到:一个简单的架构(Transformer)+ 大量数据 + 大量计算 = 通用智能

这个转变的背后,有什么深层的原因吗?


从信号处理到LLM的演进

第一阶段:传统信号处理(1960s-1990s)

问题: 如何从噪声中提取信号?

方法: 设计滤波器

  • 傅里叶变换:从时域转到频域
  • 卷积:用滤波器处理信号
  • 维纳滤波:最优估计

局限: 需要人工设计滤波器,对复杂信号无能为力

原始信号 → [人工设计的滤波器] → 处理后的信号

第二阶段:浅层机器学习(1990s-2000s)

问题: 能否自动学习特征而不是手工设计?

方法: 神经网络

  • 反向传播:自动学习参数
  • 隐层:自动学习特征表示
  • 但深度有限(梯度消失)

局限: 深度网络训练困难,性能有瓶颈

原始信号 → [学习的浅层特征] → [分类器] → 输出

第三阶段:深度学习(2010s)

突破: 深度网络可以训练了!

方法:

  • CNN:卷积 + 池化 + 深度
  • RNN:序列建模
  • 关键洞察:深度 = 更强的表示能力

成就:

  • ImageNet:CNN超越人类
  • 机器翻译:RNN+注意力
  • 语音识别:深度学习主导

局限:

  • 需要大量标注数据
  • 不同任务需要不同架构
  • 泛化能力有限
原始数据 → [深度特征学习] → [任务特定的头] → 输出

第四阶段:大规模预训练(2018-2020)

转折点: BERT、GPT出现

关键洞察:

  • 用无标注数据进行预训练
  • 然后微调到下游任务
  • 一个模型可以做多个任务

成就:

  • NLP任务大幅提升
  • 迁移学习变得实用

局限:

  • 仍需微调
  • 模型大小有限(几十亿参数)
  • 任务特定性强
无标注数据 → [预训练] → [微调] → 下游任务

第五阶段:大语言模型(2020-现在)

革命性转变: 规模即能力

关键洞察:

  • 更大的模型 + 更多数据 = 涌现能力
  • 不需要微调,直接用prompt
  • 一个模型可以做几乎所有任务

成就:

  • GPT-3:少样本学习
  • ChatGPT:通用对话
  • Claude、Gemini:多模态理解

为什么这次不同?

  • 规模达到了临界点(1000亿+参数)
  • 涌现能力:模型突然学会了新技能
  • In-context learning:从prompt中学习
海量无标注数据 → [大规模预训练] → [Prompt] → 任何任务

为什么LLM能做这么多?

1. 通用的表示空间

LLM学到的是语言的通用表示,而不是特定任务的特征。

这个表示空间包含了:

  • 语义信息("国王" - "男人" + "女人" ≈ "皇后")
  • 因果关系("如果...那么...")
  • 常识("水往低处流")
  • 推理能力("2+2=4")

2. 从信号处理的角度看

传统信号处理: 设计特定的滤波器处理特定的信号

深度学习: 学习通用的特征提取器

LLM: 学习通用的理解和推理能力

信号处理:特定问题 → 特定解决方案
深度学习:特定领域 → 通用特征学习
LLM:通用理解 → 任何问题

3. 缩放律的发现

Chinchilla论文(2022)发现:

  • 模型大小和数据量应该均衡增长
  • 性能随着规模呈幂律增长
  • 没有看到性能饱和的迹象

这意味着:更大的模型 = 更强的能力(至少在可预见的未来)


从DSP到LLM的概念连接

卷积 → 注意力

DSP中的卷积: 用一个滤波器与信号相乘求和

y[n] = Σ h[k] * x[n-k]

CNN中的卷积: 学习的滤波器提取局部特征

feature = learned_filter * local_patch

Transformer中的注意力: 学习的权重关注相关的位置

output = Σ attention_weight[i] * value[i]

本质相同: 都是加权求和,只是权重的来源不同

傅里叶变换 → 位置编码

DSP中的傅里叶变换: 将信号分解为不同频率的成分

X[k] = Σ x[n] * e^(-j2πkn/N)

Transformer中的位置编码: 用不同频率的正弦波编码位置

PE(pos, 2i) = sin(pos / 10000^(2i/d))
PE(pos, 2i+1) = cos(pos / 10000^(2i/d))

本质相同: 都是用频率来表示信息

梯度下降 → 优化器

DSP中的LMS算法: 自适应滤波

w[n+1] = w[n] + μ * e[n] * x[n]

深度学习中的SGD: 随机梯度下降

w[n+1] = w[n] - α * ∇L(w[n])

现代优化器(Adam): 自适应学习率

m[n] = β₁*m[n-1] + (1-β₁)*∇L
v[n] = β₂*v[n-1] + (1-β₂)*(∇L)²
w[n+1] = w[n] - α * m[n] / √(v[n])

本质相同: 都是迭代优化,只是适应性越来越强


为什么现在?

三个条件同时满足

  1. 算法成熟 — Transformer架构(2017)
  2. 数据充足 — 互联网文本、代码等
  3. 计算便宜 — GPU/TPU成本下降

这三个条件在2018年左右同时满足,导致了LLM的爆发。

为什么不是更早?

  • 2012年:有算法(CNN),但没有足够的数据和计算
  • 2017年:有Transformer,但规模还不够大
  • 2020年:三个条件都满足了

我们在哪里?

当前阶段的特征

已实现:

  • 通用的文本理解和生成
  • 多模态理解(文本+图像)
  • 代码生成和理解
  • 推理和问题解决

? 还在探索:

  • 长上下文理解(超过100K tokens)
  • 多步推理的可靠性
  • 知识更新(不重新训练)
  • 成本优化

还没实现:

  • 真正的通用人工智能
  • 完全可解释性
  • 零成本推理

下一步是什么?

短期(1-2年)

  • 更大的模型(1万亿+参数)
  • 更长的上下文(1百万tokens)
  • 多模态融合更深入
  • 推理能力更强

中期(3-5年)

  • 模型压缩和蒸馏
  • 本地部署变得实用
  • 专用芯片优化
  • 新的架构突破?

长期(5+年)

  • 通用人工智能?
  • 新的学习范式?
  • 与人类智能的融合?

关键洞察

  1. LLM不是突然出现的 — 它是从DSP、机器学习、深度学习逐步演进而来

  2. 规模很重要 — 但不是唯一重要的。算法、数据、计算都很重要

  3. 概念是连贯的 — 从卷积到注意力,从傅里叶到位置编码,本质思想是相通的

  4. 我们还在早期 — LLM的能力还在快速增长,最好的还没来


推荐阅读

  • Attention Is All You Need (Vaswani et al., 2017)
  • Language Models are Unsupervised Multitask Learners (Radford et al., 2019)
  • Training Compute-Optimal Large Language Models (Hoffmann et al., 2022)

下一步: 阅读 学习路径 选择适合你的学习方式

本教程采用 CC BY-NC-SA 4.0 许可协议