为什么是LLM时代?
学习时间: 15-20分钟
从信号处理的历史视角,理解为什么大语言模型(LLM)成为了当今AI的中心。
一个简单的问题
如果你在2015年问一个AI研究者:"未来10年,什么技术会最重要?"
他们可能会说:
- 计算机视觉(CNN已经在ImageNet上超越人类)
- 强化学习(AlphaGo刚刚战胜李世石)
- 自动驾驶(特斯拉、Waymo在快速进展)
但没人会预测到:一个简单的架构(Transformer)+ 大量数据 + 大量计算 = 通用智能
这个转变的背后,有什么深层的原因吗?
从信号处理到LLM的演进
第一阶段:传统信号处理(1960s-1990s)
问题: 如何从噪声中提取信号?
方法: 设计滤波器
- 傅里叶变换:从时域转到频域
- 卷积:用滤波器处理信号
- 维纳滤波:最优估计
局限: 需要人工设计滤波器,对复杂信号无能为力
原始信号 → [人工设计的滤波器] → 处理后的信号第二阶段:浅层机器学习(1990s-2000s)
问题: 能否自动学习特征而不是手工设计?
方法: 神经网络
- 反向传播:自动学习参数
- 隐层:自动学习特征表示
- 但深度有限(梯度消失)
局限: 深度网络训练困难,性能有瓶颈
原始信号 → [学习的浅层特征] → [分类器] → 输出第三阶段:深度学习(2010s)
突破: 深度网络可以训练了!
方法:
- CNN:卷积 + 池化 + 深度
- RNN:序列建模
- 关键洞察:深度 = 更强的表示能力
成就:
- ImageNet:CNN超越人类
- 机器翻译:RNN+注意力
- 语音识别:深度学习主导
局限:
- 需要大量标注数据
- 不同任务需要不同架构
- 泛化能力有限
原始数据 → [深度特征学习] → [任务特定的头] → 输出第四阶段:大规模预训练(2018-2020)
转折点: BERT、GPT出现
关键洞察:
- 用无标注数据进行预训练
- 然后微调到下游任务
- 一个模型可以做多个任务
成就:
- NLP任务大幅提升
- 迁移学习变得实用
局限:
- 仍需微调
- 模型大小有限(几十亿参数)
- 任务特定性强
无标注数据 → [预训练] → [微调] → 下游任务第五阶段:大语言模型(2020-现在)
革命性转变: 规模即能力
关键洞察:
- 更大的模型 + 更多数据 = 涌现能力
- 不需要微调,直接用prompt
- 一个模型可以做几乎所有任务
成就:
- GPT-3:少样本学习
- ChatGPT:通用对话
- Claude、Gemini:多模态理解
为什么这次不同?
- 规模达到了临界点(1000亿+参数)
- 涌现能力:模型突然学会了新技能
- In-context learning:从prompt中学习
海量无标注数据 → [大规模预训练] → [Prompt] → 任何任务为什么LLM能做这么多?
1. 通用的表示空间
LLM学到的是语言的通用表示,而不是特定任务的特征。
这个表示空间包含了:
- 语义信息("国王" - "男人" + "女人" ≈ "皇后")
- 因果关系("如果...那么...")
- 常识("水往低处流")
- 推理能力("2+2=4")
2. 从信号处理的角度看
传统信号处理: 设计特定的滤波器处理特定的信号
深度学习: 学习通用的特征提取器
LLM: 学习通用的理解和推理能力
信号处理:特定问题 → 特定解决方案
深度学习:特定领域 → 通用特征学习
LLM:通用理解 → 任何问题3. 缩放律的发现
Chinchilla论文(2022)发现:
- 模型大小和数据量应该均衡增长
- 性能随着规模呈幂律增长
- 没有看到性能饱和的迹象
这意味着:更大的模型 = 更强的能力(至少在可预见的未来)
从DSP到LLM的概念连接
卷积 → 注意力
DSP中的卷积: 用一个滤波器与信号相乘求和
y[n] = Σ h[k] * x[n-k]CNN中的卷积: 学习的滤波器提取局部特征
feature = learned_filter * local_patchTransformer中的注意力: 学习的权重关注相关的位置
output = Σ attention_weight[i] * value[i]本质相同: 都是加权求和,只是权重的来源不同
傅里叶变换 → 位置编码
DSP中的傅里叶变换: 将信号分解为不同频率的成分
X[k] = Σ x[n] * e^(-j2πkn/N)Transformer中的位置编码: 用不同频率的正弦波编码位置
PE(pos, 2i) = sin(pos / 10000^(2i/d))
PE(pos, 2i+1) = cos(pos / 10000^(2i/d))本质相同: 都是用频率来表示信息
梯度下降 → 优化器
DSP中的LMS算法: 自适应滤波
w[n+1] = w[n] + μ * e[n] * x[n]深度学习中的SGD: 随机梯度下降
w[n+1] = w[n] - α * ∇L(w[n])现代优化器(Adam): 自适应学习率
m[n] = β₁*m[n-1] + (1-β₁)*∇L
v[n] = β₂*v[n-1] + (1-β₂)*(∇L)²
w[n+1] = w[n] - α * m[n] / √(v[n])本质相同: 都是迭代优化,只是适应性越来越强
为什么现在?
三个条件同时满足
- 算法成熟 — Transformer架构(2017)
- 数据充足 — 互联网文本、代码等
- 计算便宜 — GPU/TPU成本下降
这三个条件在2018年左右同时满足,导致了LLM的爆发。
为什么不是更早?
- 2012年:有算法(CNN),但没有足够的数据和计算
- 2017年:有Transformer,但规模还不够大
- 2020年:三个条件都满足了
我们在哪里?
当前阶段的特征
✓ 已实现:
- 通用的文本理解和生成
- 多模态理解(文本+图像)
- 代码生成和理解
- 推理和问题解决
? 还在探索:
- 长上下文理解(超过100K tokens)
- 多步推理的可靠性
- 知识更新(不重新训练)
- 成本优化
✗ 还没实现:
- 真正的通用人工智能
- 完全可解释性
- 零成本推理
下一步是什么?
短期(1-2年)
- 更大的模型(1万亿+参数)
- 更长的上下文(1百万tokens)
- 多模态融合更深入
- 推理能力更强
中期(3-5年)
- 模型压缩和蒸馏
- 本地部署变得实用
- 专用芯片优化
- 新的架构突破?
长期(5+年)
- 通用人工智能?
- 新的学习范式?
- 与人类智能的融合?
关键洞察
LLM不是突然出现的 — 它是从DSP、机器学习、深度学习逐步演进而来
规模很重要 — 但不是唯一重要的。算法、数据、计算都很重要
概念是连贯的 — 从卷积到注意力,从傅里叶到位置编码,本质思想是相通的
我们还在早期 — LLM的能力还在快速增长,最好的还没来
推荐阅读
- Attention Is All You Need (Vaswani et al., 2017)
- Language Models are Unsupervised Multitask Learners (Radford et al., 2019)
- Training Compute-Optimal Large Language Models (Hoffmann et al., 2022)
下一步: 阅读 学习路径 选择适合你的学习方式
