全书概览
学习时间: 10-15分钟
8章的内容结构、关键概念和学习目标。
全书结构
第0章:导论
↓
第1章:DSP基础 ─────────────────────────────┐
↓ │
第2章:优化与机器学习 ──────────────────────┤
↓ │
第3章:深度学习快速通道 ────────────────────┤
↓ │
第4章:Transformer详解 ◄────────────────────┘
↓
第5章:LLM基础
↓
第6章:LLM应用与微调
↓
第7章:多模态LLM
↓
第8章:LLM工程实践第1章:DSP基础
主题: 从信号的三种视角理解信号处理
核心概念:
- 时域、频域、时频域三种视角
- 傅里叶变换:信号分解
- 卷积:信号处理的基本操作
- 滤波器:信号的选择性处理
关键公式:
- 离散傅里叶变换:
- 卷积:
代码实验:
- FFT频谱分析
- 位置编码(与Transformer的连接)
学习目标:
- ✓ 理解信号的三种表示方式
- ✓ 掌握傅里叶变换的直观理解
- ✓ 理解卷积的含义
- ✓ 为深度学习中的CNN做准备
学习时间: 2小时
关键连接:
- 傅里叶变换 → Transformer中的位置编码
- 卷积 → CNN中的卷积核
- 滤波器 → 神经网络的隐层
第2章:优化与机器学习
主题: 从优化算法到传统机器学习,理解ML本质是优化问题
核心概念:
优化算法部分
- 梯度下降:最基本的优化方法
- 自适应滤波:LMS算法
- 随机梯度下降:SGD
- 自适应优化器:Adam
传统机器学习部分
- 线性回归与逻辑回归:基础监督学习
- 支持向量机与核方法:最大间隔分类和非线性分类
- 决策树与随机森林:树模型和集成学习
关键公式:
- 梯度下降:
- Adam:
- 线性回归MSE:
- 逻辑回归交叉熵:
- SVM Hinge损失:
代码实验:
- MMSE vs 神经网络对比
- LMS vs Adam优化器对比
- 线性回归与逻辑回归
- SVM与核方法
- 决策树与随机森林
学习目标:
- ✓ 理解梯度下降的原理
- ✓ 掌握常用优化器的区别
- ✓ 理解机器学习本质是优化问题
- ✓ 掌握传统ML算法的核心思想
- ✓ 理解从传统ML到深度学习的演进
- ✓ 为深度学习的训练做准备
学习时间: 3-4小时(包含传统ML内容)
关键连接:
- LMS算法 → SGD → Adam(优化器的演进)
- 梯度下降 → 反向传播 → 深度学习训练
- 线性回归 → 神经网络回归
- 逻辑回归 → 神经网络分类
- SVM核方法 → 深度学习特征学习
- 集成学习 → Transformer多头注意力
第3章:深度学习快速通道
主题: CNN、RNN、为什么Transformer更好
核心概念:
- CNN:卷积神经网络(图像处理)
- RNN:循环神经网络(序列处理)
- 为什么Transformer更好:并行性、长距离依赖
关键架构:
- CNN:卷积层 → 池化层 → 全连接层
- RNN:隐状态 → 循环连接 → 序列输出
- Transformer:自注意力 → 并行处理 → 更强的表示
代码实验:
- MNIST CNN实现
- RNN结构观察
- CNN vs RNN vs Transformer的对比
学习目标:
- ✓ 理解CNN的卷积和池化
- ✓ 理解RNN的循环结构
- ✓ 理解为什么Transformer更优
- ✓ 为LLM的学习做准备
学习时间: 2小时
关键连接:
- CNN中的卷积 ← DSP中的卷积
- RNN的隐状态 ← 状态空间模型
- Transformer的优势 → LLM的基础
第4章:Transformer详解
主题: 自注意力机制和Transformer架构
核心概念:
- 自注意力:关注序列中的相关位置
- 多头注意力:多个注意力头并行
- 位置编码:编码位置信息
- Transformer架构:编码器-解码器
关键公式:
- 缩放点积注意力:
- 多头注意力:
- 位置编码:
代码实验:
- 自注意力权重可视化
- 多头注意力的作用
- 位置编码的效果
学习目标:
- ✓ 理解自注意力的原理
- ✓ 理解多头注意力的作用
- ✓ 理解位置编码的必要性
- ✓ 理解完整的Transformer架构
学习时间: 2小时
关键连接:
- 自注意力 ← DSP中的卷积(都是加权求和)
- 位置编码 ← 傅里叶变换(都用频率表示)
- Transformer → LLM的基础架构
第5章:LLM基础
主题: 预训练、缩放律、In-context Learning
核心概念:
- 预训练:用无标注数据学习语言
- 缩放律:规模与性能的关系
- In-context Learning:从prompt中学习
- 涌现能力:模型突然学会新技能
关键发现:
- Chinchilla缩放律:
- 性能随规模呈幂律增长
- 没有看到饱和迹象
代码实验:
- 调用LLM API
- Prompt工程实验
- In-context Learning演示
学习目标:
- ✓ 理解LLM的预训练过程
- ✓ 理解缩放律的含义
- ✓ 掌握Prompt工程的基本技巧
- ✓ 理解In-context Learning的原理
学习时间: 2小时
关键概念:
- 预训练 ← 无监督学习
- 缩放律 ← 经验规律
- In-context Learning ← 新的学习范式
第6章:LLM应用与微调
主题: RAG、Agent、微调技术
核心概念:
- RAG(检索增强生成):用外部知识增强LLM
- Agent:让LLM能使用工具
- 微调:在特定任务上优化LLM
- 微调 vs Prompt工程的权衡
关键技术:
- 向量数据库:存储和检索知识
- 工具调用:LLM调用外部API
- 参数高效微调:LoRA等技术
代码实验:
- 构建完整的RAG系统
- 构建简单的Agent框架
- 微调 vs Prompt工程的对比
学习目标:
- ✓ 理解RAG的原理和实现
- ✓ 理解Agent的工作流程
- ✓ 掌握微调的基本技巧
- ✓ 能构建完整的LLM应用
学习时间: 2小时
关键应用:
- RAG → 知识库问答
- Agent → 自动化任务
- 微调 → 特定领域优化
第7章:多模态LLM
主题: 视觉与语言的融合
核心概念:
- 视觉编码器:将图像转换为向量
- 视觉-语言对齐:连接图像和文本
- 多模态理解:同时处理图像和文本
- 多模态应用:图像描述、视觉问答等
关键模型:
- CLIP:视觉-语言对齐
- ViT:视觉Transformer
- GPT-4V、Claude Vision:多模态LLM
代码实验:
- 多模态API调用
- 图像理解和描述
- 跨模态检索
学习目标:
- ✓ 理解多模态学习的原理
- ✓ 理解视觉编码器的作用
- ✓ 能使用多模态LLM API
- ✓ 能构建多模态应用
学习时间: 1小时
关键应用:
- 图像描述
- 视觉问答
- 文档理解
第8章:LLM工程实践
主题: 模型选型、成本优化、监控与部署
核心概念:
- 模型选型:性能、成本、上下文长度和可部署性
- 成本优化:缓存、批处理、模型分层
- 监控:延迟、错误、质量和资源使用
- 部署:API、自托管和混合方案
关键内容:
- 工程化选型思路
- 成本与延迟权衡
- 运行时监控与失败处理
- 自托管与 API 的部署对比
代码实验:
- 模型选型演示
- 成本优化演示
- 监控与容错演示
学习目标:
- ✓ 理解 LLM 应用中的工程决策
- ✓ 掌握常见成本优化方法
- ✓ 理解监控和容错的重要性
- ✓ 能把模型能力与部署约束一起考虑
学习时间: 1小时
三个附录
附录A:数学备忘
全书通用基础公式速查:线性代数、概率统计、复数、信号处理、优化、激活函数、常用符号。 → 附录A:数学备忘
附录D:数学基础速查表
各章按需补充的数学专题导航(图论、信息论、凸分析、随机过程、线性系统等),每节含关键公式和对应 extensions 深度阅读链接。 → 附录D:数学基础速查表
附录B:环境配置
详细的环境配置指南:
- Python环境设置
- 依赖安装(包括LLM API)
- API密钥配置
- IDE配置
→ 附录B:环境配置
附录C:代码运行指南
所有代码实验的运行方法:
- 代码组织结构
- 运行单个实验
- 运行所有测试
- 常见问题解答
学习路线图
快速通道(8-12小时)
第4章 Transformer
↓
第5章 LLM基础
↓
第6章 LLM应用
↓
第7章 多模态LLM完整路径(20-30小时)
第1章 DSP基础
↓
第2章 优化与机器学习
↓
第3章 深度学习快速通道
↓
第4章 Transformer详解
↓
第5章 LLM基础
↓
第6章 LLM应用
↓
第7章 多模态LLM
↓
第8章 LLM工程实践关键概念速览
| 章节 | 核心概念 | 关键公式 | 代码实验 |
|---|---|---|---|
| 第1章 | 傅里叶变换、卷积 | FFT、位置编码 | |
| 第2章 | 梯度下降、优化器 | LMS vs Adam | |
| 第3章 | CNN、RNN、Transformer | 卷积、循环、注意力 | MNIST、RNN、对比 |
| 第4章 | 自注意力、多头注意力 | 权重可视化 | |
| 第5章 | 预训练、缩放律 | API调用、Prompt | |
| 第6章 | RAG、Agent、微调 | 向量检索、工具调用 | RAG系统、Agent |
| 第7章 | 多模态学习 | 视觉编码、对齐 | 图像理解 |
| 第8章 | 模型选型、成本优化 | 工程约束、部署权衡 | 监控、容错、部署 |
学习建议
时间分配
- 理论学习: 50%
- 代码实验: 30%
- 思考和总结: 20%
学习方式
- 先看代码 — 运行实验,看到现象
- 再看理论 — 理解现象背后的原理
- 最后总结 — 用自己的话解释
常见误区
❌ 只看理论不运行代码 — 无法深刻理解 ❌ 只运行代码不看理论 — 无法举一反三 ❌ 跳过基础章节 — 无法理解后续内容 ❌ 一次性学完 — 容易遗忘,需要分阶段
推荐的学习节奏
提示: 还没选择学习路径?先看 学习路径 → 快速判断表 了解自己适合哪条路径。
每天的学习流程
热身(5分钟)
- 回顾昨天的内容
- 明确今天的目标
理论学习(30-45分钟)
- 阅读章节内容
- 记录关键概念
- 查看推荐论文
代码实验(30-45分钟)
- 运行代码
- 观察输出
- 修改参数
思考和总结(15-20分钟)
- 总结关键点
- 记录疑问
- 思考应用
每周的学习计划
- 周一-周四: 学习新内容
- 周五: 复习和练习
- 周末: 深入思考和项目实践
完成后的下一步
短期(1-2周)
- 阅读推荐论文
- 做一个小项目
- 参与讨论
中期(1-3个月)
- 阅读最新论文
- 做一个中等规模的项目
- 参与开源项目
长期(3个月+)
- 进行研究或创新
- 发表文章或论文
- 成为领域专家
获取帮助
- 数学问题? → 查看 附录A:数学备忘
- 代码问题? → 查看 附录C:代码运行指南
- 环境问题? → 查看 附录B:环境配置
- 概念不清? → 重新阅读相关章节或查看extensions
下一步: 选择你的学习路径,开始学习!
- 快速通道? → 从 第4章:Transformer详解 开始
- 完整路径? → 从 第1章:DSP基础 开始
- 深度探索? → 从 第1章:DSP基础 开始,并阅读所有extensions
