⚠️ Alpha内测版本警告:此为早期内部构建版本,尚不完整且可能存在错误,欢迎大家提Issue反馈问题或建议。
Skip to content

全书概览

学习时间: 10-15分钟

8章的内容结构、关键概念和学习目标。


全书结构

第0章:导论

第1章:DSP基础 ─────────────────────────────┐
  ↓                                          │
第2章:优化与机器学习 ──────────────────────┤
  ↓                                          │
第3章:深度学习快速通道 ────────────────────┤
  ↓                                          │
第4章:Transformer详解 ◄────────────────────┘

第5章:LLM基础

第6章:LLM应用与微调

第7章:多模态LLM

第8章:LLM工程实践

第1章:DSP基础

主题: 从信号的三种视角理解信号处理

核心概念:

  • 时域、频域、时频域三种视角
  • 傅里叶变换:信号分解
  • 卷积:信号处理的基本操作
  • 滤波器:信号的选择性处理

关键公式:

  • 离散傅里叶变换:X[k]=n=0N1x[n]ej2πkn/N
  • 卷积:y[n]=mx[m]h[nm]

代码实验:

  • FFT频谱分析
  • 位置编码(与Transformer的连接)

学习目标:

  • ✓ 理解信号的三种表示方式
  • ✓ 掌握傅里叶变换的直观理解
  • ✓ 理解卷积的含义
  • ✓ 为深度学习中的CNN做准备

学习时间: 2小时

关键连接:

  • 傅里叶变换 → Transformer中的位置编码
  • 卷积 → CNN中的卷积核
  • 滤波器 → 神经网络的隐层

第2章:优化与机器学习

主题: 从优化算法到传统机器学习,理解ML本质是优化问题

核心概念:

优化算法部分

  • 梯度下降:最基本的优化方法
  • 自适应滤波:LMS算法
  • 随机梯度下降:SGD
  • 自适应优化器:Adam

传统机器学习部分

  • 线性回归与逻辑回归:基础监督学习
  • 支持向量机与核方法:最大间隔分类和非线性分类
  • 决策树与随机森林:树模型和集成学习

关键公式:

  • 梯度下降:wt+1=wtαL(wt)
  • Adam:wt+1=wtαmtvt+ϵ
  • 线性回归MSE:L=1n(yiy^i)2
  • 逻辑回归交叉熵:L=1n[yilog(y^i)+(1yi)log(1y^i)]
  • SVM Hinge损失:L=max(0,1yy^)

代码实验:

  • MMSE vs 神经网络对比
  • LMS vs Adam优化器对比
  • 线性回归与逻辑回归
  • SVM与核方法
  • 决策树与随机森林

学习目标:

  • ✓ 理解梯度下降的原理
  • ✓ 掌握常用优化器的区别
  • ✓ 理解机器学习本质是优化问题
  • ✓ 掌握传统ML算法的核心思想
  • ✓ 理解从传统ML到深度学习的演进
  • ✓ 为深度学习的训练做准备

学习时间: 3-4小时(包含传统ML内容)

关键连接:

  • LMS算法 → SGD → Adam(优化器的演进)
  • 梯度下降 → 反向传播 → 深度学习训练
  • 线性回归 → 神经网络回归
  • 逻辑回归 → 神经网络分类
  • SVM核方法 → 深度学习特征学习
  • 集成学习 → Transformer多头注意力

第3章:深度学习快速通道

主题: CNN、RNN、为什么Transformer更好

核心概念:

  • CNN:卷积神经网络(图像处理)
  • RNN:循环神经网络(序列处理)
  • 为什么Transformer更好:并行性、长距离依赖

关键架构:

  • CNN:卷积层 → 池化层 → 全连接层
  • RNN:隐状态 → 循环连接 → 序列输出
  • Transformer:自注意力 → 并行处理 → 更强的表示

代码实验:

  • MNIST CNN实现
  • RNN结构观察
  • CNN vs RNN vs Transformer的对比

学习目标:

  • ✓ 理解CNN的卷积和池化
  • ✓ 理解RNN的循环结构
  • ✓ 理解为什么Transformer更优
  • ✓ 为LLM的学习做准备

学习时间: 2小时

关键连接:

  • CNN中的卷积 ← DSP中的卷积
  • RNN的隐状态 ← 状态空间模型
  • Transformer的优势 → LLM的基础

第4章:Transformer详解

主题: 自注意力机制和Transformer架构

核心概念:

  • 自注意力:关注序列中的相关位置
  • 多头注意力:多个注意力头并行
  • 位置编码:编码位置信息
  • Transformer架构:编码器-解码器

关键公式:

  • 缩放点积注意力:Attention(Q,K,V)=softmax(QKTdk)V
  • 多头注意力:MultiHead(Q,K,V)=Concat(head1,...,headh)WO
  • 位置编码:PE(pos,2i)=sin(pos100002i/d)

代码实验:

  • 自注意力权重可视化
  • 多头注意力的作用
  • 位置编码的效果

学习目标:

  • ✓ 理解自注意力的原理
  • ✓ 理解多头注意力的作用
  • ✓ 理解位置编码的必要性
  • ✓ 理解完整的Transformer架构

学习时间: 2小时

关键连接:

  • 自注意力 ← DSP中的卷积(都是加权求和)
  • 位置编码 ← 傅里叶变换(都用频率表示)
  • Transformer → LLM的基础架构

第5章:LLM基础

主题: 预训练、缩放律、In-context Learning

核心概念:

  • 预训练:用无标注数据学习语言
  • 缩放律:规模与性能的关系
  • In-context Learning:从prompt中学习
  • 涌现能力:模型突然学会新技能

关键发现:

  • Chinchilla缩放律:L(N,D)E+ANα+BDβ
  • 性能随规模呈幂律增长
  • 没有看到饱和迹象

代码实验:

  • 调用LLM API
  • Prompt工程实验
  • In-context Learning演示

学习目标:

  • ✓ 理解LLM的预训练过程
  • ✓ 理解缩放律的含义
  • ✓ 掌握Prompt工程的基本技巧
  • ✓ 理解In-context Learning的原理

学习时间: 2小时

关键概念:

  • 预训练 ← 无监督学习
  • 缩放律 ← 经验规律
  • In-context Learning ← 新的学习范式

第6章:LLM应用与微调

主题: RAG、Agent、微调技术

核心概念:

  • RAG(检索增强生成):用外部知识增强LLM
  • Agent:让LLM能使用工具
  • 微调:在特定任务上优化LLM
  • 微调 vs Prompt工程的权衡

关键技术:

  • 向量数据库:存储和检索知识
  • 工具调用:LLM调用外部API
  • 参数高效微调:LoRA等技术

代码实验:

  • 构建完整的RAG系统
  • 构建简单的Agent框架
  • 微调 vs Prompt工程的对比

学习目标:

  • ✓ 理解RAG的原理和实现
  • ✓ 理解Agent的工作流程
  • ✓ 掌握微调的基本技巧
  • ✓ 能构建完整的LLM应用

学习时间: 2小时

关键应用:

  • RAG → 知识库问答
  • Agent → 自动化任务
  • 微调 → 特定领域优化

第7章:多模态LLM

主题: 视觉与语言的融合

核心概念:

  • 视觉编码器:将图像转换为向量
  • 视觉-语言对齐:连接图像和文本
  • 多模态理解:同时处理图像和文本
  • 多模态应用:图像描述、视觉问答等

关键模型:

  • CLIP:视觉-语言对齐
  • ViT:视觉Transformer
  • GPT-4V、Claude Vision:多模态LLM

代码实验:

  • 多模态API调用
  • 图像理解和描述
  • 跨模态检索

学习目标:

  • ✓ 理解多模态学习的原理
  • ✓ 理解视觉编码器的作用
  • ✓ 能使用多模态LLM API
  • ✓ 能构建多模态应用

学习时间: 1小时

关键应用:

  • 图像描述
  • 视觉问答
  • 文档理解

第8章:LLM工程实践

主题: 模型选型、成本优化、监控与部署

核心概念:

  • 模型选型:性能、成本、上下文长度和可部署性
  • 成本优化:缓存、批处理、模型分层
  • 监控:延迟、错误、质量和资源使用
  • 部署:API、自托管和混合方案

关键内容:

  • 工程化选型思路
  • 成本与延迟权衡
  • 运行时监控与失败处理
  • 自托管与 API 的部署对比

代码实验:

  • 模型选型演示
  • 成本优化演示
  • 监控与容错演示

学习目标:

  • ✓ 理解 LLM 应用中的工程决策
  • ✓ 掌握常见成本优化方法
  • ✓ 理解监控和容错的重要性
  • ✓ 能把模型能力与部署约束一起考虑

学习时间: 1小时


三个附录

附录A:数学备忘

全书通用基础公式速查:线性代数、概率统计、复数、信号处理、优化、激活函数、常用符号。 → 附录A:数学备忘

附录D:数学基础速查表

各章按需补充的数学专题导航(图论、信息论、凸分析、随机过程、线性系统等),每节含关键公式和对应 extensions 深度阅读链接。 → 附录D:数学基础速查表

附录B:环境配置

详细的环境配置指南:

  • Python环境设置
  • 依赖安装(包括LLM API)
  • API密钥配置
  • IDE配置

附录B:环境配置

附录C:代码运行指南

所有代码实验的运行方法:

  • 代码组织结构
  • 运行单个实验
  • 运行所有测试
  • 常见问题解答

附录C:代码运行指南


学习路线图

快速通道(8-12小时)

第4章 Transformer

第5章 LLM基础

第6章 LLM应用

第7章 多模态LLM

完整路径(20-30小时)

第1章 DSP基础

第2章 优化与机器学习

第3章 深度学习快速通道

第4章 Transformer详解

第5章 LLM基础

第6章 LLM应用

第7章 多模态LLM

第8章 LLM工程实践

关键概念速览

章节核心概念关键公式代码实验
第1章傅里叶变换、卷积X[k]=x[n]ej2πkn/NFFT、位置编码
第2章梯度下降、优化器wt+1=wtαLLMS vs Adam
第3章CNN、RNN、Transformer卷积、循环、注意力MNIST、RNN、对比
第4章自注意力、多头注意力Attention(Q,K,V)权重可视化
第5章预训练、缩放律L(N,D)E+A/NαAPI调用、Prompt
第6章RAG、Agent、微调向量检索、工具调用RAG系统、Agent
第7章多模态学习视觉编码、对齐图像理解
第8章模型选型、成本优化工程约束、部署权衡监控、容错、部署

学习建议

时间分配

  • 理论学习: 50%
  • 代码实验: 30%
  • 思考和总结: 20%

学习方式

  1. 先看代码 — 运行实验,看到现象
  2. 再看理论 — 理解现象背后的原理
  3. 最后总结 — 用自己的话解释

常见误区

只看理论不运行代码 — 无法深刻理解 ❌ 只运行代码不看理论 — 无法举一反三 ❌ 跳过基础章节 — 无法理解后续内容 ❌ 一次性学完 — 容易遗忘,需要分阶段


推荐的学习节奏

提示: 还没选择学习路径?先看 学习路径 → 快速判断表 了解自己适合哪条路径。

每天的学习流程

  1. 热身(5分钟)

    • 回顾昨天的内容
    • 明确今天的目标
  2. 理论学习(30-45分钟)

    • 阅读章节内容
    • 记录关键概念
    • 查看推荐论文
  3. 代码实验(30-45分钟)

    • 运行代码
    • 观察输出
    • 修改参数
  4. 思考和总结(15-20分钟)

    • 总结关键点
    • 记录疑问
    • 思考应用

每周的学习计划

  • 周一-周四: 学习新内容
  • 周五: 复习和练习
  • 周末: 深入思考和项目实践

完成后的下一步

短期(1-2周)

  • 阅读推荐论文
  • 做一个小项目
  • 参与讨论

中期(1-3个月)

  • 阅读最新论文
  • 做一个中等规模的项目
  • 参与开源项目

长期(3个月+)

  • 进行研究或创新
  • 发表文章或论文
  • 成为领域专家

获取帮助


下一步: 选择你的学习路径,开始学习!

本教程采用 CC BY-NC-SA 4.0 许可协议