Group 2.10: Project Practice | 2.10: 项目实战
本组用于承接综合项目、性能对比与训练分析,是 Part 2 的项目收束层。这里不再展开单个方法原理,而是把前面各组的能力收成可比较、可复现、可决策的工程验证入口。
Group Overview | 组概览
这一组把前面各组学到的能力放回真实项目里做收口,优先保证“训练 -> 推理 -> 性能分析”的闭环完整。阅读顺序和组内资产见下表,先做核心项目,再进入进阶项目。60-65 这一段主归属仍是训练微调,其中 61 明确作为架构支撑项目,用来把 2.2 的结构判断接回训练项目线。新增的“横向专题”列表示项目的主叙事入口;一个项目可以被多个专题复用,但只保留一个主归属。
Group Asset Overview | 组内资产总览
| 项目 | 项目角色 | Practice 实践级别 | 上游来源 | 横向专题 | 作用 |
|---|---|---|---|---|---|
| 60 LoRA 微调项目 | 核心项目 | Practice-P1 模板:训练 GPU | 2.3 训练与微调闭环 | 训练微调 | 微调训练闭环 |
| 61 架构验证项目 | 核心项目 | Practice-P1 单 GPU | 2.2 模型架构 | 大模型架构 | 架构支撑与验证对比 |
| 62 指令微调项目 | 核心项目 | Practice-P1 单 GPU | 2.3 训练与微调闭环 | 训练微调 | 指令微调验证 |
| 63 LoRA 变体对比 | 核心项目 | Practice-P1 单 GPU | 2.3 训练与微调闭环 | 训练微调 | LoRA 变体选型 |
| 73 训练性能分析 | 核心项目 | Practice-P1 模板:性能 GPU | 2.5 反向传播与显存优化 | 显存优化 | 训练性能分析 |
| 66 推理性能对比实验 | 核心项目 | Practice-P2 真实 backend(无 GPU 可 P1) | 2.6 核心推理优化 | 推理优化 | 推理性能选型 |
| 68 推测解码基准 | 扩展项目 | Practice-P1/P2 | 2.7 高级推理策略 | 推理优化 | 推测解码基准 |
| 69 前缀缓存基准 | 主题项目 | Practice-P1/P2 | 2.7 高级推理策略 | 推理优化 | 前缀缓存基准 |
| 70 推理服务调度基准 | 扩展项目 | Practice-P1/P2 | 2.7 高级推理策略 | 推理优化 | 服务调度基准 |
| 74 profiling 驱动的端到端优化项目 | 进阶项目 | Practice-P1/P2 跨域 profiling | 显存优化专题 | Profiling | 显存优化路线的端到端最终收口 |
| 79 分布式并行基准项目 | 进阶项目 | Practice-P3 分布式系统 | 2.9 分布式并行策略 | 通信与并行 | 并行策略选型 |
| 80 MoE 专家并行 benchmark | 进阶项目 | Practice-P3 分布式系统 | 2.9 分布式并行策略 | 通信与并行 | MoE 并行选型 |
| 81 分布式推理逻辑验证 | 进阶项目 | Practice-P3 分布式系统 | 2.9 分布式并行策略 | 通信与并行 | 分布式推理验证 |
| 67 量化推理与部署项目 | 主题项目 | Practice-P1/P2 | 2.8 模型压缩与量化 | 量化与压缩 | 量化部署验证 |
| 84 DPO 偏好优化项目 | 进阶项目 | Practice-P1 单 GPU | 2.4 偏好优化与对齐 | 后训练与对齐 | DPO 偏好对齐 |
| 85 GRPO 组内对齐项目 | 进阶项目 | Practice-P1 单 GPU | 2.4 偏好优化与对齐 | 后训练与对齐 | GRPO 组内对齐 |
| 86 DPO 在线基准 | 进阶项目 | Practice-P2 真实 backend | 2.4 偏好优化与对齐 | 后训练与对齐 | 在线对齐基准 |
| 64 SFT 数据质量项目 | 进阶项目 | Practice-P0/P1 CPU-first→GPU | 2.3 训练与微调闭环 | 训练微调 | 数据质量与模板评测 |
| 65 QLoRA 选型项目 | 进阶项目 | Practice-P1 单 GPU | 2.8 模型压缩与量化 | 量化与压缩 | 低资源微调选型 |
| 71-72 | 预留位 | 待定 | 推理优化 | — | 预留 |
| 75 显存预算压缩项目 | 进阶项目 | Practice-P1 模板:显存预算 | 2.5 反向传播与显存优化 | 显存优化 | 显存预算、质量门槛与方案决策 |
| 76 Activation / Checkpoint / Offload 对比项目 | 进阶项目 | Practice-P1 专项 benchmark | 2.5 反向传播与显存优化 | 显存优化 | checkpoint / offload / hybrid 策略对比 |
| 77-78 | 预留位 | 待定 | 显存优化 | — | 预留 |
| 82-83 | 预留位 | 待定 | 通信与并行 | — | 预留 |
| 87-89 | 预留位 | 待定 | 通用预留 | — | 预留 |
Practice 实践级别说明:Practice-P0 为 CPU-first 逻辑验证;Practice-P1 为单 GPU、本地模型或单机 profiling / 显存实验;Practice-P2 为 vLLM / SGLang 等真实 inference backend;Practice-P3 为多 GPU、分布式通信或分布式 serving。74 是显存优化路线的跨域 profiling 收口项目,基础路径按 Practice-P1 执行,若接入真实 inference backend 则进入 Practice-P2。实践级别表示推荐的真实实验深度,不意味着没有对应硬件时无法阅读项目。
显存优化线的职责边界:73 是训练侧 Practice-P1 测量入口,负责建立 step time、吞吐、峰值显存和 loss 的统一口径;76 是训练侧专项 benchmark,负责测量 checkpoint、offload 和 hybrid 的真实代价;75 是训练侧预算决策,负责定义显存上限、吞吐下限、质量下限和最终 accept / tune / reject;74 是最终收口项目,负责用 profiling 和端到端 workload 验证前面方案是否值得保留,不替代 75 的局部预算决策。
Cross-topic Reuse | 跨专题复用与 Infra 层
主表中的“横向专题”表示项目的主叙事入口。下面的索引只记录需要跨专题复用的项目,避免把组内资产表继续拉宽;“Infra 层”描述项目主要落在五层架构的哪里,与上表的“Practice 实践级别”(实验所需硬件/系统深度)不是同一个概念。
| 项目 | 主专题 | 关联专题 | Infra 层 |
|---|---|---|---|
| 60 LoRA 微调 | 训练微调 | 反向传播、显存优化 | Infra-L1/Infra-L3 |
| 61 架构验证 | 大模型架构 | 推理优化、编译图优化 | 负载面/Infra-L3 |
| 65 QLoRA 选型 | 量化与压缩 | 训练微调、显存优化 | Infra-L2/Infra-L3 |
| 66 推理性能对比 | 推理优化 | 量化、编译图优化、显存优化、Profiling | Infra-L2–Infra-L4 |
| 67 量化推理部署 | 量化与压缩 | 推理优化、编译图优化、显存优化 | Infra-L2–Infra-L4 |
| 73 训练性能分析 | 显存优化 | Profiling、反向传播 | Infra-L1–Infra-L3 |
| 74 端到端优化 | 显存优化 | Profiling、推理优化、编译图优化、通信与并行 | Infra-L1–Infra-L5 |
| 75 显存预算压缩 | 显存优化 | Profiling、量化、反向传播 | Infra-L1/Infra-L3/Infra-L5 |
| 76 激活检查点与 Offload | 显存优化 | 反向传播、Profiling | Infra-L1/Infra-L3 |
| 79 分布式并行基准 | 通信与并行 | Profiling、显存优化、编译图优化 | Infra-L1–Infra-L3 |
| 80 MoE 专家并行 | 通信与并行 | 大模型架构、Profiling | Infra-L2–Infra-L4 |
| 81 分布式推理验证 | 通信与并行 | 推理优化、Profiling | Infra-L3–Infra-L5 |
| 84-86 后训练项目线 | 后训练与对齐 | 训练微调、推理优化、Profiling | Infra-L3–Infra-L5 |
Learning Path | 学习路径
Recommended Order | 推荐顺序
- 训练微调: 60 -> 61 -> 62 -> 63 -> 64 -> 65
- 推理与部署: 66 -> 68 -> 69 -> 70 -> 67
- 显存优化项目: 73 -> 76 -> 75 -> 74
- 分布式与对齐扩展: 79 -> 80 -> 81 -> 84 -> 85 -> 86
Next Steps | 后续衔接
- 做完训练、推理或分析项目后,可回看 2.3、2.5、2.6、2.9 复盘对应能力来源。
- 如果要继续加深工程化能力,可沿专题入口和后续项目线继续展开:推理侧回看
38/39,显存侧回看43/44/45,通信侧回看48/49,对齐侧回看51/52。
Environment Notes | 环境说明
- 默认按
CPU-first阅读,核心项目优先保证逻辑和 correctness 验证。 - 这里只写组级统一前提,不点到具体节号。
- 进阶项目中的 profiling、分布式或部署验证,若需要 GPU / 多卡 / 工具链支持,以单页说明为准。
