Group 2.10: Project Practice | 2.10: 项目实战
本组用于承接综合项目、性能对比与训练分析,是 Part 2 的项目收束层。这里不再展开单个方法原理,而是把前面各组的能力收成可比较、可复现、可决策的工程验证入口。
Group Overview | 组概览
这一组把前面各组学到的能力放回真实项目里做收口,优先保证“训练 -> 推理 -> 性能分析”的闭环完整。阅读顺序和组内资产见下表。60-65 这一段主归属仍是训练微调,其中 61 明确作为架构支撑项目,用来把 2.2 的结构判断接回训练项目线。表中的“归属与复用”说明项目从哪里来、如何被复用;一个项目可以被多个专题复用,但只保留一个主归属。下图先展示各项目组的承接关系,资产表再补充每个项目的类型、环境和 Infra 层。
Group Asset Overview | 组内资产总览
| 项目类型 | 项目 | 主要作用 | 归属与复用 | 运行环境 | Infra 层 |
|---|---|---|---|---|---|
| Project | 60 LoRA 微调项目 | 微调训练闭环 | 主归属:2.3 训练与微调闭环 · 训练微调;关联:显存优化 | 单 GPU · Transformers / PEFT · fine-tuning.txt + torch-cu128.txt | Infra-L1 / Infra-L3 |
| 62 指令微调项目 | 指令微调验证 | 主归属:2.3 训练与微调闭环 · 训练微调 | 单 GPU · Transformers / PEFT · fine-tuning.txt + torch-cu128.txt | Infra-L3 | |
| 64 SFT 数据质量项目 | 数据质量与模板评测 | 主归属:2.3 训练与微调闭环 · 训练微调;关联:显存优化 | CPU · Python / 数据处理 · base.txt + torch-cpu.txt;可选单 GPU · fine-tuning.txt + torch-cu128.txt | Infra-L3 | |
| 67 量化推理与部署项目 | 量化部署验证 | 主归属:2.8 模型压缩与量化 · 量化与压缩;关联:推理优化、编译图优化、显存优化 | 单 GPU · Transformers / 量化 backend · torch-cu128.txt;可选 vLLM · inference-vllm.txt | Infra-L2–Infra-L4 | |
| 81 分布式推理逻辑验证 | 分布式推理验证 | 主归属:2.9 分布式并行策略 · 通信与并行;关联:推理优化、性能分析 | 多 GPU · PyTorch Distributed · distributed.txt + torch-cu128.txt | Infra-L3–Infra-L5 | |
| 84 DPO 偏好优化项目 | DPO 偏好对齐 | 主归属:2.4 偏好优化与对齐 · 后训练与对齐;关联:训练微调 | 单 GPU · Transformers / TRL · reinforcement-learning.txt + torch-cu128.txt | Infra-L3–Infra-L5 | |
| 85 GRPO 组内对齐项目 | GRPO 组内对齐 | 主归属:2.4 偏好优化与对齐 · 后训练与对齐;关联:训练微调 | 单 GPU · Transformers / TRL · reinforcement-learning.txt + torch-cu128.txt | Infra-L3–Infra-L5 | |
| Benchmark | 63 LoRA 变体对比 | LoRA 变体选型 | 主归属:2.3 训练与微调闭环 · 训练微调 | 单 GPU · Transformers / PEFT | Infra-L3 |
| 66 推理性能对比实验 | 推理性能选型 | 主归属:2.6 核心推理优化 · 推理优化;关联:量化与压缩、编译图优化、显存优化、性能分析 | 单 GPU · vLLM / SGLang | Infra-L2–Infra-L4 | |
| 68 推测解码基准 | 推测解码基准 | 主归属:2.7 高级推理策略 · 推理优化;关联:显存优化 | 单 GPU · vLLM / SGLang | Infra-L3–Infra-L4 | |
| 69 前缀缓存基准 | 前缀缓存基准 | 主归属:2.7 高级推理策略 · 推理优化;关联:显存优化 | 单 GPU · vLLM / SGLang | Infra-L3–Infra-L4 | |
| 70 推理服务调度基准 | 服务调度基准 | 主归属:2.7 高级推理策略 · 推理优化;关联:通信与并行、性能分析 | 单 GPU · vLLM / SGLang | Infra-L3–Infra-L5 | |
| 72 多模型部署对比项目 | 模型产物、推理 backend 与部署条件对比 | 主归属:2.6 核心推理优化 · 部署与异构系统;关联:推理优化、量化与压缩 | 单 GPU 起步 · Transformers / vLLM / SGLang;扩展 TensorRT-LLM / llama.cpp | Infra-L2–Infra-L4 | |
| 76 Activation / Checkpoint / Offload 对比项目 | checkpoint / offload / hybrid 策略对比 | 主归属:2.5 反向传播与显存优化 · 显存优化 | 单 GPU · Transformers | Infra-L1 / Infra-L3 | |
| 79 分布式并行基准项目 | 并行策略选型 | 主归属:2.9 分布式并行策略 · 通信与并行;关联:性能分析、显存优化、编译图优化 | 多 GPU · PyTorch Distributed | Infra-L1–Infra-L3 | |
| 80 MoE 专家并行 benchmark | MoE 并行选型 | 主归属:2.9 分布式并行策略 · 通信与并行;关联:大模型架构、性能分析 | 多 GPU · PyTorch Distributed / MoE | Infra-L2–Infra-L4 | |
| 86 DPO 在线基准 | 在线对齐基准 | 主归属:2.4 偏好优化与对齐 · 后训练与对齐;关联:推理优化、性能分析 | 单 GPU · 真实 backend | Infra-L3–Infra-L5 | |
| Analysis | 61 架构验证项目 | 架构支撑与验证对比 | 主归属:2.2 模型架构 · 大模型架构;关联:推理优化、编译图优化 | 单 GPU · Transformers | 负载面 / Infra-L3 |
| 71 MLA / KV Cache 结构基准 | 结构账本与容量分析 | 主归属:推理优化 · MLA、KV Cache 表示与容量账本;关联:显存优化、大模型架构、性能分析 | 单 GPU · vLLM / SGLang | Infra-L3–Infra-L4 | |
| 73 训练性能分析 | 训练性能分析 | 主归属:2.5 反向传播与显存优化 · 显存优化;关联:性能分析、反向传播与训练机制 | 单 GPU · PyTorch Profiler | Infra-L1–Infra-L3 | |
| 74 性能分析驱动的端到端优化项目 | 显存优化路线的端到端最终收口 | 主归属:显存优化;关联:性能分析、推理优化、编译图优化、通信与并行 | 单 GPU · PyTorch Profiler / backend | Infra-L1–Infra-L5 | |
| Decision | 65 QLoRA 选型项目 | 低资源微调选型 | 主归属:2.8 模型压缩与量化 · 量化与压缩;关联:训练微调、显存优化 | 单 GPU · Transformers / PEFT | Infra-L1–Infra-L3 |
| 75 显存预算压缩项目 | 显存预算、质量门槛与方案决策 | 主归属:2.5 反向传播与显存优化 · 显存优化 | 单 GPU · Transformers | Infra-L1 / Infra-L3 / Infra-L5 |
预留位置:77-78、82-83、87-89 暂不归入项目类型,待后续确定项目职责后再登记。
运行环境说明:硬件、运行方式和依赖配置共同组成项目运行环境。例如,“单 GPU · Transformers”表示在单张 GPU 上运行 Transformers;“单 GPU · vLLM”表示在单张 GPU 上通过真实推理 backend 运行。没有对应硬件时,可以先完成 CPU 逻辑验证或阅读项目设计,但不能把模拟结果当作真实性能结论。
项目类型说明:Project 以完成一个端到端任务和交付产物为主;Benchmark 以固定 workload、单变量对照和指标比较为主;Analysis 以测量口径、瓶颈假设和证据解释为主;Decision 以预算、SLA 或质量约束下的方案选择为主。第一列只登记项目的主类型;Practice 等级另行表示所需的真实实验深度。
显存优化线的职责边界:73 是训练侧测量入口,负责建立 step time、吞吐、峰值显存和 loss 的统一口径;76 是训练侧专项 benchmark,负责测量 checkpoint、offload 和 hybrid 的真实代价;75 是训练侧预算决策,负责定义显存上限、吞吐下限、质量下限和最终 accept / tune / reject;74 是最终收口项目,负责用性能分析和端到端 workload 验证前面方案是否值得保留,不替代 75 的局部预算决策。
Learning Path | 学习路径
Recommended Order | 推荐顺序
- 训练微调: 60 -> 61 -> 62 -> 63 -> 64 -> 65
- 推理与部署: 66 -> 67 -> 68 -> 69 -> 70 -> 71 -> 72
- 显存优化项目: 73 -> 76 -> 75 -> 74
- 分布式与对齐扩展: 79 -> 80 -> 81 -> 84 -> 85 -> 86
Next Steps | 后续衔接
- 做完训练、推理或分析项目后,可回看 2.3、2.5、2.6、2.9 复盘对应能力来源。
- 如果要继续加深工程化能力,可沿专题入口和后续项目线继续展开:推理侧回看
38/39,显存侧回看43/44/45,通信侧回看48/49,对齐侧回看51/52。
Environment Notes | 环境说明
- 默认按
CPU-first阅读,先完成项目的逻辑和 correctness 验证,再按需要进入真实环境。 - 这里只写组级统一前提,不点到具体节号。
- 项目中的性能分析、分布式或部署验证,若需要 GPU / 多卡 / 工具链支持,以单页说明为准。
