Skip to content

Group 2.10: Project Practice | 2.10: 项目实战

本组用于承接综合项目、性能对比与训练分析,是 Part 2 的项目收束层。这里不再展开单个方法原理,而是把前面各组的能力收成可比较、可复现、可决策的工程验证入口。

Group Overview | 组概览

这一组把前面各组学到的能力放回真实项目里做收口,优先保证“训练 -> 推理 -> 性能分析”的闭环完整。阅读顺序和组内资产见下表。60-65 这一段主归属仍是训练微调,其中 61 明确作为架构支撑项目,用来把 2.2 的结构判断接回训练项目线。表中的“归属与复用”说明项目从哪里来、如何被复用;一个项目可以被多个专题复用,但只保留一个主归属。下图先展示各项目组的承接关系,资产表再补充每个项目的类型、环境和 Infra 层。

项目资产之间的承接关系

机制小节提供方法,项目节提供证据,横向专题负责跨路线复用。

Group Asset Overview | 组内资产总览

项目类型项目主要作用归属与复用运行环境Infra 层
Project60 LoRA 微调项目微调训练闭环主归属:2.3 训练与微调闭环 · 训练微调;关联:显存优化单 GPU · Transformers / PEFT · fine-tuning.txt + torch-cu128.txtInfra-L1 / Infra-L3
62 指令微调项目指令微调验证主归属:2.3 训练与微调闭环 · 训练微调单 GPU · Transformers / PEFT · fine-tuning.txt + torch-cu128.txtInfra-L3
64 SFT 数据质量项目数据质量与模板评测主归属:2.3 训练与微调闭环 · 训练微调;关联:显存优化CPU · Python / 数据处理 · base.txt + torch-cpu.txt;可选单 GPU · fine-tuning.txt + torch-cu128.txtInfra-L3
67 量化推理与部署项目量化部署验证主归属:2.8 模型压缩与量化 · 量化与压缩;关联:推理优化编译图优化显存优化单 GPU · Transformers / 量化 backend · torch-cu128.txt;可选 vLLM · inference-vllm.txtInfra-L2–Infra-L4
81 分布式推理逻辑验证分布式推理验证主归属:2.9 分布式并行策略 · 通信与并行;关联:推理优化性能分析多 GPU · PyTorch Distributed · distributed.txt + torch-cu128.txtInfra-L3–Infra-L5
84 DPO 偏好优化项目DPO 偏好对齐主归属:2.4 偏好优化与对齐 · 后训练与对齐;关联:训练微调单 GPU · Transformers / TRL · reinforcement-learning.txt + torch-cu128.txtInfra-L3–Infra-L5
85 GRPO 组内对齐项目GRPO 组内对齐主归属:2.4 偏好优化与对齐 · 后训练与对齐;关联:训练微调单 GPU · Transformers / TRL · reinforcement-learning.txt + torch-cu128.txtInfra-L3–Infra-L5
Benchmark63 LoRA 变体对比LoRA 变体选型主归属:2.3 训练与微调闭环 · 训练微调单 GPU · Transformers / PEFTInfra-L3
66 推理性能对比实验推理性能选型主归属:2.6 核心推理优化 · 推理优化;关联:量化与压缩编译图优化显存优化性能分析单 GPU · vLLM / SGLangInfra-L2–Infra-L4
68 推测解码基准推测解码基准主归属:2.7 高级推理策略 · 推理优化;关联:显存优化单 GPU · vLLM / SGLangInfra-L3–Infra-L4
69 前缀缓存基准前缀缓存基准主归属:2.7 高级推理策略 · 推理优化;关联:显存优化单 GPU · vLLM / SGLangInfra-L3–Infra-L4
70 推理服务调度基准服务调度基准主归属:2.7 高级推理策略 · 推理优化;关联:通信与并行性能分析单 GPU · vLLM / SGLangInfra-L3–Infra-L5
72 多模型部署对比项目模型产物、推理 backend 与部署条件对比主归属:2.6 核心推理优化 · 部署与异构系统;关联:推理优化量化与压缩单 GPU 起步 · Transformers / vLLM / SGLang;扩展 TensorRT-LLM / llama.cppInfra-L2–Infra-L4
76 Activation / Checkpoint / Offload 对比项目checkpoint / offload / hybrid 策略对比主归属:2.5 反向传播与显存优化 · 显存优化单 GPU · TransformersInfra-L1 / Infra-L3
79 分布式并行基准项目并行策略选型主归属:2.9 分布式并行策略 · 通信与并行;关联:性能分析显存优化编译图优化多 GPU · PyTorch DistributedInfra-L1–Infra-L3
80 MoE 专家并行 benchmarkMoE 并行选型主归属:2.9 分布式并行策略 · 通信与并行;关联:大模型架构性能分析多 GPU · PyTorch Distributed / MoEInfra-L2–Infra-L4
86 DPO 在线基准在线对齐基准主归属:2.4 偏好优化与对齐 · 后训练与对齐;关联:推理优化性能分析单 GPU · 真实 backendInfra-L3–Infra-L5
Analysis61 架构验证项目架构支撑与验证对比主归属:2.2 模型架构 · 大模型架构;关联:推理优化编译图优化单 GPU · Transformers负载面 / Infra-L3
71 MLA / KV Cache 结构基准结构账本与容量分析主归属:推理优化 · MLA、KV Cache 表示与容量账本;关联:显存优化大模型架构性能分析单 GPU · vLLM / SGLangInfra-L3–Infra-L4
73 训练性能分析训练性能分析主归属:2.5 反向传播与显存优化 · 显存优化;关联:性能分析反向传播与训练机制单 GPU · PyTorch ProfilerInfra-L1–Infra-L3
74 性能分析驱动的端到端优化项目显存优化路线的端到端最终收口主归属:显存优化;关联:性能分析推理优化编译图优化通信与并行单 GPU · PyTorch Profiler / backendInfra-L1–Infra-L5
Decision65 QLoRA 选型项目低资源微调选型主归属:2.8 模型压缩与量化 · 量化与压缩;关联:训练微调显存优化单 GPU · Transformers / PEFTInfra-L1–Infra-L3
75 显存预算压缩项目显存预算、质量门槛与方案决策主归属:2.5 反向传播与显存优化 · 显存优化单 GPU · TransformersInfra-L1 / Infra-L3 / Infra-L5

预留位置:77-78、82-83、87-89 暂不归入项目类型,待后续确定项目职责后再登记。

运行环境说明:硬件、运行方式和依赖配置共同组成项目运行环境。例如,“单 GPU · Transformers”表示在单张 GPU 上运行 Transformers;“单 GPU · vLLM”表示在单张 GPU 上通过真实推理 backend 运行。没有对应硬件时,可以先完成 CPU 逻辑验证或阅读项目设计,但不能把模拟结果当作真实性能结论。

项目类型说明:Project 以完成一个端到端任务和交付产物为主;Benchmark 以固定 workload、单变量对照和指标比较为主;Analysis 以测量口径、瓶颈假设和证据解释为主;Decision 以预算、SLA 或质量约束下的方案选择为主。第一列只登记项目的主类型;Practice 等级另行表示所需的真实实验深度。

显存优化线的职责边界:73 是训练侧测量入口,负责建立 step time、吞吐、峰值显存和 loss 的统一口径;76 是训练侧专项 benchmark,负责测量 checkpoint、offload 和 hybrid 的真实代价;75 是训练侧预算决策,负责定义显存上限、吞吐下限、质量下限和最终 accept / tune / reject;74 是最终收口项目,负责用性能分析和端到端 workload 验证前面方案是否值得保留,不替代 75 的局部预算决策。

Learning Path | 学习路径

Next Steps | 后续衔接

  • 做完训练、推理或分析项目后,可回看 2.32.52.62.9 复盘对应能力来源。
  • 如果要继续加深工程化能力,可沿专题入口和后续项目线继续展开:推理侧回看 38/39,显存侧回看 43/44/45,通信侧回看 48/49,对齐侧回看 51/52

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,先完成项目的逻辑和 correctness 验证,再按需要进入真实环境。
  • 这里只写组级统一前提,不点到具体节号。
  • 项目中的性能分析、分布式或部署验证,若需要 GPU / 多卡 / 工具链支持,以单页说明为准。

Released under the MIT License.