Skip to content

Group 2.10: Project Practice | 2.10: 项目实战

本组用于承接综合项目、性能对比与训练分析,是 Part 2 的项目收束层。这里不再展开单个方法原理,而是把前面各组的能力收成可比较、可复现、可决策的工程验证入口。

Group Overview | 组概览

这一组把前面各组学到的能力放回真实项目里做收口,优先保证“训练 -> 推理 -> 性能分析”的闭环完整。阅读顺序和组内资产见下表,先做核心项目,再进入进阶项目。60-65 这一段主归属仍是训练微调,其中 61 明确作为架构支撑项目,用来把 2.2 的结构判断接回训练项目线。新增的“横向专题”列表示项目的主叙事入口;一个项目可以被多个专题复用,但只保留一个主归属。

Group Asset Overview | 组内资产总览

项目项目角色Practice 实践级别上游来源横向专题作用
60 LoRA 微调项目核心项目Practice-P1 模板:训练 GPU2.3 训练与微调闭环训练微调微调训练闭环
61 架构验证项目核心项目Practice-P1 单 GPU2.2 模型架构大模型架构架构支撑与验证对比
62 指令微调项目核心项目Practice-P1 单 GPU2.3 训练与微调闭环训练微调指令微调验证
63 LoRA 变体对比核心项目Practice-P1 单 GPU2.3 训练与微调闭环训练微调LoRA 变体选型
73 训练性能分析核心项目Practice-P1 模板:性能 GPU2.5 反向传播与显存优化显存优化训练性能分析
66 推理性能对比实验核心项目Practice-P2 真实 backend(无 GPU 可 P1)2.6 核心推理优化推理优化推理性能选型
68 推测解码基准扩展项目Practice-P1/P22.7 高级推理策略推理优化推测解码基准
69 前缀缓存基准主题项目Practice-P1/P22.7 高级推理策略推理优化前缀缓存基准
70 推理服务调度基准扩展项目Practice-P1/P22.7 高级推理策略推理优化服务调度基准
74 profiling 驱动的端到端优化项目进阶项目Practice-P1/P2 跨域 profiling显存优化专题Profiling显存优化路线的端到端最终收口
79 分布式并行基准项目进阶项目Practice-P3 分布式系统2.9 分布式并行策略通信与并行并行策略选型
80 MoE 专家并行 benchmark进阶项目Practice-P3 分布式系统2.9 分布式并行策略通信与并行MoE 并行选型
81 分布式推理逻辑验证进阶项目Practice-P3 分布式系统2.9 分布式并行策略通信与并行分布式推理验证
67 量化推理与部署项目主题项目Practice-P1/P22.8 模型压缩与量化量化与压缩量化部署验证
84 DPO 偏好优化项目进阶项目Practice-P1 单 GPU2.4 偏好优化与对齐后训练与对齐DPO 偏好对齐
85 GRPO 组内对齐项目进阶项目Practice-P1 单 GPU2.4 偏好优化与对齐后训练与对齐GRPO 组内对齐
86 DPO 在线基准进阶项目Practice-P2 真实 backend2.4 偏好优化与对齐后训练与对齐在线对齐基准
64 SFT 数据质量项目进阶项目Practice-P0/P1 CPU-first→GPU2.3 训练与微调闭环训练微调数据质量与模板评测
65 QLoRA 选型项目进阶项目Practice-P1 单 GPU2.8 模型压缩与量化量化与压缩低资源微调选型
71-72预留位待定推理优化预留
75 显存预算压缩项目进阶项目Practice-P1 模板:显存预算2.5 反向传播与显存优化显存优化显存预算、质量门槛与方案决策
76 Activation / Checkpoint / Offload 对比项目进阶项目Practice-P1 专项 benchmark2.5 反向传播与显存优化显存优化checkpoint / offload / hybrid 策略对比
77-78预留位待定显存优化预留
82-83预留位待定通信与并行预留
87-89预留位待定通用预留预留

Practice 实践级别说明:Practice-P0 为 CPU-first 逻辑验证;Practice-P1 为单 GPU、本地模型或单机 profiling / 显存实验;Practice-P2 为 vLLM / SGLang 等真实 inference backend;Practice-P3 为多 GPU、分布式通信或分布式 serving。74 是显存优化路线的跨域 profiling 收口项目,基础路径按 Practice-P1 执行,若接入真实 inference backend 则进入 Practice-P2。实践级别表示推荐的真实实验深度,不意味着没有对应硬件时无法阅读项目。

显存优化线的职责边界:73 是训练侧 Practice-P1 测量入口,负责建立 step time、吞吐、峰值显存和 loss 的统一口径;76 是训练侧专项 benchmark,负责测量 checkpoint、offload 和 hybrid 的真实代价;75 是训练侧预算决策,负责定义显存上限、吞吐下限、质量下限和最终 accept / tune / reject;74 是最终收口项目,负责用 profiling 和端到端 workload 验证前面方案是否值得保留,不替代 75 的局部预算决策。

Cross-topic Reuse | 跨专题复用与 Infra 层

主表中的“横向专题”表示项目的主叙事入口。下面的索引只记录需要跨专题复用的项目,避免把组内资产表继续拉宽;“Infra 层”描述项目主要落在五层架构的哪里,与上表的“Practice 实践级别”(实验所需硬件/系统深度)不是同一个概念。

项目主专题关联专题Infra 层
60 LoRA 微调训练微调反向传播、显存优化Infra-L1/Infra-L3
61 架构验证大模型架构推理优化、编译图优化负载面/Infra-L3
65 QLoRA 选型量化与压缩训练微调、显存优化Infra-L2/Infra-L3
66 推理性能对比推理优化量化、编译图优化、显存优化、ProfilingInfra-L2–Infra-L4
67 量化推理部署量化与压缩推理优化、编译图优化、显存优化Infra-L2–Infra-L4
73 训练性能分析显存优化Profiling、反向传播Infra-L1–Infra-L3
74 端到端优化显存优化Profiling、推理优化、编译图优化、通信与并行Infra-L1–Infra-L5
75 显存预算压缩显存优化Profiling、量化、反向传播Infra-L1/Infra-L3/Infra-L5
76 激活检查点与 Offload显存优化反向传播、ProfilingInfra-L1/Infra-L3
79 分布式并行基准通信与并行Profiling、显存优化、编译图优化Infra-L1–Infra-L3
80 MoE 专家并行通信与并行大模型架构、ProfilingInfra-L2–Infra-L4
81 分布式推理验证通信与并行推理优化、ProfilingInfra-L3–Infra-L5
84-86 后训练项目线后训练与对齐训练微调、推理优化、ProfilingInfra-L3–Infra-L5

Learning Path | 学习路径

Next Steps | 后续衔接

  • 做完训练、推理或分析项目后,可回看 2.32.52.62.9 复盘对应能力来源。
  • 如果要继续加深工程化能力,可沿专题入口和后续项目线继续展开:推理侧回看 38/39,显存侧回看 43/44/45,通信侧回看 48/49,对齐侧回看 51/52

Environment Notes | 环境说明

  • 默认按 CPU-first 阅读,核心项目优先保证逻辑和 correctness 验证。
  • 这里只写组级统一前提,不点到具体节号。
  • 进阶项目中的 profiling、分布式或部署验证,若需要 GPU / 多卡 / 工具链支持,以单页说明为准。

Released under the MIT License.