Skip to content

第五部分:综合项目与架构决策 ​

收口层:把多条主学习路线的证据汇总为可交付的系统方案。

本部分定位 ​

Part 05 不再新增一条单独技术路线,也不替代推理、性能、算子或后训练专题。它负责把这些路线中的机制、benchmark、质量结果和工程约束放到同一个项目问题中,完成方案组合与架构决策。

推荐学习方式 ​

先从一个明确的系统目标开始,再回查相关主路线和横向专题:

text
目标与约束 → baseline → 瓶颈证据 → 候选组合 → 对照实验 → 成本与质量 → 架构决策

Part 05 分成两个模块。模块一先产出跨路线的项目证据,模块二再把这些证据转化为选型、部署和成本结论;两者不是两条平行课程,而是“项目验证 → 决策收口”的前后关系。

模块一:综合项目 ​

综合项目跨越多个 Part 和主学习路线,重点不是重复讲某个局部机制,而是把目标、约束、实现、实验和交付结果串成完整闭环。

项目方向主要组合的路线需要形成的结果
推理服务综合项目推理优化、性能优化、量化与部署请求链路、backend、KV Cache、延迟吞吐和服务质量的综合结论
训练优化综合项目性能优化、算子优化、后训练优化、通信并行训练显存、计算、通信、质量和训练成本的对照报告
Agent 综合项目推理优化、后训练优化、数据工程、部署与异构多轮调用、工具链、状态管理、可靠性和端到端成本的综合结论
多模态推理综合项目大模型架构、推理优化、性能优化、多模态多模态输入链路、模型服务、显存压力、延迟和质量的综合结论

每个项目至少应保留:问题定义、环境与 workload、baseline、候选方案、实测证据、质量结果、限制条件和最终决策。

模块二:架构选型与成本决策 ​

这一模块不再从单个实现细节出发,而是回答“在给定目标、预算和约束下,应该选择什么方案”。

决策方向主要比较对象典型输出
硬件选型决策框架GPU、CPU、互连、显存和带宽容量、性能、扩展性与采购约束的比较
架构选型决策框架单体、分层、服务化和多阶段架构延迟、吞吐、可靠性和维护复杂度的权衡
引擎选型决策框架vLLM、SGLang、TensorRT-LLM 等workload、backend 能力、生态和证据质量的比较
部署架构选型决策框架单机、多卡、多节点和异构部署部署拓扑、资源隔离、扩缩容和故障恢复方案
成本模型与 TCO 分析设备、运行、通信、存储和维护成本单请求成本、单位吞吐成本、回本周期和敏感性分析

模块二的结论必须引用模块一或前置专题中的证据,不能只依据理论峰值或单项 benchmark。

综合项目关注的问题 ​

维度需要回答的问题典型证据
性能端到端延迟、吞吐和扩展效率是否达到目标?benchmark、P50/P99、throughput、trace
显存与容量当前模型、上下文和并发是否能稳定运行?peak memory、KV Cache、OOM 边界、容量账本
质量优化是否改变输出、训练稳定性或任务指标?质量集、回归测试、数值误差、偏好指标
成本设备、运行时间、通信和维护成本如何变化?成本模型、资源利用率、容量规划
交付模型产物、backend、环境和回滚路径是否完整?artifact、配置、启动记录、accept/tune/reject

与前面路线的关系 ​

  • 推理优化提供请求链路、KV Cache、Serving 和 backend 方案。
  • 性能优化提供 profiling、显存、通信、I/O 和成本证据。
  • 算子优化提供 Kernel、Fusion、访存和执行路径方案。
  • 后训练优化提供模型能力、数据质量和对齐结果。
  • 量化、通信并行、部署与异构等横向专题提供具体约束和扩展方案。

后续建设 ​

后续项目将按“场景目标—约束条件—候选架构—实验证据—交付决策”组织,不把单个局部指标改善直接当成系统级结论。Rust 可以作为 Part 04 的选修实现模块保留,但不再作为 Part 05 的目录定位。

Released under the MIT License.