性能优化问题链:从“变慢”到工程决策
假设一个训练或推理系统出现了性能问题:运行变慢、显存接近上限、GPU 利用率不稳定,或者增加设备后收益很小。不要立即选择某个优化技巧,先沿着下面的问题链推进:
text
定义 workload → 建立 baseline → 取得可观测证据
→ 定位显存/计算/通信/I/O对象 → 比较候选策略
→ 复测质量、成本和稳定性 → 形成项目决策第一段:先把问题变成可测量对象
先明确运行阶段、输入规模、目标指标和质量门槛。训练关注 step time、throughput、peak memory;推理还要区分 TTFT、TPOT、P99、并发和生成质量。
第二段:用证据而不是直觉定位
从轻量计时和显存统计开始,再根据假设进入框架 profiler、trace、通信日志或 kernel 分析。一次 trace 可以提出假设,但不能自动证明优化有效。
第三段:区分资源对象和代价转移
Checkpoint 用计算换显存,Offload 用搬运和同步换显存,量化改变表示精度和存储,通信并行改变跨设备代价。比较方案时必须同时记录收益和新增成本。
第四段:从局部改善走向端到端结论
候选策略需要在相同 workload 下与 baseline 比较,并检查质量、稳定性、尾延迟和资源成本。最终结论应说明适用硬件、模型、输入分布和仍未验证的风险。
