Skip to content
大模型算法实战教程
Main Navigation
第零部分 前置知识与环境准备
第一部分 硬件与系统基础
第二部分 PyTorch 核心算法
第三部分 Triton 算子开发
第四部分 CUDA C++ 与系统优化
专题讨论
组队学习
Appearance
Menu
Return to top
On this page
01 性能问题与 Benchmark 基础
本节定位
把“慢、显存不足、吞吐不够、扩展效率差”转化为可比较的问题,为后续 profiling 和策略实验建立共同口径。
内容安排
性能对象:训练 step、推理请求、服务批次与多卡运行。
指标语义:延迟、吞吐、峰值显存、利用率、P50/P99 和质量。
Workload 与 baseline:模型、输入、dtype、batch、并发、warmup 和重复次数。
Benchmark 结果:如何记录环境、失败状态、证据等级和可复查结论。
主要产出
一份可以被其他学习者复跑的 benchmark 配置和结果表。