Skip to content

算子优化判断手册

这份手册按性能现象选择排查方向,不替代 Task0–6 的顺序学习。先确认语义和 workload,再决定进入访存、融合、硬件执行还是 autotune。

统一判断链是:

text
现象 → 语义 / 访存 / 执行对象 → 候选机制 → 证据层级 → accept / tune / reject

算子优化知识地图:语义、数据路径、硬件执行与验证证据

按现象选择方向

现象优先检查可能机制验证出口
输出 shape 对,但数值误差大dtype、mask、边界和累加路径精度控制、边界 tile、参考实现对齐02 Kernel 语义与访存
kernel 能运行但明显变慢layout、合并访存、tile 和工作集memory coalescing、tile、shared memory02 Kernel 语义与访存
fusion 后 kernel 变慢register、shared memory、occupancy减少写回与资源压力的权衡03 算子融合
某张 GPU 快,另一张 GPU 慢dtype、shape、编译目标和硬件资源Tensor Core、warp、block、stream04 CUDA 执行
autotune 结果不稳定shape 分布、warmup、测量口径配置搜索、分桶、缓存和编译成本05 成本模型与 Profiling
kernel 变快但模型不变快launch、同步、其他算子或输入管线端到端瓶颈不在当前 kernel06 Benchmark 与验证

证据层级

证据可以确认什么不能确认什么
CPU correctness语义、shape、边界和误差GPU 带宽、真实 kernel 时间
GPU microbenchmark固定 shape 下的 kernel 相对成本模型或服务端到端收益
profiling trace当前 workload 的热点和等待所有 shape 都适用
workload benchmark固定模型与输入下的系统变化其他 GPU 或其他请求分布

常见决策

  • accept:语义对齐,目标 workload 上有可重复收益,且编译和维护成本可接受。
  • tune:方向合理,但 shape、tile、dtype、调度或证据还不稳定。
  • reject:语义不对齐、收益不足,或额外资源与维护成本超过预算。

相关入口

Released under the MIT License.