High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
本文通过对 NVIDIA Ada Lovelace 架构 RTX 4060 上 cuBLAS、CUTLASS 以及自定义 WMMA 实现的 FP16 GEMM 性能进行基准测试,揭示了采用特定分块几何结构的深度为三的流水线达到了峰值吞吐量的 52.7%,并表明共享内存压力而非流水线深度是限制进一步优化的主要瓶颈。