High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
Este artigo avalia o desempenho de GEMM em FP16 na NVIDIA RTX 4060 da arquitetura Ada Lovelace através de cuBLAS, CUTLASS e implementações customizadas de WMMA, revelando que uma profundidade de pipeline de três com uma geometria de tile específica atinge 52,7% do throughput de pico ao demonstrar que a pressão na memória compartilhada, em vez da profundidade do pipeline, é o principal gargalo que limita a otimização adicional.