High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
Este artículo evalúa el rendimiento de GEMM en FP16 en la NVIDIA RTX 4060 de arquitectura Ada Lovelace a través de cuBLAS, CUTLASS e implementaciones personalizadas de WMMA, revelando que una profundidad de segmentación de tres con una geometría de tesela específica alcanza el 52,7% del rendimiento máximo, al tiempo que demuestra que la presión sobre la memoria compartida, en lugar de la profundidad de la segmentación, es el principal cuello de botella que limita una mayor optimización.