High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
Dit artikel benchmarkt de FP16 GEMM-prestaties op NVIDIA's Ada Lovelace RTX 4060 over cuBLAS, CUTLASS en aangepaste WMMA-implementaties, waarbij wordt onthuld dat een pipeline-diepte van drie met specifieke tile-geometrie 52,7% van de piekdoorvoer bereikt en aantoont dat de druk op het gedeelde geheugen, in plaats van de pipeline-diepte, de primaire bottleneck is die verdere optimalisatie beperkt.