High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
Diese Arbeit benchmarkt die FP16-GEMM-Leistung auf der NVIDIA Ada Lovelace RTX 4060 über cuBLAS, CUTLASS und benutzerdefinierte WMMA-Implementierungen hinweg und zeigt auf, dass eine Pipeline-Tiefe von drei mit spezifischer Tile-Geometrie 52,7 % des Spitzen-Durchsatzes erreicht, während sie gleichzeitig demonstriert, dass der Shared-Memory-Druck und nicht die Pipeline-Tiefe der primäre Engpass ist, der eine weitere Optimierung begrenzt.