High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
Cet article évalue les performances du GEMM en FP16 sur la carte NVIDIA Ada Lovelace RTX 4060 à travers cuBLAS, CUTLASS et des implémentations WMMA personnalisées, révélant qu'une profondeur de pipeline de trois avec une géométrie de tuile spécifique atteint 52,7 % du débit de crête tout en démontrant que la pression sur la mémoire partagée, plutôt que la profondeur du pipeline, est le principal goulot d'étranglement limitant toute optimisation supplémentaire.