High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
この論文は、NVIDIAのAda Lovelaceアーキテクチャに基づくRTX 4060におけるFP16 GEMMの性能をcuBLAS、CUTLASS、およびカスタムWMMA実装を用いてベンチマークしており、特定のタイルジオメトリを用いたパイプライン深度3がピークスループットの52.7%を達成することを示すとともに、さらなる最適化を制限している主要なボトルネックはパイプライン深度ではなく共有メモリの圧力であることを明らかにしている。