High-Performance FP16 General Matrix Multiplication on NVIDIA Ada Lovelace via CUTLASS and WMMA: A Benchmark and Pipeline-Depth Analysis
이 논문은 NVIDIA의 Ada Lovelace RTX 4060에서 cuBLAS, CUTLASS 및 커스텀 WMMA 구현에 대한 FP16 GEMM 성능을 벤치마킹하여, 특정 타일 기하 구조를 가진 3단계 파이프라인 깊이가 피크 처리량의 52.7%를 달달성함을 밝히는 동시에, 추가적인 최적화를 제한하는 주요 병목 현상이 파이프라인 깊이가 아닌 공유 메모리 압력임을 입증한다.