85.30 GFLOPS Single-Core FP32 Matrix Multiplication on AMD Zen 3: A Systematic Study of Cache Blocking, Register Blocking, FMA Chaining, and On-the-Fly Packing
Diese Arbeit präsentiert eine systematische Optimierungsstudie zur AMD Zen 3-Mikroarchitektur, die durch die Evaluierung von 28 distinkten Konfigurationen aus Cache/Register-Blocking, FMA-Chaining und On-the-fly-Packing eine Leistung von 85,30 GFLOPS bei der Single-Core-FP32-Matrixmultiplikation erzielt und dabei ein Champion-Design identifiziert, das 63,5 % der theoretischen Spitzenleistung erreicht, während es gleichzeitig ein prädiktives Modell für zukünftige Optimierungen einführt.