85.30 GFLOPS Single-Core FP32 Matrix Multiplication on AMD Zen 3: A Systematic Study of Cache Blocking, Register Blocking, FMA Chaining, and On-the-Fly Packing
本文针对 AMD Zen 3 微架构进行了一项系统性的优化研究,通过评估 28 种不同的缓存/寄存器分块、FMA 链化以及即时打包配置,实现了单核 FP32 矩阵乘法 85.30 GFLOPS 的性能,并最终确定了一个达到理论峰值性能 63.5% 的冠军设计,同时引入了一个用于未来优化的预测模型。