Diagnosing Simulation and Hardware Barriers to Cross-Size Transfer in Equivariant Quantum Reinforcement Learning
This paper demonstrates that while equivariant quantum reinforcement learning policies trained on small combinatorial optimization instances can outperform size-matched training in zero-shot transfer to larger instances within idealized regimes, their performance on realistic hardware is severely degraded by simulation truncation, conditional performance bounds, and shot-noise limitations, ultimately establishing a rigorous diagnostic standard for future claims of quantum advantage.