Does Fallback-Anchored Uncertainty Gating Help Off-Policy Reinforcement Learning? A Short Study Combining DCUG-Style Gating with TD3
Questo studio dimostra che l'applicazione di un meccanismo di gating dell'incertezza ancorato al fallback, che precedentemente aveva stabilizzato l'addestramento on-policy PPO, non fornisce alcun beneficio statistico a TD3 off-policy, indicando che il valore del meccanismo è specifico per correggere il collasso dell'addestramento on-policy piuttosto che servire come un potenziatore di robustezza generale.