Not All Transitions Matter: Evidence from PPO
Dieser Artikel zeigt, dass das zufällige Entfernen eines festen Anteils (genauer 25 %) von Übergängen aus PPO-Rollouts die Redundanz kausal verketteter Gradienten effektiv aufbricht, wodurch die Trainingsdynamik über verschiedene Umgebungen hinweg stabilisiert wird, ohne den Kernalgorithmus zu verändern oder die finale Belohnungsleistung zu beeinträchtigen.