Not All Transitions Matter: Evidence from PPO
Este artículo demuestra que descartar aleatoriamente una fracción fija (específicamente el 25%) de las transiciones de los recorridos de PPO rompe eficazmente la redundancia de los gradientes encadenados causalmente, estabilizando así la dinámica de entrenamiento en diversos entornos sin alterar el algoritmo central ni sacrificar el rendimiento final de la recompensa.