Why shared attention vectors fail: a case for outcome-indexed tuning
Este artículo demuestra que los vectores de atención compartidos globalmente no logran aprender ajustes significativos en escenarios de múltiples resultados debido a la inestabilidad y el colapso, proponiendo y validando una matriz de atención indexada por resultados como una solución robusta para el aprendizaje basado en gradientes y la generalización.