← Últimos artículos
🤖 machine learning

The Loss Does Not See the Basis, but Adam Does

Este artículo demuestra que el fallo de Adam al no recuperar soluciones de bajo rango en modelos factorizados se deriva de su falta de equivariancia de calibre, una propiedad poseída por el descenso de gradiente y otros optimizadores de escalar compartido que preserva el sesgo implícito hacia interpolantes de bajo rango.

Autores originales: Devender Singh

Publicado 2026-08-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Devender Singh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas gigante y desordenado donde las piezas son números dispuestos en una cuadrícula. En el mundo de la inteligencia artificial, esto se llama "factorización de matrices". Tienes una imagen enorme y complicada (los datos) y quieres descomponerla en dos pilas de cartas más pequeñas y simples que, al multiplicarse, recreen la imagen original. El objetivo es encontrar las pilas más simples posibles que aún así encajen perfectamente con la imagen. Esto es importante porque las soluciones más simples suelen funcionar mejor en el mundo real, evitando la trampa de memorizar el ruido en lugar de aprender patrones.

Para resolver este rompecabezas, las computadoras usan un método llamado "descenso de gradiente", que es como un excursionista que intenta encontrar el fondo de un valle siempre dando pasos cuesta abajo. Durante mucho tiempo, los científicos notaron que si comienzas con cartas muy pequeñas, el excursionista encuentra naturalmente la solución más simple. Sin embargo, un excursionista más rápido llamado "Adam" (una herramienta popular en IA) a menudo se pierde, encontrando una solución complicada y desordenada incluso cuando existe una solución simple. La gran pregunta ha sido: ¿Por qué el excursionista rápido no logra encontrar el camino simple, y podemos arreglarlo sin hacerlo lento?

Este artículo, titulado "La pérdida no ve la base, pero Adam sí", investiga por qué sucede esto. El autor descubrió que el problema no es solo la velocidad; es sobre cómo el excursionista ve el mundo. El rompecabezas tiene una simetría oculta: puedes rotar tus pilas de cartas de muchas maneras diferentes, y la imagen final permanece exactamente igual. Piensa en ello como girar un globo terráqueo; los continentes se mueven, pero el mapa sigue siendo el mismo. El excursionista tradicional (Descenso de Gradiente) ignora la rotación específica y simplemente mira la forma del valle, encontrando naturalmente la solución más simple. Pero el excursionista rápido (Adam) se distrae con la rotación específica de las cartas. Trata una dirección como "especial" y otra como "diferente", aunque son matemáticamente idénticas. Esta distracción hace que elija una solución complicada y de alto rango en lugar de la solución simple y de bajo rango.

El autor demostró que cualquier optimizador (una herramienta para resolver el rompecabezas) que respete esta simetría de rotación encontrará naturalmente la solución simple, mientras que aquellos que rompan la simetría se quedarán estancados en soluciones complejas. Probaron nueve optimizadores diferentes y encontraron una división clara: los que "respetan la simetría" (como el Descenso de Gradiente, Muon y una versión modificada de Adam) encontraron soluciones con errores tan bajos como 0.000006, mientras que los que "rompen la simetría" (como el Adam estándar y RMSProp) tenían errores superiores a 0.42—una diferencia masiva.

Para demostrar que no fue una casualidad, construyeron un "dial" que cambia suavemente a Adam de su modo caótico y de odio a la rotación hacia un modo amigable con la rotación. A medida que giraban el dial, la solución se volvía más simple y precisa, mostrando que la forma específica en que Adam mira los datos es la causa exacta del problema. Incluso probaron esto con datos del mundo real, como imágenes hiperespectrales de la tierra, y encontraron que los métodos amigables con la rotación redujeron los errores en aproximadamente un 44% en comparación con el Adam estándar.

Curiosamente, el artículo también encontró que ser "amigable con la rotación" no siempre es un remedio mágico. Si el rompecabezas en sí es desordenado y tiene mucho ruido aleatorio (una "cola espectral"), el excursionista súper rápido y amigable con la rotación llamado Muon a veces se vuelve demasiado entusiasta y se ajusta al ruido, mientras que el excursionista más lento y constante (Descenso de Gradiente) lo hace mejor. Así que la mejor herramienta depende de la naturaleza específica del rompecabezas.

Finalmente, el autor analizó cómo esto afecta a los modelos de IA modernos llamados Transformers (los cerebros detrás de los chatbots). Encontró que si se comienza con dos modelos de IA idénticos con la misma matemática pero simplemente rotando sus cartas internas de manera diferente, el optimizador Adam estándar hace que se comporten de manera completamente distinta después de un solo paso. Terminan con estructuras internas completamente diferentes, a pesar de haber comenzado como la misma función. Esto significa que la elección del optimizador no es solo un detalle de ajuste; determina fundamentalmente qué versión de la solución aprende la IA. El artículo concluye que, para obtener los mejores y más simples resultados, necesitamos optimizadores que respeten las simetrías ocultas de las matemáticas, en lugar de distraerse con la forma específica en que organizamos los números.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →