← Últimos artículos
🤖 machine learning

A Defense of the Quadratic Model

Este artículo demuestra que el modelo cuadrático simple, cuando se aplica mediante la expansión de Taylor en puntos de control intermedios, puede predecir sorprendentemente con precisión la dinámica de optimización en los modelos de lenguaje de gran tamaño, revelando espectros de la Hessiana estructurados y confirmando que el entrenamiento ocurre típicamente en un borde de estabilidad estocástico dependiente del tamaño del lote.

Autores originales: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

Publicado 2026-07-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade, Alex Damian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando navegar por una enorme cordillera nublada durante la noche. Esta montaña es el "paisaje de pérdida" de una Inteligencia Artificial gigante, un terreno complejo donde cada paso que da la IA es un intento de encontrar el valle más bajo (el mejor rendimiento posible). El problema es que la montaña es tan grande y retorcida que nadie puede ver todo el mapa a la vez. Durante años, los científicos han intentado predecir cómo se mueve la IA utilizando mapas simples y planos o modelos idealizados. A veces, estos mapas funcionan, pero a menudo son demasiado simples para ser útiles, o demasiado complicados de calcular. La gran pregunta es: ¿Podemos usar un mapa simple y plano para predecir el viaje de la IA a través de esta montaña caótica?

Para entender esto, necesitas saber algunas cosas. Primero, los modelos de IA aprenden mediante la "optimización", lo que simplemente significa dar pasos diminutos para reducir sus errores. Segundo, el "Hessiano" es una forma matemática de describir qué tan empinado o curvo es el suelo en cualquier punto específico. Si conoces la curva, puedes predecir si un paso te llevará hacia abajo, a un valle, o hacia arriba, a un acantilado. Finalmente, existe un concepto llamado "borde de estabilidad", que es como caminar justo al borde de un precipicio donde el suelo es tan empinado que un paso en falso te hace caer, y sin embargo, la IA de alguna manera sigue caminando sin caerse. Este artículo pregunta si el mapa más simple posible —una aproximación plana y cuadrática (en forma de cuenco)— puede realmente predecir cómo se comporta una IA gigante en el mundo real.

Los autores de este artículo decidieron poner a prueba este "modelo cuadrático" simple en un Modelo de Lenguaje Grande (LLM) con 150 millones de parámetros, entrenado con 3 mil millones de palabras. Querían ver si, en lugar de intentar comprender toda la montaña loca, simplemente podían mirar un parche de suelo pequeño y plano alrededor de donde la IA se encuentra actualmente, y usar eso para predecir los siguientes pasos.

Encontraron algo sorprendentemente genial: ¡el simple mapa con forma de cuenco funciona! Cuando detuvieron el entrenamiento cada 10% del camino y crearon una versión cuadrática y plana del problema en ese punto exacto, este modelo simple pudo predecir con precisión el comportamiento de la IA durante el siguiente 10% del entrenamiento. Es como si, aunque la montaña sea un desastre dentado, la IA pasa tanto tiempo en valles específicos "con forma de cuenco" que un mapa simple de un cuenco es suficiente para decirte hacia dónde irá después. La predicción fue incluso mejor cerca del final del entrenamiento que al principio.

Una vez que demostraron que el mapa simple funcionaba, usaron esto para mirar bajo el capó del proceso de aprendizaje de la IA. Observaron el "espectro del Hessiano", que es como una lista de todas las diferentes pendientes y curvas en el paisaje. Descubrieron que esta lista no es aleatoria; tiene una estructura muy específica. La parte superior de la lista está dominada por la parte de la IA que maneja el vocabulario (la capa de "unembedding"), mientras que la larga parte de la cola sigue una "ley de potencia" universal. Esto significa que la forma de la cola es idéntica ya sea que la IA esté usando un lote de datos diminuto o uno enorme, y no le importa los trucos específicos (precondicionadores) que el optimizador utiliza para acelerar las cosas. Es un patrón universal oculto en el caos.

Finalmente, investigaron el "borde de estabilidad". Querían saber si la IA está caminando con cuidado en medio del valle o bailando justo en el borde de un acantilado. Al ajustar la tasa de aprendizaje y el tamaño del lote (el tamaño de los fragmentos de datos), descubrieron que la IA, de hecho, está bailando en el borde. Cuando la IA usa lotes pequeños, baila en un "borde de estabilidad estocástico", lo que significa que se tambalea debido al ruido aleatorio en los datos. Cuando usa lotes enormes, se tambalea en un "borde determinista", donde la inestabilidad es causada por la matemática de los pasos en sí. En ambos casos, la IA está operando justo en el límite de lo que es estable, lo que sugiere que este precario acto de equilibrio es, de hecho, cómo estos modelos aprenden mejor.

El artículo concluye que, si bien el mundo de la IA es increíblemente complejo, podemos entenderlo tratándolo como una secuencia de problemas cuadráticos locales y simples. En lugar de necesitar una única teoría imposible para toda la montaña, podemos simplemente mirar el cuenco local en el que se encuentra la IA. Este modelo simple no es solo un juguete; es un sustituto sorprendentemente preciso de cómo funciona realmente el preentrenamiento de la IA en el mundo real, brindándonos una forma nueva y tratable de entender y mejorar estos sistemas masivos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →