← Últimos artículos
🤖 machine learning

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

Pro-KLShampoo es un optimizador novedoso que mejora KL-Shampoo aprovechando la estructura observada de "pico y plano" de los valores propios de sus precondicionadores para combinar el seguimiento espectral completo en un subespacio de baja dimensión con la ortogonalización en las direcciones restantes, logrando un rendimiento superior en pérdida de validación, eficiencia de memoria y velocidad de entrenamiento en múltiples escalas de LLM.

Autores originales: Ruotong Sun, Ermin Wei

Publicado 2026-05-08
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ruotong Sun, Ermin Wei

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot gigante y complejo (un Modelo de Lenguaje Grande) a hablar el lenguaje humano. Para lograrlo, le muestras millones de ejemplos y le permites cometer errores. Cada vez que comete un error, le das un "empujón" (un gradiente) para corregir su trayectoria.

El problema es que estos empujones son desordenados. A veces el robot necesita un empujón diminuto y preciso en una dirección, y un empujón masivo en otra. Si simplemente lo empujas al azar, aprende lentamente. Para aprender rápido, necesitas un "precondicionador" inteligente: una herramienta que reconfigure estos empujones para que estén perfectamente equilibrados y sean eficientes.

Dos herramientas populares para este trabajo son KL-Shampoo y Muon.

  • KL-Shampoo es como un maestro escultor. Intenta tallar la forma perfecta para cada empujón individual. Es muy preciso, pero requiere mucho esfuerzo pesado (potencia de cálculo y memoria) para calcular la forma de cada pieza del rompecabezas.
  • Muon es como un gimnasta. No intenta reconfigurar cada pieza; en su lugar, simplemente endereza el momento de los empujones, haciendo que se muevan de manera limpia y ortogonal (en ángulo recto). Es rápido y ligero, pero podría pasar por alto algunos detalles sutiles que el escultor capta.

El Gran Descubrimiento: El Patrón "Pico y Plano"
Los autores de este artículo observaron de cerca el trabajo del "escultor" (el precondicionador KL-Shampoo) y notaron un patrón extraño y hermoso. Descubrieron que las "formas de los empujones" no son aleatorias. En cambio, se asemejan a un paisaje de pico y plano:

  • El Pico: Unas pocas direcciones tienen valores enormes y dominantes (como unas pocas montañas altas).
  • El Plano: El resto de las direcciones tienen aproximadamente la misma altura (como una vasta llanura plana).

Esto ocurre en todas las capas del cerebro del robot, desde la primera hasta la última. Es como si el robot solo realmente se preocupara por unas pocas direcciones específicas, y en todas partes más, fuera simplemente "ruido plano".

La Solución: Pro-KLShampoo
Los autores construyeron un nuevo optimizador llamado Pro-KLShampoo (KL-Shampoo Proyectado). Piénsalo como una herramienta híbrida que obtiene lo mejor de ambos mundos utilizando el descubrimiento de "pico y plano".

Así es como funciona, usando una analogía simple:

  1. El "Salón VIP" (El Subespacio):
    El algoritmo identifica las direcciones de "pico": las pocas montañas importantes. Las coloca en un "Salón VIP" especial (un subespacio rastreado). Dentro de este salón, utiliza la herramienta pesada y precisa de escultura (KL-Shampoo) para obtener la forma perfecta para estas pocas direcciones críticas. No pierde tiempo con el resto.

  2. El "Campo Abierto" (El Complemento):
    Para las direcciones "planas" (el resto del paisaje), deja de intentar tallar cada guijarro individual. En su lugar, utiliza un truco inteligente llamado Ortogonalización (prestado de la herramienta Muon).

    • El Truco Mágico: Los autores demostraron matemáticamente que si simplemente "enderezas" (ortogonalizas) los empujones en esta área plana, mágicamente recuperas el mismo resultado algebraico exacto que si hubieras realizado la pesada escultura allí. Es como darse cuenta de que, para un campo plano, no necesitas un mapa; solo necesitas caminar en línea recta, y terminarás exactamente en el mismo lugar que si hubieras calculado cada coordenada.

¿Por qué es esto mejor?

  • Velocidad: Al ignorar la escultura pesada para las partes "planas" y simplemente enderezarlas, el algoritmo se ejecuta mucho más rápido. Ahorra mucho tiempo en el "reloj de pared" (tiempo real) de la computadora.
  • Memoria: No necesita almacenar las formas masivas y complejas para las partes planas. Solo almacena las pequeñas formas "VIP" y un solo número para el resto. Esto ahorra mucha memoria de la computadora.
  • Rendimiento: En pruebas con diferentes tamaños de robots (GPT-2 y LLaMA), Pro-KLShampoo aprendió más rápido y alcanzó una tasa de error más baja que el KL-Shampoo original, utilizando menos memoria.

En Resumen
El artículo dice: "Descubrimos que las matemáticas complejas detrás del entrenamiento moderno de IA tienen un patrón simple: unos pocos picos grandes y una cola plana. Construimos una nueva herramienta que trata los picos con extremo cuidado y la cola plana con un truco simple y rápido. Este truco funciona tan bien como las matemáticas difíciles, pero es mucho más rápido y económico de ejecutar".

El resultado es una forma más inteligente y rápida de entrenar modelos de IA que ahorra tiempo y recursos informáticos sin sacrificar la calidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →