← Últimos artículos
🤖 machine learning

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

Este artículo propone la Descomposición en Valores Singulares con Pesado de Fisher Generalizada (GFWSVD), un método de compresión post-entrenamiento escalable para modelos de lenguaje extensos que utiliza una aproximación factorizada por Kronecker de la matriz de información de Fisher completa para capturar las correlaciones de los parámetros y superar significativamente las técnicas de compresión basadas en la diagonal existentes.

Autores originales: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

Publicado 2026-07-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando encoger una biblioteca masiva e intrincada para que quepa dentro de una mochila sin perder las historias en su interior. Este es el desafío diario para los científicos que trabajan en el campo de la inteligencia artificial, específicamente con las "redes neuronales": programas informáticos diseñados para aprender como los cerebros. Estos programas están construidos a partir de millones de diminutos interruptores llamados "parámetros". Para que estos programas funcionen más rápido y en dispositivos más pequeños, los investigadores intentan eliminar los interruptores que no están haciendo mucho trabajo. Pero aquí está la parte difícil: los interruptores no trabajan solos. Son como una compañía de danza compleja; si sacas a un bailarín, toda la rutina podría colapsar porque ese bailarín estaba de la mano con alguien más.

Durante años, la forma estándar de decidir qué bailarines cortar fue observar a cada uno individualmente, ignorando el hecho de que se toman de la mano. Era como comprobar si un bailarín estaba cansado sin notar que estaba apoyando a un compañero. Este método era rápido, pero a menudo arruinaba la actuación. El artículo que vas a leer aborda este problema introduciendo una nueva forma de ver la "danza" de los parámetros. Utiliza una herramienta matemática llamada "Matriz de Información de Fisher", que actúa como un mapa que muestra cómo cada interruptor está conectado con todos los demás. El objetivo es encoger la biblioteca (el modelo de IA) manteniendo las historias (la inteligencia) perfectamente intactas.

La Gran Idea: Ver la Danza Completa, No Solo a los Bailarines

Los autores de este artículo, Viktoriia Chekalina y su equipo, se dieron cuenta de que los mapas antiguos eran demasiado borrosos. Querían un mapa que mostrara no solo qué bailarines eran importantes, sino cómo estaban vinculados entre sí. Para hacer esto, inventaron un nuevo algoritmo llamado Factorización de Fisher Libre de Matrices (MFF).

Piensa en la Matriz de Información de Fisher como una gigantesca y densa niebla que cubre toda la pista de baile. En el pasado, intentar ver a través de esta niebla para encontrar las conexiones era imposible porque la niebla era demasiado espesa y la pista de baile demasiado grande. Los métodos antiguos simplemente suponían que las conexiones eran simples (como una línea recta), lo que perdía las curvas complejas de la danza real.

El nuevo truco del equipo, MFF, es como tener unos lentes especiales que te permiten ver la estructura de la niebla sin tener que despejar toda la niebla. En lugar de intentar escribir cada una de las conexiones (lo que tomaría mucha memoria), su algoritmo calcula las conexiones sobre la marcha, centrándose solo en las "capas" específicas de la danza. Es un enfoque "libre de matrices", lo que significa que nunca construye realmente el mapa gigante y pesado; simplemente utiliza la forma del mapa para guiar los cortes.

La Solución: Una Nueva Forma de Encoger el Modelo

Utilizando esta nueva forma de ver las conexiones, el equipo desarrolló un método llamado GFWSVD (SVD Ponderado por la Información de Fisher Generalizada). Si imaginas el modelo de IA como un bloque de arcilla, los métodos estándar podrían simplemente rebanar los bordes. GFWSVD, sin embargo, comprende el grano interno de la arcilla. Sabe que algunas partes de la arcilla están estrechamente tejidas y deben cortarse de una manera específica para mantener la forma.

El artículo demuestra que bajo ciertas condiciones matemáticas (específicamente, si las conexiones siguen un patrón llamado "distribución Normal Multivariante de Matrices"), su método es la forma única y óptima de encoger el modelo. No es solo una suposición; es la forma matemáticamente perfecta de minimizar el daño al rendimiento del modelo cuando se eliminan parámetros.

Lo Que Encontraron: Recortando la Mitad del Modelo

El equipo probó su nuevo método en algunos de los modelos de IA más famosos que existen, incluyendo Llama 2 y Llama 3.1, que son modelos de lenguaje masivos utilizados para todo, desde escribir código hasta chatear. También probaron BERT, un modelo utilizado para la comprensión de texto.

Esto es lo que descubrieron:

  • El Poder de Compresión: Fueron capaces de encoger estos modelos gigantes hasta en un 50%. Eso significa reducir el número de parámetros a la mitad.
  • El Rendimiento: Incluso con la mitad del tamaño, los modelos funcionaron tan bien como, o incluso mejor que, las versiones originales. En muchas pruebas, GFWSVD superó a los mejores métodos actuales (como las aproximaciones diagonales y los métodos basados en activaciones) en todos los aspectos.
  • Evitando el Colapso: Cuando intentaron comprimir los modelos en un 40%, los métodos estándar empezaron a fallar, causando que la IA perdiera su capacidad de razonar o responder preguntas correctamente. GFWSVD, sin embargo, se mantuvo robusto y fiable.
  • La Velocidad: Debido a que los modelos son más pequeños, funcionan más rápido. En un chip potente (un NVIDIA A100), los modelos comprimidos procesaron texto 1.34 veces más rápido que los modelos originales sin comprimir.

Por Qué Esto Importa

Los autores demostraron que, al prestar atención a las conexiones ocultas entre los parámetros (los elementos fuera de la diagonal), se puede encoger los modelos de IA de forma mucho más agresiva sin romperlos. Demostraron que ignorar estas conexiones, como hacen la mayoría de los otros métodos, deja mucho potencial de rendimiento sobre la mesa.

También demostraron que este método funciona como un excelente "punto de partida" para otros procesos de entrenamiento. Si utilizas GFWSVD para encoger un modelo primero, y luego dejas que el modelo aprenda un poco más (ajuste fino o fine-tuning), mantiene su precisión mucho mejor que si hubieras utilizado los métodos de encogimiento estándar.

En resumen, este artículo proporciona unas "tijeras" matemáticamente sólidas para recortar los modelos de IA gigantes. Nos permite mantener la inteligencia mientras desechamos el volumen, haciendo que la IA poderosa sea accesible en dispositivos más pequeños y más barata de ejecutar, todo ello sin perder la magia del modelo original.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →