Low-Rank Ternary Adaptation for Fine-Tuning Transformers
Este artículo propone la "adaptación multiplicativa ternaria", un nuevo método de bajo rango que permite el ajuste fino eficiente de transformadores ternarios mediante la representación de actualizaciones de pesos discretos a través de pequeñas matrices ternarias, preservando así el dominio ternario y permitiendo la fusión directa sin decuantización, al tiempo que recupera significativamente el rendimiento en modelos de lenguaje y visión.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La inteligencia artificial moderna se basa en programas informáticos masivos llamados transformadores, que se han convertido en el motor detrás de todo, desde asistentes de escritura hasta generadores de imágenes. Estos programas son increíblemente potentes, pero también son pesados, requiriendo vastas cantidades de memoria informática y energía para funcionar. Para hacerlos utilizables en dispositivos más pequeños como teléfonos o portátiles, los investigadores han pasado años intentando reducirlos de tamaño. Una estrategia popular es comprimir los números dentro del programa, convirtiéndolos de valores complejos de alta precisión en versiones de pocos bits más simples. Imagine tomar una fotografía de alta resolución y reducirla a unos pocos colores; la imagen se vuelve más pequeña y rápida de procesar, aunque inevitablemente se pierde algo de detalle. La forma más agresiva de esta compresión implica limitar los números internos del programa a solo tres valores posibles: menos uno, cero y positivo uno. Este enfoque, conocido como cuantización ternaria, reduce la memoria necesaria en un factor de diez, convirtiendo potencialmente un modelo que antes requería un gran servidor en algo que podría ejecutarse en un portátil estándar.
Sin embargo, un problema significativo ha estancado el progreso de estos modelos ultra compactos. Si bien los modelos son pequeños y eficientes, son difíciles de enseñar nuevas tareas. Los métodos estándar para enseñar estos programas implican realizar ajustes diminutos y continuos en sus números. Pero cuando un modelo está restringido a solo tres valores, no puede realizar ajustes pequeños; solo puede cambiar un número de negativo a positivo, o apagarlo por completo. Las técnicas existentes para enseñar estos modelos comprimidos a menudo requieren expandir temporalmente los números de vuelta a su tamaño completo y pesado para realizar los cambios, y luego comprimirlos de nuevo. Este proceso de expansión y recompresión introduce errores que degradan el rendimiento del modelo, a menudo haciendo que el resultado final sea peor que si no se hubiera realizado ninguna enseñanza.
Un equipo de investigadores de la Universidad Tecnológica de Delft y Amazon ha desarrollado una nueva forma de enseñar estos modelos ultra compactos que evita este ciclo de expansión y error. En lugar de intentar añadir números pequeños y continuos al modelo, su método trabaja directamente dentro del estricto sistema de tres valores. Diseñaron un sistema que actúa como un conjunto de interruptores, permitiendo al modelo cambiar el signo de sus números internos o apagarlos por completo, sin salir nunca del estado comprimido. Para que esto sea eficiente, no intentaron ajustar cada número individualmente. En su lugar, utilizaron una estructura matemática que permite que unos pocos patrones pequeños y simples controlen vastas secciones del modelo a la vez. Este enfoque, que llaman adaptación ternaria de bajo rango, permite que el modelo aprenda nuevas habilidades mientras permanece perfectamente comprimido.
Los investigadores probaron este método en diferentes tipos de inteligencia artificial, incluyendo modelos de lenguaje capaces de razonar y modelos de visión que reconocen imágenes. Comenzaron con modelos que ya habían sido comprimidos al límite de tres valores y luego aplicaron esta nueva técnica de enseñanza. Los resultados mostraron que los modelos recuperaron gran parte de la precisión que habían perdido durante la compresión inicial. En pruebas relacionadas con tareas de lenguaje, los modelos adaptados funcionaron significativamente mejor que los intentos previos que intentaban forzar al modelo a aprender mediante la expansión y la recompresión. Por ejemplo, en un modelo de lenguaje con tres mil millones de parámetros, el nuevo método mejoró la precisión promedio en nueve tareas diferentes de aproximadamente un 32 por ciento a un 38 por ciento, haciendo también que las predicciones del modelo fueran mucho más seguras.
Quizás lo más importante es que el resultado final de este proceso es un modelo único y unificado que permanece en su forma ultra compacta. A diferencia de otros métodos que dejan atrás un conjunto separado y pesado de instrucciones que deben cargarse junto al modelo pequeño, este nuevo enfoque integra el aprendizaje directamente en los pesos diminutos. Los investigadores descubrieron que, para las tareas de visión, como la identificación de objetos en imágenes, su método produjo un modelo que era mucho más preciso que aquellos creados al recomprimir después de aprender. También descubrieron que el proceso de aprendizaje funcionaba redistribuyendo los signos de los números existentes en lugar de intentar devolver a la vida a los números que habían sido puestos en cero. Esto significa que el modelo aprende reorganizando lo que ya tiene, en lugar de intentar crear nuevas conexiones donde no existían.
Este trabajo demuestra que es posible enseñar a modelos de inteligencia artificial altamente comprimidos sin sacrificar su eficiencia o precisión. Al respetar los límites estrictos del sistema de tres valores y encontrar una forma de aprender dentro de esos límites, los investigadores han demostrado que estos modelos diminutos pueden ser tan capaces como sus contrapartes más grandes para muchas tareas. El método no requiere memoria adicional ni potencia de cálculo durante el uso, ya que el aprendizaje está totalmente integrado en la estructura del modelo. Esto abre la puerta para ejecutar inteligencia artificial sofisticada en dispositivos con recursos muy limitados, llevando capacidades poderosas a lugares donde antes era imposible desplegarlas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.