SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning
El artículo propone SAME, un marco de Mezcla de Expertos estabilizado para el Ajuste de Instrucciones Multimodal Continuo que mitiga la deriva del enrutador y de los expertos mediante el enrutamiento de subespacios ortogonales, el escalado sensible a la curvatura y la activación adaptativa de expertos, logrando un rendimiento de vanguardia en un nuevo referente de secuencias largas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina a un estudiante que es brillante resolviendo problemas matemáticos pero que, cuando se le pide leer un poema, de repente olvida cómo contar. Este es el desafío central que enfrentan los sistemas modernos de inteligencia artificial conocidos como modelos de lenguaje de gran tamaño multimodales. Estos son computadores potentes que pueden ver imágenes y leer texto, aprendiendo a responder preguntas sobre el mundo mediante el estudio de vastas cantidades de datos. Están entrenados para seguir instrucciones, como "describe al gato en la foto" o "resuelve este problema de física". Sin embargo, en el mundo real, estos sistemas no lo aprenden todo a la vez. En su lugar, encuentran nuevos tipos de tareas una tras otra, como un estudiante pasando de una clase de matemáticas a una de historia y luego a una de arte. El problema es que, a medida que estos modelos aprenden nuevas habilidades, a menudo olvidan las anteriores, un fenómeno que los científicos llaman olvido catastrófico. Para mantener estos modelos útiles, los investigadores necesitan una forma de enseñarles cosas nuevas sin borrar lo que ya saben.
Durante algún tiempo, los expertos han intentado resolver esto dándole al modelo un equipo de ayudantes especializados, una estructura conocida como mezcla de expertos. Piensa en el modelo como una gran oficina donde diferentes trabajadores, o "expertos", se encargan de diferentes tipos de trabajos. Cuando llega una pregunta, un gerente, llamado enrutador, decide qué trabajador es el más adecuado para responderla. Si la pregunta es sobre un gráfico, el enrutador la envía al analista de datos; si es sobre un poema, va al escritor. Este sistema funciona bien cuando las tareas son estables, pero los investigadores descubrieron una falla cuando el modelo tenía que aprender una larga secuencia de nuevas tareas. A medida que el modelo aprendía nuevas habilidades, el gerente comenzaba a cometer errores, enviando tipos de preguntas antiguas a los trabajadores equivocados. Simultáneamente, los trabajadores mismos comenzaban a cambiar, perdiendo las habilidades específicas que habían desarrollado para tareas anteriores. Este doble fallo significaba que el modelo no solo estaba enviando las preguntas a las personas equivocadas, sino que también estaba olvidando cómo realizar los trabajos que esas personas debían hacer.
Un equipo de investigadores ha propuesto ahora un nuevo método llamado SAME para solucionar estos problemas. Descubrieron que la confusión del gerente y la pérdida de memoria de los trabajadores eran dos problemas distintos que requerían soluciones diferentes. Para evitar que el gerente se confunda, los investigadores diseñaron un sistema que rastrea cuidadosamente cómo el modelo ve el mundo. En lugar de permitir que el gerente cambie de opinión completamente con cada nueva lección, restringen cuánto puede cambiar su enfoque. Permiten que el gerente aprenda nuevas formas de clasificar preguntas, pero protegen las formas antiguas de clasificar que eran esenciales para tareas previas. Esto asegura que una pregunta sobre una imagen médica, por ejemplo, continúe yendo al experto médico, incluso después de que el modelo haya aprendido a leer mapas o resolver problemas de química.
Para evitar que los trabajadores olviden sus trabajos, los investigadores introdujeron una forma de medir cuánto podría dañar el nuevo aprendizaje de un trabajador sus habilidades previas. Analizaron los tipos de datos que los trabajadores habían visto en el pasado y utilizaron ese historial para ralentizar los cambios que podrían dañar esas viejas habilidades. Es como decirle a un trabajador: "Puedes aprender esta nueva habilidad, pero hazlo de una manera que no borre cómo reparabas las máquinas antiguas". Al hacer esto, el modelo preserva las capacidades específicas que obtuvo de tareas anteriores mientras sigue siendo capaz de adaptarse a nuevas. Además, los investigadores descubrieron que no todos los trabajadores necesitan estar activos para cada lección. Crearon una regla para pausar temporalmente a los trabajadores que no son necesarios para la tarea actual, lo que ahorra energía y evita que sean cambiados accidentalmente por información irrelevante.
El equipo probó este nuevo enfoque en una serie de evaluaciones desafiantes, incluyendo un nuevo conjunto de tareas que crearon para imitar la realidad desordenada y variada del mundo real. Esta nueva prueba incluyó diez tipos diferentes de tareas, que van desde la lectura de documentos médicos y el análisis de gráficos científicos hasta la comprensión de escenas viales complejas y fórmulas químicas. Los resultados mostraron que su método, SAME, era significativamente mejor para recordar tareas antiguas que los métodos anteriores. En una prueba específica que involucraba una larga secuencia de ocho tareas, el nuevo método mantuvo un nivel de precisión mucho más alto en la primera tarea en comparación con otros enfoques. También demostró ser más eficiente, requiriendo menos tiempo y memoria de computadora para el entrenamiento porque solo actualizaba a los trabajadores necesarios.
Quizás lo más importante es que los investigadores observaron que su método prevenía un tipo de falla sutil pero común donde el modelo obtenía la respuesta correcta pero la formateaba incorrectamente. Por ejemplo, si una tarea requería una respuesta en letras mayúsculas, el modelo podría empezar a dar la respuesta en letras minúsculas después de aprender una nueva tarea que utilizaba minúsculas. El nuevo sistema mantuvo al modelo consistente, asegurando que siguiera las reglas de formato específicas de cada tarea sin confundirse por el estilo de la siguiente. Al estabilizar tanto la decisión de quién responde la pregunta como la memoria de la persona que responde, este trabajo ofrece una forma más confiable para que la inteligencia artificial aprenda continuamente, expandiendo sus capacidades sin perder la base de lo que ya sabe.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.