SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning
O artigo propõe o SAME, um framework de Mistura-de-Especialistas estabilizado para Ajuste de Instrução Multimodal Contínua que mitiga o desvio de roteador e de especialista por meio de roteamento de subespaço ortogonal, escalonamento consciente da curvatura e ativação adaptativa de especialistas, alcançando o estado da arte de desempenho em um novo benchmark de sequência longa.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um estudante que é brilhante em resolver problemas de matemática mas, ao ser solicitado a ler um poema, de repente esquece como contar. Este é o desafio central enfrentado pelos sistemas modernos de inteligência artificial conhecidos como modelos de linguagem de grande escala multimodais. Estes são computadores poderosos que podem ver imagens e ler texto, aprendendo a responder perguntas sobre o mundo estudando vastas quantidades de dados. Eles são treinados para seguir instruções, como "descreva o gato na foto" ou "resolva este problema de física". No entanto, no mundo real, esses sistemas não aprendem tudo de uma vez. Em vez disso, eles encontram novos tipos de tarefas uma após a outra, como um estudante passando de uma aula de matemática para uma aula de história e, depois, para uma aula de arte. O problema é que, à medida que esses modelos aprendem novas habilidades, eles frequentemente esquecem as antigas, um fenômeno que os cientistas chamam de esquecimento catastrófico. Para manter esses modelos úteis, os pesquisadores precisam de uma maneira de ensinar coisas novas sem apagar o que já sabem.
Por algum tempo, especialistas tentaram resolver isso dando ao modelo uma equipe de ajudantes especializados, uma estrutura conhecida como mistura de especialistas (mixture of experts). Pense no modelo como um grande escritório onde diferentes trabalhadores, ou "especialistas", lidam com diferentes tipos de trabalhos. Quando uma pergunta chega, um gerente, chamado roteador, decide qual trabalhador é o mais adequado para responder. Se a pergunta for sobre um gráfico, o roteador a envia para o analista de dados; se for sobre um poema, ela vai para o escritor. Este sistema funciona bem quando as tarefas são estáveis, mas os pesquisadores descobriram uma falha quando o modelo tinha que aprender uma longa sequência de novas tarefas. À medida que o modelo aprendia novas habilidades, o gerente começava a cometer erros, enviando tipos antigos de perguntas para os trabalhadores errados. Simultaneamente, os próprios trabalhadores começavam a mudar, perdendo as habilidades específicas que haviam desenvolvido para tarefas anteriores. Esta falha dupla significava que o modelo não estava apenas enviando perguntas para as pessoas erradas, mas também estava esquecendo como realizar os trabalhos que essas pessoas deveriam fazer.
Uma equipe de pesquisadores propôs agora um novo método chamado SAME para corrigir esses problemas. Eles descobriram que a confusão do gerente e a perda de memória dos trabalhadores eram dois problemas separados que exigiam soluções diferentes. Para impedir que o gerente se confundisse, os pesquisadores projetaram um sistema que rastreia cuidadosamente como o modelo vê o mundo. Em vez de deixar o gerente mudar de ideia completamente a cada nova lição, eles restringem o quanto ele pode mudar seu foco. Eles permitem que o gerente aprenda novas maneiras de classificar perguntas, mas protegem as formas antigas de classificação que eram essenciais para tarefas anteriores. Isso garante que uma pergunta sobre uma imagem médica, por exemplo, continue indo para o especialista médico, mesmo após o modelo ter aprendido a ler mapas ou resolver problemas de química.
Para evitar que os trabalhadores esqueçam seus empregos, os pesquisadores introduziram uma maneira de medir o quanto o novo aprendizado de um trabalhador poderia prejudicar suas habilidades antigas. Eles analisaram os tipos de dados que os trabalhadores viram no passado e usaram esse histórico para retardar mudanças que danificariam essas habilidades antigas. É como dizer a um trabalhador: "Você pode aprender esta nova habilidade, mas faça-o de uma forma que não apague como você costumava consertar as máquinas antigas". Ao fazer isso, o modelo preserva as habilidades específicas que obteve de tarefas anteriores, enquanto ainda é capaz de se adaptar a novas tarefas. Além disso, os pesquisadores descobriram que nem todo trabalhador precisa estar ativo para cada lição. Eles criaram uma regra para pausar temporariamente os trabalhadores que não são necessários para a tarefa atual, o que economiza energia e evita que eles sejam alterados acidentalmente por informações irrelevantes.
A equipe testou essa nova abordagem em uma série de benchmarks desafiadores, incluindo um novo conjunto de tarefas que criaram para imitar a realidade desordenada e variada do mundo real. Este novo teste incluiu dez tipos diferentes de tarefas, abrangendo desde a leitura de documentos médicos e análise de gráficos científicos até a compreensão de cenas rodoviárias complexas e fórmulas químicas. Os resultados mostraram que o método deles, o SAME, foi significativamente melhor em lembrar tarefas antigas do que métodos anteriores. Em um teste específico envolvendo uma longa sequência de oito tarefas, o novo método manteve um nível de precisão muito mais alto na primeiríssima tarefa em comparação com outras abordagens. Também se mostrou mais eficiente, exigindo menos tempo e memória de computador para o treinamento, porque atualizava apenas os trabalhadores necessários.
Talvez o mais importante seja que os pesquisadores observaram que seu método preveniu um tipo de falha sutil, mas comum, onde o modelo daria a resposta correta, mas a formataria incorretamente. Por exemplo, se uma tarefa exigisse uma resposta em letras maiúsculas, o modelo poderia começar a dar a resposta em letras minúsculas após aprender uma nova tarefa que utilizava letras minúsculas. O novo sistema manteve o modelo consistente, garantindo que ele seguisse as regras de formatação específicas de cada tarefa sem se confundir com o estilo da próxima. Ao estabilizar tanto a decisão de quem responde à pergunta quanto a memória da pessoa que responde, este trabalho oferece uma maneira mais confiável para a inteligência artificial aprender continuamente, expandindo suas capacidades sem perder a base do que já sabe.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.