← Últimos artigos
💬 NLP

MeRoTune: RoPE-Safe Merging with a Tunable Dial

O MeRoTune introduz uma técnica de fusão de modelos que resolve o desalinhamento de subespaço de atenção em modelos equipados com RoPE através da aprendizagem de matrizes de correção restritas e comutativas com RoPE, permitindo a mistura ajustável post-hoc de modelos ajustados sem modificar os pesos base.

Autores originais: Salman Faroz

Publicado 2026-09-09✓ Author reviewed
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Salman Faroz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, os pesquisadores frequentemente enfrentam um dilema: eles possuem um cérebro computacional poderoso e de uso geral, e treinaram versões separadas e especializadas dele para se destacarem em tarefas específicas, como escrever código em uma linguagem ou responder perguntas em outra. O objetivo é combinar esses especialistas em um único modelo versátil sem o custo de executar vários programas ao mesmo tempo. A maneira padrão de fazer isso é simplesmente misturar os pesos matemáticos dos dois modelos, como se misturasse dois lotes de tinta. No entanto, essa mistura simples assume que a lógica interna de ambos os modelos está perfeitamente alinhada. Se um modelo pensa sobre um conceito usando um sistema de coordenadas internas ligeiramente diferente do outro, fundi-los diretamente pode criar um resultado confuso que é pior do que qualquer um dos modelos originais. Isso é particularmente complicado em modelos modernos que usam um mecanismo específico para entender a ordem das palavras, um sistema que rotaciona a informação com base na posição. Se o processo de mistura ignorar essa rotação, ele quebra silenciosamente a capacidade do modelo de entender o contexto, muitas vezes de formas invisíveis durante o treinamento.

Um pesquisador desenvolveu um novo método chamado MeRoTune para resolver esse problema. Em vez de fazer a média cega dos dois modelos, ele primeiro ensina cada modelo a ajustar seu próprio sistema de coordenadas internas para que possam concordar sobre como lidar com a ordem das palavras antes de serem misturados. Eles descobriram que, para que esse ajuste funcione sem quebrar o modelo, as mudanças devem seguir um conjunto de regras muito específico e restrito. Eles provaram matematicamente que a única maneira segura de corrigir esses modelos é aplicar um tipo específico de rotação que respeite a maneira única como o modelo lida com a posição. Eles construíram um sistema onde dois modelos especializados aprendem esses ajustes precisos por conta própria e, então, podem ser combinados em qualquer proporção que o usuário desejar, agindo como um dial ajustável em vez de uma mistura fixa.

Eles testaram essa abordagem em duas versões distintas de um modelo de linguagem: uma treinada para ser especialista em indonésio e codificação, e outra treinada para ser especialista em japonês. Antes de tentar fundir os modelos, aplicaram uma verificação matemática rigorosa para garantir que os dois modelos eram realmente diferentes o suficiente para justificar o processo complexo. Eles verificaram que cada modelo era genuinamente melhor em sua própria especialidade e pior na outra, confirmando que existia um conflito real que precisava de solução. Eles rejeitaram vários outros pares candidatos que não atendiam a esse critério, garantindo que estivessem trabalhando apenas em um problema real. Assim que confirmaram que o par era adequado, treinaram os modelos para aprender seus próprios fatores de correção únicos. Esses fatores foram projetados para serem rotações simples, garantindo que os modelos permanecessem estáveis e não se tornassem distorcidos durante o processo.

Quando combinaram os modelos usando seu novo método, os resultados foram superiores às técnicas existentes. Eles testaram o modelo fundido através de uma ampla gama de razões de mistura, desde predominantemente indonésio até predominantemente japonês, e descobriram que sua abordagem nunca teve um desempenho inferior aos métodos padrão usados por outros pesquisadores. Na verdade, na maioria dos testes, o método deles superou uma barra alta de confiabilidade estatística, enquanto um método concorrente teve um desempenho inferior ao modelo base original, não fundido, em pelo menos uma tarefa. Eles também exploraram se a razão de mistura poderia ser dividida em dois controles independentes, permitindo que cada modelo contribuísse mais livremente. Descobriram que fazer isso causava o colapso do desempenho, provando que manter a razão de mistura unida era essencial para o funcionamento do método.

O estudo também revelou detalhes interessantes sobre o que os modelos realmente aprenderam durante o processo. A maioria dos ajustes que os modelos fizeram foi de rotações muito pequenas, de apenas alguns graus, sugerindo que os modelos já estavam majoritariamente alinhados. No entanto, um pequeno número de partes específicas dos modelos exigiu mudanças muito maiores, de até oitenta e seis graus, e essas partes também diminuíram em magnitude. Isso indica que, embora a estrutura geral fosse semelhante, havia desacordos profundos e específicos sobre como os modelos lidavam com certos conceitos, o que exigiu um realinhamento significativo. Eles observaram que este método não é uma solução mágica para todos os pares possíveis de modelos; ele só funciona quando os modelos são verdadeiramente especializados de formas conflitantes e quando a estrutura interna do modelo inclui o mecanismo específico de manipulação de posição que eles abordaram.

Em última análise, este trabalho demonstra que fundir modelos de IA não é apenas uma questão de tirar a média de números. Requer a compreensão da geometria oculta de como o modelo processa a informação. Ao respeitar as regras específicas de como esses modelos lidam com a ordem das palavras, eles criaram uma ferramenta que permite ao usuário girar suavemente entre diferentes capacidades especialistas sem perder a qualidade de qualquer uma delas. O método fornece uma maneira confiável de combinar cérebros de IA especializados, garantindo que o resultado final seja um modelo coerente e de alto desempenho, em vez de uma mistura confusa. O código e os dados deste trabalho estão disponíveis publicamente, permitindo que outros verifiquem as descobertas e apliquem a mesma abordagem cuidadosa e fundamentada matematicamente às suas próprias combinações de modelos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →