Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition
Este artigo demonstra que as técnicas padrão de fusão de modelos frequentemente causam um colapso assimétrico onde as capacidades de reconhecimento de segurança são perdidas enquanto os comportamentos amplos de recusa são preservados, primariamente porque o ajuste fino de recusa induz magnitudes de vetores de tarefa significativamente maiores que dominam o processo de fusão, apesar de os vetores serem quase ortogonais.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um robô superinteligente que consegue aprender novos truques. Às vezes, você quer ensinar ao robô uma coisa específica, como identificar uma manchete de notícia falsa. Outras vezes, você quer que ele aprenda um truque diferente, como dizer "não" a pedidos perigosos. Mas e se você quisesse que o robô fizesse as duas coisas ao mesmo tempo? No mundo da inteligência artificial, existe um atalho inteligente chamado "fusão de modelos" (model merging). Em vez de treinar o robô do zero, os cientistas pegam duas versões diferentes do robô — uma treinada para o truque A e outra para o truque B — e misturam matematicamente seus cérebros. É como misturar dois sabores diferentes de sorvete para obter um novo redemoinho perfeito. A grande questão é: quando você mistura esses dois "sabores" de treinamento de segurança, você obtém um robô que é bom em ambos ou um sabor completamente abafa o outro? Este é o mistério que um novo estudo se propôs a resolver, investigando se podemos manter a capacidade de um robô de entender o perigo e, ao mesmo tempo, manter sua capacidade de recusar esse perigo.
Os pesquisadores por trás deste estudo, publicado na conferência COLM 2026, decidiram testar isso com um modelo de robô específico chamado Gemma-3-1B-IT. Eles criaram duas versões especiais deste robô. A primeira versão, vamos chamá-la de "Detetive", foi treinada em um conjunto massivo de dados de perguntas médicas para se tornar um especialista em identificar o quão prejudicial é um comando (prompt). Ela aprendeu a dar uma resposta graduada, como dizer: "Isso é um pouco arriscado" ou "Isso é muito perigoso". A segunda versão, "Guardião", foi treinada em uma enorme coleção de comandos adversariais complexos, projetados para quebrar as regras do robô. O Guardião aprendeu uma lição simples e direta: se parecer perigoso, apenas diga "Não" e recuse-se a responder, sem fazer perguntas.
A equipe então pegou esses dois especialistas e tentou fundi-los de volta em um único robô usando quatro métodos matemáticos de mistura diferentes. Eles esperavam o resultado de um robô que pudesse tanto detectar o nível de dano quanto recusar as coisas ruins. Em vez disso, encontraram um resultado estranho e desequilibrado. Em todos os casos, o comportamento do "Guardião" assumiu o controle total. Os robôs fundidos tornaram-se excelentes em recusar comandos ruins, mantendo suas taxas de recusa altas (entre 81% e 85%). No entanto, as habilidades do "Detetive" desapareceram quase completamente. Os robôs esqueceram como graduar o dano; sua capacidade de classificar a gravidade de um comando caiu para quase zero (caindo para tão baixo quanto 0,6% ou 12,9%, dependendo do método). Foi como se o robô tivesse aprendido a bater a porta na cara de tudo, esquecendo-se de espiar pelo olho mágico para ver o que realmente estava lá.
Por que isso aconteceu? Os cientistas examinaram de perto o "DNA" dos dois robôs para encontrar o culpado. Eles descobriram que não foi porque os dois robôs estavam lutando entre si ou tentando ir em direções opostas. Na verdade, seus cérebros estavam quase em ângulos retos um com o outro, o que significa que eles estavam tentando fazer coisas totalmente diferentes sem entrar em conflito. O problema real era uma questão de volume. O robô "Guardião" havia sido treinado em um conjunto de dados aproximadamente 29 vezes maior do que o conjunto de dados do "Detetive". Por causa disso, as mudanças feitas no cére-rebro do Guardião foram muito mais "altas" e fortes. Quando os cientistas misturaram os cérebros, as ferramentas matemáticas que usaram foram como um botão de volume que aumentou o sinal mais alto e diminuiu o sinal mais silencioso. O "Não!" grande e audacioso do "Guardião" abafou o "Talvez" sutil e matizado do "Detetive".
Mesmo quando os pesquisadores tentaram corrigir isso diminuindo o conjunto de dados de treinamento do Guardião para igualar o tamanho do conjunto do Detetive, o problema não desapareceu totalmente para todos os métodos de fusão. Isso sugere que, embora o tamanho dos dados fosse um fator importante, a maneira como os algoritmos de fusão lidam com esses sinais de "volume alto" versus "volume baixo" é a verdadeira chave. O estudo sugere que as ferramentas de fusão padrão são atualmente enviesadas para manter os comportamentos grandes e brutos (como recusar tudo) enquanto deletam acidentalmente as habilidades detalhadas e refinadas (como entender por que algo é ruim).
Então, o que isso significa para o futuro? O artigo sugere que, se quisermos construir uma IA segura que possa tanto recusar coisas ruins quanto entender as nuances da segurança, não podemos apenas misturar e combinar modelos usando as ferramentas padrão atuais. Podemos estar perdendo o "Detetive" dentro do "Guardião". Os pesquisadores concluem que os métodos futuros precisam ser mais inteligentes sobre como equilibrar esses diferentes "volumes" de aprendizado, garantindo que o robô não aprenda apenas a dizer "não" para tudo, mas que também aprenda a entender a diferença entre um pequeno aviso e um grande perigo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.