← Últimos artigos
💬 NLP

Model Unlearning Objectives Vary for Distinct Language Functions

Este artigo argumenta que o esquecimento em modelos de linguagem deve ser adaptado a funções específicas, em vez de ser tratado como uma tarefa monolítica, demonstrando por meio de experimentos em modelos de 7 a 8 bilhões de parâmetros que objetivos distintos — especificamente uma abordagem meta-aprendida baseada em cosseno para conhecimento perigoso e um método baseado em sondas multicamadas para toxicidade — produzem resultados superiores para seus respectivos objetivos.

Autores originais: Berk Atil, Vipul Gupta, Rebecca J. Passonneau

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Berk Atil, Vipul Gupta, Rebecca J. Passonneau

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine os Modelos de Linguagem de Grande Escala (LLMs) como alunos incrivelmente talentosos, mas ligeiramente imprudentes, que leram quase tudo na internet. Eles são ótimos em escrever histórias e responder perguntas, mas também adquiriram alguns maus hábitos: às vezes sabem segredos perigosos (como construir uma bomba) e, às vezes, usam linguagem ofensiva ou tóxica.

O artigo argumenta que tentar "desaprender" esses maus hábitos não é uma tarefa que se encaixa em todos os casos. Assim como um professor usa métodos diferentes para impedir que um aluno trapaceie em uma prova de matemática versus impedir que ele seja rude com os colegas, os pesquisadores de IA precisam de ferramentas diferentes para problemas diferentes.

Abaixo está uma explicação de sua abordagem usando analogias simples:

1. O Problema Central: Um Tamanho Não Serve para Todos

Os autores afirmam que o "desaprendizado" (ensinar a IA a esquecer coisas específicas) não deve ser tratado como uma única tarefa genérica.

  • Conhecimento Perigoso é como um aluno memorizando um fato específico e perigoso (por exemplo, "Como fazer veneno"). Isso é armazenado no modelo como um arquivo específico em uma biblioteca.
  • Toxicidade é como a má atitude de um aluno ou a tendência de ser rude. Isso não é apenas um fato; é uma vibração ou um padrão que se espalha por toda a personalidade do aluno.

O artigo afirma que, como esses dois problemas são armazenados de maneira diferente dentro do "cérebro" da IA, são necessárias duas estratégias distintas para corrigi-los.

2. Estratégia A: Esquecer Fatos Perigosos (A Abordagem "Cosseno")

Quando a IA conhece fatos perigosos, os autores testaram um novo método baseado em direção em vez de distância.

  • O Jeito Antigo (Perda L2): Imagine tentar afastar um carrinho de brinquedo de um penhasco. O método antigo media a distância exata entre o carrinho e o penhasco. Se o carrinho se movesse 1 polegada, isso contava como progresso. Mas, se o carrinho fosse enorme, mover 1 polegada talvez não fosse suficiente.
  • O Novo Jeito (Perda Cosseno): Os autores sugerem que não devemos nos importar com a distância exata. Em vez disso, devemos nos importar com a direção para a qual o carrinho está apontando. Se o carrinho estiver apontando para o penhasco, giramos 180 graus para que ele aponte na direção oposta. Mesmo que ainda esteja perto da borda, agora está apontando para longe do perigo.
  • O Resultado: Eles também usaram um "treinador inteligente" (meta-aprendizado) que descobre automaticamente quão forte empurrar o carrinho para girá-lo sem fazê-lo esquecer como dirigir (conhecimento geral). Isso funcionou muito bem para remover fatos perigosos.

3. Estratégia B: Esquecer Toxicidade (A Abordagem "Multicamada")

Quando a IA está sendo tóxica, o método de "girar o carrinho" falhou. Por quê? Porque a toxicidade não é armazenada em um único local específico; é como uma mancha que impregnou o tecido do cérebro da IA através de muitas camadas diferentes.

  • O Problema: Se você apenas esfregar um ponto em uma camisa manchada, a mancha ainda está lá.
  • A Solução: Os autores construíram um "esfregador multicamada". Eles olharam para o cérebro da IA em diferentes profundidades (camadas iniciais, médias e tardias) e descobriram que o "sinal de toxicidade" parece diferente em cada nível.
  • O Método: Eles treinaram detectores especiais (sondas) em várias camadas para encontrar exatamente onde a toxicidade está se escondendo. Em seguida, eles forçaram a IA a mudar seu comportamento em todas essas camadas simultaneamente, efetivamente esfregando a mancha de toda a camisa, não apenas de um ponto.

4. O Placar: S-Unlearning

Como saber se a IA está melhor? Você não pode apenas dizer: "É menos tóxica", porque talvez ela também tenha parado de ser útil.
Os autores criaram uma nova pontuação chamada S-Unlearning.

  • Imagine uma balança de dois pratos. De um lado está "Quão bem removemos as coisas ruins?" e do outro "Quão bem mantivemos as coisas boas?".
  • A pontuação S-Unlearning é como a área de um retângulo formado por esses dois lados. Você quer um retângulo grande (alta remoção de coisas ruins E alta retenção de coisas boas). Se você remover as coisas ruins, mas quebrar a IA a ponto de ela não conseguir mais falar, seu retângulo encolhe para zero.

5. O Que Eles Encontraram

Eles testaram isso em quatro modelos de IA de código aberto diferentes (como Llama, Mistral e Qwen).

  • Para Fatos Perigosos: Seu novo método "baseado em direção" funcionou melhor do que métodos anteriores ao fazer a IA esquecer informações perigosas sem perder sua inteligência geral.
  • Para Toxicidade: Seu "esfregador multicamada" foi muito mais eficaz do que tentar usar o mesmo método usado para fatos perigosos. Eles descobriram que a toxicidade está, de fato, espalhada, e você precisa mirar em várias camadas para corrigi-la.
  • A Grande Conclusão: Você não pode usar uma única "varinha mágica" para resolver todos os problemas de IA. Você precisa entender como a IA armazena o problema (como um fato específico ou como um comportamento disperso) e escolher a ferramenta certa para corrigi-lo.

Em resumo: Para corrigir um fato específico, mude a direção. Para corrigir uma má atitude, esfregue todo o sistema camada por camada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →