← Últimos artigos
🤖 machine learning

Natively Unlearnable Large Language Models

Este artigo apresenta os NULLs (Natively Unlearnable LLMs), uma arquitetura de modelo que utiliza neurônios de base compartilhados e sumidouros específicos da fonte esparsamente ativados para permitir o desaprendizado eficiente, robusto e livre de dados de fontes de treinamento individuais, preservando ao mesmo tempo os benefícios do aprendizado conjunto e das capacidades gerais de linguagem.

Autores originais: Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

Publicado 2026-06-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo uma biblioteca massiva de conhecimento dentro de um cérebro gigante (um Grande Modelo de Linguagem - LLM). Normalmente, quando você ensina este cérebro, você mistura tudo. Se você ensinar um fato sobre "Harry Potter" e um fato sobre a "Segunda Guerra Mundial", essas memórias ficam emaranhadas nos mesmos neurônios. Se mais tarde você precisar remover a memória de "Harry Potter" devido a um pedido judicial, é como tentar cortar um único fio de um suéter sem desmanchar todo o resto. Você pode acidentalmente deletar a lição de história, ou a memória de Harry Potter pode voltar a aparecer furtivamente.

Este artigo apresenta uma nova maneira de construir esses cérebros de IA chamados NULLs (LLMs Nativamente Esquecíveis). Em vez de misturar tudo em um grande amontoado, os NULLs constroem o cérebro com um "sistema de classificação" especial desde o primeiro dia.

Veja como funciona, usando analogias simples:

1. A "Cozinha Compartilhada" vs. os "Armários Pessoais"

Pense no cérebro da IA como tendo dois tipos de armazenamento:

  • A Cozinha Compartilhada (A Espinha Dorsal): É onde a IA aprende coisas gerais que se aplicam a tudo, como gramática, como formar frases ou fatos comuns sobre o mundo (ex: "Paris fica na França"). Todos usam esta cozinha.
  • Os Armários Pessoais (Os Sinks/Depósitos): Esta é a nova invenção. Para cada fonte específica de informação (como um único artigo da Wikipedia ou um livro específico), a IA recebe um conjunto único de "armários" (neurônios) que apenas aquela fonte pode usar.

Quando a IA aprende um fato que é único de um artigo (como o nome de um denunciante específico em uma notícia), ela naturalmente armazena esse fato no Armário Pessoal daquele artigo. Quando ela aprende um fato geral (como "denunciantes são importantes"), isso vai para a Cozinha Compartilhada.

2. O Interruptor Mágico (Desaprender)

No modelo de IA padrão, se você quiser esquecer algo, precisa retreinar todo o cérebro ou tentar remover pesos cirurgicamente, o que muitas vezes estraga outras coisas.

Com os NULLs, "desaprender" é tão simples quanto ligar ou desligar um interruptor de luz.

  • Se uma editora diz: "Remova esse artigo específico do nosso modelo", você não precisa retreinar. Você apenas desativa o "Armário Pessoal" atribuído àquele artigo.
  • A IA esquece instantaneamente os fatos únicos daquele artigo porque o armário dela está trancado.
  • No entanto, a Cozinha Compartilhada permanece aberta. A IA ainda conhece fatos gerais sobre o tópico porque eles estão armazenados na área comum, não no armário específico.

É como se você tivesse uma casa com uma sala de estar compartilhada e um quarto para cada convidado. Se um convidado vai embora, você apenas tranca a porta do quarto dele. A sala de estar (onde todos convivem) permanece exatamente a mesma, e a casa não desmorona.

3. O que o Artigo Descobriu

Os pesquisadores testaram essa ideia de duas maneiras principais:

  • O Teste da Wikipedia (Granularidade Fina): Eles treinaram um modelo em 6 milhões de artigos da Wikipedia. Eles queriam ver se consegiam remover apenas um artigo sem deletar o conhecimento geral encontrado em artigos similares.
    • Resultado: Quando eles "trancaram" o armário de um artigo, o modelo esqueceu os detalhes únicos daquele artigo, mas manteve o conhecimento geral compartilhado por outros artigos. Funcionou quase tão bem quanto se tivessem jogado o artigo fora e retreinado o modelo do zero (o que geralmente é caro demais para fazer).
  • O Teste de Harry Potter (Granularidade Grossa): Eles treinaram um modelo em toda a série de livros de Harry Potter e depois tentaram remover todo o conhecimento de Harry Potter.
    • Resultado: Quando eles "desligaram o armário de Harry Potter", o modelo parou de falar sobre bruxos e começou a falar sobre coisas normais (como reuniões de conselho municipal) quando estimulado com frases de Harry Potter.
    • Bônus: Eles tentaram enganar o modelo para que ele lembrasse de Harry Potter novamente usando prompts "adversariais" ou reensinando-o um pouco. Os modelos de IA padrão falharam e lembraram dos livros rapidamente. O modelo NULL, no entanto, permaneceu "desaprendido" e resistiu a esses truques.

4. Isso deixa a IA mais burra?

Uma grande preocupação é que, se separarmos as memórias, a IA pode ficar pior em tarefas gerais. O artigo testou isso em benchmarks de linguagem padrão (como responder perguntas de ciência ou resolver enigmas de lógica).

  • Resultado: O modelo NULL teve um desempenho tão bom quanto um modelo de IA padrão não especializado. Ele não perdeu sua inteligência geral.

Resumo

O artigo argumenta que não devemos esperar até que uma IA seja treinada para descobrir como deletar dados. Em vez disso, devemos construir o "botão de deletar" diretamente na arquitetura. Ao dar a cada fonte de dados seu próprio "armário" dedicado enquanto compartilham uma "cozinha" comum, podemos remover cirurgicamente informações específicas sem quebrar o resto do modelo ou precisar retreinar tudo do zero.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →