← Últimos artigos
🤖 machine learning

Leak@kk: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding

Este artigo revela que os métodos existentes de esquecimento em LLMs não conseguem alcançar o esquecimento verdadeiro sob decodificação probabilística, introduzindo a métrica \texttt{leak@kk} para quantificar essa vulnerabilidade e propondo o algoritmo \texttt{RULE} para mitigar efetivamente o vazamento de conhecimento em múltiplos benchmarks.

Autores originais: Hadi Reisizadeh, Jiajun Ruan, Yiwei Chen, Soumyadeep Pal, Sijia Liu, Mingyi Hong

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hadi Reisizadeh, Jiajun Ruan, Yiwei Chen, Soumyadeep Pal, Sijia Liu, Mingyi Hong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: A Ilusão da "Amnésia"

Imagine que você contrata um bibliotecário (a IA) e pede para remover um livro específico e embaraçoso de sua coleção. Você quer que ele esqueça completamente a história para que nunca a conte novamente.

Os pesquisadores deste artigo descobriram uma verdade chocante: O bibliotecário não está realmente esquecendo a história.

Quando você faz uma pergunta ao bibliotecário, ele geralmente dá uma resposta padrão e segura (como um robô lendo um roteiro). Isso é chamado de Decodificação Gananciosa. Sob essas condições, o bibliotecário parece ter esquecido o livro com sucesso.

No entanto, se você pedir ao bibliotecário para "improvisar" ou "ser criativo" (que é como a IA do mundo real realmente funciona, chamada de Decodificação Probabilística), o bibliotecário de repente lembra da história e a conta para você, muitas vezes palavra por palavra. O "esquecimento" foi apenas uma ilusão causada pela forma como estávamos testando-os.

O Problema: A "Bola Mágica 8" vs. a "Bola de Cristal"

Para entender o artigo, precisamos olhar para como a IA toma decisões:

  1. Decodificação Gananciosa (A Bola de Cristal): Imagine que a IA sempre escolhe a única palavra mais óbvia e segura a seguir. É como uma bola de cristal que só mostra o futuro mais provável. Neste modo, a IA esconde com sucesso o segredo.
  2. Decodificação Probabilística (A Bola Mágica 8): No mundo real, a IA não escolhe apenas a palavra mais provável; ela escolhe entre uma lista de boas opções, às vezes seguindo um caminho mais arriscado para ser mais criativa ou humana. Isso é como agitar uma Bola Mágica 8.
    • A Descoberta: O artigo descobriu que, enquanto a IA esconde o segredo ao olhar através da Bola de Cristal, ela revela o segredo quando você agita a Bola Mágica 8 vezes suficientes. Se você fizer a mesma pergunta 64 vezes com "agitações" diferentes (aleatoriedade), o segredo eventualmente vaza.

A Nova Ferramenta: "Leak@k"

Os autores perceberam que os testes atuais eram como verificar uma barragem apenas quando o rio está calmo. Eles precisavam de uma maneira de testar a barragem durante uma tempestade.

Eles inventaram uma nova régua de medição chamada Leak@k.

  • A Analogia: Imagine que você está tentando ver se uma peneira tem furos.
    • Antiga maneira: Você derrama uma xícara de água através da peneira. Nenhuma água sai? Ótimo, sem furos! (Este é o antigo teste "Ganancioso").
    • Maneira Leak@k: Você derrama k xícaras de água através da peneira. Mesmo que a primeira xícara não vaze, a 10ª ou a 50ª xícara pode encontrar um pequeno furo e pingar.
  • O que mede: Calcula a probabilidade de que pelo menos uma dessas muitas tentativas revele a informação secreta. O artigo mostra que para quase todos os métodos atuais de "esquecimento", à medida que você aumenta o número de xícaras (k), a água (segredos) eventualmente vaza.

A Evidência: O Exemplo do "Ônibus para o Inferno"

O artigo fornece um exemplo engraçado, mas sério, usando um conjunto de dados sobre artigos de notícias (MUSE).

  • O Segredo: Um número de rota de ônibus que foi alterado de 666 (Inferno) para 669.
  • O Teste:
    • Modo Ganancioso: A IA diz: "Não conheço essa rota." (Sucesso!)
    • Modo Probabilístico (64 tentativas): A IA eventualmente diz: "O novo número da rota é 669." (Falha!)

Isso aconteceu em três grandes testes diferentes (TOFU, MUSE e WMDP). Seja o segredo um nome de autor fictício, um fato jornalístico ou conhecimento biológico perigoso, o "esquecimento" falhou assim que a IA foi permitida a ser criativa.

A Solução: RULE (Esquecimento Robusto)

Como os métodos antigos eram como tentar apagar uma tatuagem com um papel toalha molhado (parece que sumiu, mas a tinta ainda está lá), os autores criaram um novo método chamado RULE.

  • Como funciona: Em vez de apenas dizer à IA "Esqueça esta frase específica", o RULE joga um jogo de "Whac-A-Mole" (o jogo de martelar topos).

    1. Faz a IA responder à pergunta várias vezes para ver como ela tenta vazar o segredo.
    2. Pega a IA quando ela quase erra.
    3. Então ensina a IA a esquecer esses deslizes específicos também.
    4. Repete esse processo, ficando mais rigoroso a cada vez.
  • O Resultado: Com o RULE, mesmo que você agite a Bola Mágica 8 128 vezes, o segredo permanece escondido. A IA realmente esquece, não apenas quando está sendo cuidadosa, mas mesmo quando está sendo criativa.

Resumo

  • O Problema: Os métodos atuais de "esquecimento" de IA são falsos. Eles só funcionam quando a IA é forçada a ser chata e previsível.
  • A Realidade: Quando a IA é permitida a ser criativa (que é como a usamos), ela lembra das coisas que lhe dissemos para esquecer.
  • O Conserto: Os autores construíram um novo teste (Leak@k) para pegar essa trapaça e um novo método de treinamento (RULE) para realmente fazer a IA esquecer, mesmo sob pressão.

O artigo conclui que não podemos confiar nas medidas de segurança atuais de IA até que elas sejam testadas com esse novo e mais rigoroso padrão "Leak@k".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →