← Últimos artigos
🤖 AI

I-CARE: Analysis of interference-related phenomena in a controllable, diverse and representative unlearning setting for text-to-image models

Este artigo apresenta o I-CARE, uma metodologia abrangente que formaliza e fornece ferramentas padronizadas para analisar fenômenos relacionados à interferência no desaprendizado de modelos de texto para imagem, permitindo uma avaliação sistemática e reprodutível da degradação indesejada do conhecimento em diversos cenários.

Autores originais: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Publicado 2026-09-02
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Nos últimos anos, a inteligência artificial aprendeu a pintar imagens a partir de palavras. Você pode digitar uma frase como "um gato usando um chapéu", e um programa de computador gerará uma imagem única que corresponda a essa descrição. Esses sistemas, conhecidos como modelos generativos, são treinados em coleções massivas de imagens e textos, aprendendo a associar palavras com padrões visuais. Mas, à medida que essas ferramentas se tornam mais poderosas, um novo problema surgiu: o que acontece quando você quer que elas esqueçam?

Imagine um modelo que aprendeu a desenhar uma celebridade específica, mas que essa pessoa posteriormente pede para que sua imagem seja removida do sistema, talvez devido a preocupações com privacidade ou ao desejo de controlar sua pegada digital. Esse processo, chamado de desaprendizado de máquina (machine unlearning), é a tentativa de fazer um sistema de IA "desaprender" um conceito específico sem quebrar sua capacidade de desenhar todo o resto. É uma operação delicada. Se você tentar apagar uma coisa de forma muito agressiva, o modelo pode acidentalamente danificar seu conhecimento de outras coisas não relacionadas. Um modelo tentando esquecer uma raça específica de cachorro pode começar a desenhar todos os cachorros mal, ou um modelo tentando remover um político pode começar a gerar imagens distorcidas de outras figuras públicas. Esse dano não intencional a conceitos relacionados é conhecido como interferência e, até agora, os cientistas não tinham uma maneira confiável de medir o quão ruim isso é ou por que acontece.

Uma equipe de pesquisadores introduziu um novo framework chamado I-CARE para estudar este problema. Em vez de inventar uma nova maneira de apagar dados ou um novo modelo de IA, eles construíram um método padronizado para testar como diferentes técnicas de apagamento afetam o resto do sistema. Pense nisso como uma nova régua para medir o dano. Antes deste trabalho, os estudos sobre desaprendizado eram frequentemente inconsistentes; uma equipe poderia testar o esquecimento de uma pessoa enquanto outra testava o esquecimento de uma paisagem, tornando impossível comparar os resultados de forma justa. O framework I-CARE fornece uma linguagem comum e um conjunto de regras estritas para configurar esses experimentos. Ele define exatamente o que significa "esquecer" algo, como medir a qualidade das imagens restantes e como rastrear quais conceitos não relacionados foram prejudicados no processo. Os pesquisadores também construíram uma ferramenta de software gratuita e de código aberto chamada Forgety, que permite que qualquer pessoa explore esses resultados sem precisar escrever código ou entender matemática complexa.

Para provar que seu método funcionou, os pesquisadores realizaram um experimento massivo. Eles escolheram três categorias distintas para testar: pessoas famosas, raças de cães específicas e várias cenas, como florestas ou estádios. Para cada categoria, eles selecionaram cem entidades específicas, como um ator particular, um tipo específico de terrier ou um tipo particular de ponte. Eles então pegaram um gerador de imagens de última geração e aplicaram três técnicas diferentes de desaprendizado para remover uma entidade de cada vez. No total, eles tiveram que apagar 900 conceitos diferentes e gerar 360.000 novas imagens para ver o que acontecia. Eles fizeram isso não apenas para ver se o alvo havia partido, mas para ver se a habilidade do modelo de desenhar as outras 99 entidades naquela categoria havia mudado.

Os resultados revelaram que a interferência é muito mais complexa do que os cientistas pensavam anteriormente. Uma suposição comum era que o modelo apenas prejudicaria conceitos que fossem muito semelhantes ao que estava sendo apagado. Por exemplo, se você apagasse um Golden Retriever, poderia esperar que um Labrador sofresse, mas um Poodle permanecesse intacto. O estudo descobriu que isso nem sempre é verdade. Às vezes, apagar uma entidade causou danos significativos a entidades que pareciam completamente não relacionadas, enquanto deixava outras muito semelhantes intactas. Em alguns casos, o dano foi tão imprevisível que os pesquisadores não conseguiram encontrar uma regra simples para explicá-lo. Eles descobriram que a quantidade de dano causado dependia fortemente do método específico usado para apagar os dados. Um método, que se baseava em uma abordagem de teoria dos jogos, causou significativamente mais danos colaterais do que os outros dois métodos testados. Outro método, que não exigia dados extras para funcionar, causou menos danos no geral, mas era mais difícil de prever.

Os pesquisadores também observaram como os dados que usaram para proteger os conceitos restantes afetavam o resultado. Eles descobriram que, se o modelo fosse mostrado exemplos de coisas semelhantes enquanto estava esquecendo o alvo, ele era muito melhor em proteger essas coisas similares. Por exemplo, ao tentar apagar um campo de futebol, o modelo manteve outros locais de esportes seguros apenas se fosse ativamente mostrado fotos de outros esportes durante o processo de apagamento. Se esses exemplos estivessem ausentes, o modelo acidentalmente degradava as imagens de todos os locais de esportes. Isso sugere que a maneira como um modelo é treinado para "lembrar" enquanto está "esquecendo" é tão importante quanto a própria técnica de apagamento.

Talvez a descoberta mais surpreendente tenha sido que a interferência nem sempre é destrutiva. Em cerca de 2,7% dos casos, os pesquisadores observaram que apagar um conceito na verdade tornou as imagens de um conceito semelhante ligeiramente melhores. Por exemplo, quando apagaram a imagem de um piloto de corrida famoso, a habilidade do modelo de desenhar um nadador famoso melhorou ligeiramente. Os pesquisadores chamam isso de "interferência construtiva". Embora isso tenha ocorrido raramente, prova que a relação entre conceitos em um modelo de IA não é uma via de mão única simples onde apagar uma coisa sempre prejudica outra. Às vezes, remover um padrão específico permite que o modelo refine sua compreensão de um padrão relacionado.

O estudo também destacou a dificuldade de prever esses resultados. Os pesquisadores tentaram construir um sistema que pudesse adivinhar quais conceitos interfeririam uns com os outros com base em quão semelhantes eles pareciam para um humano. Eles descobriram que essas previsões eram frequentemente erradas. Duas entidades que pareciam muito semelhantes para um humano poderiam não interferir uma na outra no modelo, enquanto duas que pareciam diferentes poderiam causar danos massivos. Isso sugere que a lógica interna desses modelos de IA ainda é, em grande parte, um mistério para nós. Podemos ver o dano, mas ainda não podemos prever de forma confiável onde ele acontecerá antes de realizarmos o apagamento.

Para tornar essas descobertas acessíveis, a equipe criou uma interface baseada na web chamada Forgety. Esta ferramenta permite que os usuários naveguem pelos resultados de seus experimentos, visualizem quais conceitos interferiram uns com os outros e explorem os dados sem precisar ser um programador. Ela transforma milhares de pontos de dados complexos em gráficos e listas simples que qualquer pessoa pode entender. Essa transparência é uma parte fundamental de seu trabalho, pois permite que formuladores de políticas, eticistas e o público vejam as consequências no mundo real de tentar fazer com que os sistemas de IA esqueçam.

O artigo conclui que, embora tenhamos feito progressos na compreensão do desaprendizado de máquina, ainda não existe uma única "melhor" maneira de fazê-lo. A eficácia de um método de apagamento depende inteiramente da tarefa específica e dos dados utilizados. Os pesquisadores enfatizam que seu framework foi projetado para evoluir. À medida que novos modelos de IA são criados e novas formas de apagar dados são inventadas, o método I-CARE pode ser aplicado para testá-los, garantindo que o campo avance com resultados claros, comparáveis e reproduzíveis. O objetivo final não é apenas fazer a IA esquecer, mas fazê-lo sem quebrar o restante de sua mente, garantindo que essas ferramentas poderosas permaneçam seguras e confiáveis para todos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →