← Últimos artículos
🤖 AI

I-CARE: Analysis of interference-related phenomena in a controllable, diverse and representative unlearning setting for text-to-image models

Este artículo presenta I-CARE, una metodología integral que formaliza y proporciona herramientas estandarizadas para analizar fenómenos relacionados con la interferencia en el desaprendizaje de modelos de texto a imagen, permitiendo una evaluación sistemática y reproducible de la degradación de conocimiento no deseada en diversos entornos.

Autores originales: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Publicado 2026-09-02
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En los últimos años, la inteligencia artificial ha aprendido a pintar imágenes a partir de palabras. Puedes escribir una frase como "un gato con un sombrero" y un programa informático generará una imagen única que coincida con esa descripción. Estos sistemas, conocidos como modelos generativos, han sido entrenados con colecciones masivas de imágenes y texto, aprendiendo a asociar palabras con patrones visuales. Pero a medida que estas herramientas se vuelven más potentes, ha surgido un nuevo problema: ¿qué ocurre cuando quieres que olviden?

Imagina un modelo que ha aprendido a dibujar a una celebridad específica, pero que esa persona solicita más tarde que su imagen sea eliminada del sistema, quizás debido a preocupaciones de privacidad o al deseo de controlar su huella digital. Este proceso, llamado desaprendizaje de máquinas (machine unlearning), es el intento de hacer que un sistema de IA "desaprenda" un concepto específico sin romper su capacidad de dibujar todo lo demás. Es una operación delicada. Si intentas borrar algo de forma demasiado agresiva, el modelo podría dañar accidentalmente su conocimiento de otras cosas no relacionadas. Un modelo que intenta olvidar una raza de perro específica podría empezar a dibujar mal todos los perros, o un modelo que intenta eliminar a un político podría empezar a generar imágenes distorsionadas de otras figuras públicas. Este daño no deseado en conceptos relacionados se conoce como interferencia y, hasta ahora, los científicos no tenían una forma fiable de medir qué tan grave era o por qué sucedía.

Un equipo de investigadores ha introduido un nuevo marco de trabajo llamado I-CARE para estudiar este problema. En lugar de inventar una nueva forma de borrar datos o un nuevo modelo de IA, construyeron un método estandarizado para probar cómo las diferentes técnicas de borrado afectan al resto del sistema. Piensa en ello como una nueva regla para medir el daño. Antes de este trabajo, los estudios sobre el desaprendizaje solían ser inconsistentes; un equipo podía probar el olvido de una persona mientras otro probaba el olvido de un paisaje, lo que hacía imposible comparar los resultados de manera justa. El marco I-CARE proporciona un lenguaje común y un conjunto de reglas estrictas para configurar estos experimentos. Define exactamente qué significa "olvidar" algo, cómo medir la calidad de las imágenes restantes y cómo rastrear qué conceptos no relacionados resultaron perjudicados en el proceso. Los investigadores también construyeron una herramienta de software libre y de código abierto llamada Forgety, que permite a cualquiera explorar estos resultados sin necesidad de escribir código o comprender matemáticas complejas.

Para demostrar que su método funcionaba, los investigadores realizaron un experimento masivo. Eligieron tres categorías distintas para probar: personas famosas, razas de perros específicas y diversas escenas como bosques o estadios. Para cada categoría, seleccionaron cien entidades específicas, como un actor en particular, un tipo específico de terrier o un tipo particular de puente. Luego, tomaron un generador de imágenes de última generación y aplicaron tres técnicas diferentes de desaprendizaje para eliminar una entidad a la vez. En total, tuvieron que borrar 900 conceptos diferentes y generar 360.000 imágenes nuevas para ver qué sucedía. Lo hicieron no solo para ver si el objetivo había desaparecido, sino para ver si la capacidad del modelo para dibujar las otras 99 entidades de esa categoría había cambiado.

Los resultados revelaron que la interferencia es mucho más compleja de lo que los científicos pensaban anteriormente. Una suposición común era que el modelo solo dañaría los conceptos que fueran muy similares al que se estaba borrando. Por ejemplo, si borraras un Golden Retriever, podrías esperar que un Labrador sufriera, pero que un Poodle permaneciera intacto. El estudio encontró que esto no siempre es así. A veces, borrar una entidad causaba un daño significativo a entidades que parecían completamente no relacionadas, mientras que dejaba intactas a otras muy similares. En algunos casos, el daño era tan impredecible que los investigadores no pudieron encontrar una regla simple para explicarlo. Descubrieron que la cantidad de daño causado dependía en gran medida del método específico utilizado para borrar los datos. Un método, que se basaba en un enfoque de teoría de juegos, causó significativamente más daños colaterales que los otros dos métodos probados. Otro método, que no requería datos adicionales para funcionar, causó menos daño en general pero era más difícil de predecir.

Los investigadores también analizaron cómo los datos utilizados para proteger los conceptos restantes afectaban el resultado. Encontraron que si se le mostraban al modelo ejemplos de cosas similares mientras olvidaba el objetivo, este era mucho mejor protegiendo esas cosas similares. Por ejemplo, al intentar borrar un campo de fútbol, el modelo mantuvo seguros otros recintos deportivos solo si se le mostraban activamente imágenes de otros deportes durante el proceso de borrado. Si esos ejemplos faltaban, el modelo degradaba accidentalmente las imágenes de todos los recintos deportivos. Esto sugiere que la forma en que un modelo es entrenado para "recordar" mientras está "olvidando" es tan importante como la técnica de borrado misma.

Quizás el hallazgo más sorprendente fue que la interferencia no siempre es destructiva. En aproximadamente el 2,7% de los casos, los investigadores observaron que borrar un concepto de hecho hacía que las imágenes de un concepto similar mejoraran ligeramente. Por ejemplo, cuando borraron la imagen de un famoso piloto de carreras, la capacidad del modelo para dibujar a un famoso nadador mejoró ligeramente. Los investigadores llaman a esto "interferencia constructiva". Aunque esto ocurrió raramente, demuestra que la relación entre conceptos en un modelo de IA no es una calle de sentido único donde borrar una cosa siempre perjudica a otra. A veces, eliminar un patrón específico permite al modelo refinar su comprensión de un patrón relacionado.

El estudio también destacó la dificultad de predecir estos resultados. Los investigadores intentaron construir un sistema que pudiera adivinar qué conceptos interferirían entre sí basándose en qué tan similares parecían para un humano. Encontraron que estas predicciones eran a menudo erróneas. Dos entidades que parecían muy similares para un humano podrían no interferir entre sí en el modelo, mientras que dos que parecían diferentes podrían causar un daño masivo. Esto sugiere que la lógica interna de estos modelos de IA es todavía, en gran medida, un misterio para nosotros. Podemos ver el daño, pero aún no podemos predecir con fiabilidad dónde ocurrirá antes de realizar el borrado.

Para hacer estos hallazgos accesibles, el equipo creó una interfaz basada en la web llamada Forgety. Esta herramienta permite a los usuarios navegar por los resultados de sus experimentos, visualizar qué conceptos interferían con otros y explorar los datos sin necesidad de ser programador. Convierte miles de puntos de datos complejos en gráficos y listas sencillas que cualquiera puede entender. Esta transparencia es una parte clave de su trabajo, ya que permite a los responsables políticos, a los éticos y al público ver las consecuencias en el mundo real de intentar hacer que los sistemas de IA olviden.

El artículo concluye que, si bien hemos progresado en la comprensión del desaprendizaje de máquinas, aún no existe una única "mejor" forma de hacerlo. La eficacia de un método de borrado depende enteramente de la tarea específica y de los datos utilizados. Los investigadores enfatizan que su marco de trabajo está diseñado para evolucionar. A medida que se creen nuevos modelos de IA y se inventen nuevas formas de borrar datos, el método I-CARE puede aplicarse para probarlos, asegurando que el campo avance con resultados claros, comparables y reproducibles. El objetivo final no es solo hacer que la IA olvide, sino hacerlo sin romper el resto de su mente, garantizando que estas poderosas herramientas sigan siendo seguras y fiables para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →