← Últimos artículos
🤖 machine learning

Inpainting Insights: Elevating Visual XAI with Photorealistic Perturbations

Este artículo propone mejorar el método de explicabilidad LIME mediante la sustitución de las perturbaciones tradicionales basadas en píxeles por la técnica de inpainting generativo para producir muestras fotorrealistas y dentro de la distribución que mejoran significativamente la calidad y la fiabilidad de las explicaciones visuales para los modelos de aprendizaje automático.

Autores originales: Josef Lindl, Mariana Chaves, Damien Garreau

Publicado 2026-07-20
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Josef Lindl, Mariana Chaves, Damien Garreau

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de descubrir cómo ve el mundo un robot superinteligente. Le preguntas: "¿Qué hace que esta foto parezca un perro?", y él responde: "¡Las orejas!". Pero, ¿cómo sabes que no está simplemente adivinando debido a una sombra extraña o a un color específico? Este es el mundo de la IA Explicable (XAI). Es el campo dedicado a mirar dentro de la "caja negra" de la inteligencia artificial para ver qué está sucediendo realmente. Una forma popular de hacer esto se llama perturbación. Piensa en ello como jugar al "¿Qué pasaría si...?" con una foto. Cubres partes de la imagen —tal vez las orejas o la cola del perro— y le preguntas al robot: "¿Sigue pensando que esto es un perro?". Si el robot de repente deja de reconocer al perro cuando cubres las orejas, sabes que las orejas son importantes.

Sin embargo, hay un inconveniente. Si solo cubres las orejas con un gran y feo cuadrado gris, no estás probando realmente la comprensión del robot sobre un perro; estás probando su reacción ante un gigante bloque gris. El robot podría confundirse por el cuadrado extraño y antinatural y darte una respuesta errónea sobre lo que es importante. Este artículo aborda ese problema. Sugiere que, en lugar de usar aburridos y falsos cuadrados grises para ocultar partes de una imagen, deberíamos usar un "borrador mágico" que rellene los espacios faltantes con detalles fotorrealistas que parezcan pertenecer allí. De esta manera, el robot solo se confunde por el objeto faltante, no por un artefacto extraño, dándonos una respuesta mucho más clara sobre lo que realmente está mirando.


El Problema: Cuadrados Feos y Robots Confundidos

En el mundo de la visión computacional, los modelos de IA se están volviendo increíblemente buenos para detectar cosas, pero también se están volviendo más difíciles de entender. Para solucionar esto, los investigadores utilizan herramientas como LIME (Explicaciones Locales Interpretables Independientes del Modelo). LIME funciona tomando una imagen, troceándola en pequeñas piezas de rompecabezas llamadas "superpíxeles", y luego ocultando algunas de esas piezas para ver cómo cambia la predicción de la IA.

La forma tradicional de ocultar una pieza es pintarla con un color sólido, como gris o negro. Los autores de este artículo argumentan que esto es un poco como intentar probar la capacidad de un chef para reconocer un pastel reemplazando el glaseado con un bloque de concreto. El concreto no es parte del pastel y no parece nada natural. Cuando la IA ve este "concreto", puede entrar en pánico y hacer una predicción que no tiene nada que ver con el pastel, lo que lleva a una explicación confusa.

El artículo muestra que estos "cuadrados feos" (oclusión determinista) a menudo fallan. Por ejemplo, en una prueba con la imagen de una tirita (curita), los métodos estándar que usan cuadrados grises u otros reemplazos de color simples pasaron por alto completamente la tirita como la parte más importante de la imagen. Se distrajeron demasiado con los bloques grises antinaturales que crearon.

La Solución: El Truco de la "Inpainting Mágica"

Para resolver esto, los autores introducen un nuevo método llamado LILI (Aprovechamiento de la Inpainting para la Interpretabilidad Local). En lugar de pintar sobre las piezas de rompecabezas ocultas con pintura gris, LILI utiliza un modelo de IA generativa llamado LaMa para realizar un "inpainting" de la imagen.

Piensa en el inpainting como un artista muy talentoso que puede mirar un agujero en una foto y pintar exactamente lo que debería estar allí basándose en el entorno. Si ocultas una tirita, LaMa no pone un cuadrado gris; pinta un parche de piel que se ve exactamente como la piel alrededor de la tirita. Esto crea una "perturbación fotorrealista". El modelo de IA ve una imagen que parece natural, excepto que la tirita ha desaparecido. Esto obliga a la IA a confiar en su conocimiento real de cómo es una tirita, en lugar de reaccionar a un extraño cuadrado gris.

Pero había un segundo problema. Incluso con el artista mágico, los bordes del área oculta a veces dejaban pistas diminutas e invisibles (artefactos) que la IA aún podía ver. Para solucionar esto, los autores añadieron un paso de "expansión de la máscara". Imagina que, en lugar de solo ocultar la tirita, también ocultas un poquito de la piel a su alrededor. Esto asegura que el artista mágico tenga que rellenar todo el área con nueva piel de fondo, borrando por completo cualquier rastro del objeto original.

Lo Que Encontraron: El Realismo Gana

El equipo probó LILI contra el método antiguo (LIME con cuadrados grises) y un intento anterior que utilizaba un modelo de inpainting diferente llamado DeepFill (LIME-G). Realizaron cientos de pruebas en imágenes del conjunto de datos ImageNet, utilizando un modelo de IA estándar llamado InceptionV3 para el reconocimiento.

1. Las Imágenes Se Ven Mejor
Los autores midieron qué tan "reales" parecían las imágenes falsas utilizando una puntuación llamada Distancia de Incepción de Fréchet (FID). Una puntuación más baja significa que las imágenes falsas son más similares a las fotos reales.

  • El viejo método LIME (cuadrados grises) obtuvo 30.532.
  • El método de inpainting anterior (LIME-G con DeepFill) obtuvo 56.524 (lo cual fue sorprendentemente peor, probablemente porque el modelo no era tan bueno).
  • El nuevo método LILI obtuvo 6.727.
    Esta enorme caída en la puntuación demuestra que LILI crea imágenes que están mucho más cerca de la distribución de datos reales. Se ven naturales, no como una foto con un bloque gris pegado encima.

2. Las Explicaciones Son Más Precisas
Para ver si las explicaciones eran realmente mejores, utilizaron una "métrica de prominencia" (saliency metric). Esto mide qué tan bien la explicación resalta las partes más importantes de la imagen. Las puntuaciones más bajas son mejores aquí.

  • LILI con una expansión de máscara de 3 píxeles logró las mejores puntuaciones, superando tanto al viejo LIME como al método LIME-G.
  • Por ejemplo, en el caso de la tirita, solo LILI identificó correctamente la tirita como la característica más importante. Los otros métodos se distrajeron con el fondo o los artefactos.

3. Estabilidad y Velocidad
Los investigadores también comprobaron si las explicaciones eran consistentes. Si ejecutas la prueba diez veces, ¿obtienes la misma respuesta?

  • El viejo LIME fue el más estable (puntuación de acuerdo de 0.889), seguido de cerca por LILI (0.852).
  • LIME-G fue menos estable (0.723).
  • Los autores señalan que LILI es ligeramente menos estable que el viejo método de los cuadrados grises porque el "artista mágico" (LaMa) a veces puede pintar fondos ligeramente diferentes dependiendo de la máscara exacta. Sin embargo, este es un pequeño precio a pagar por obtener la respuesta correcta.
  • En cuanto a la velocidad, LILI tarda un poco más. El viejo LIME tardó unos 4.4 segundos por imagen, mientras que LILI tardó unos 12.5 segundos. Esto se debe a que el "artista mágico" tiene que hacer un trabajo extra para pintar las partes faltantes, pero sigue siendo mucho más rápido que otros métodos de alta tecnología que utilizan modelos de difusión.

La Conclusión

El artículo concluye que, al cambiar los feos y falsos cuadrados grises por un relleno de fondo realista generado por IA, podemos obtener explicaciones mucho mejores de cómo la IA ve el mundo. El método LILI sugiere que las perturbaciones fotorrealistas se alinean mejor con la forma en que la IA fue entrenada, lo que conduce a resultados más confiables. Aunque requiere un poco más de potencia de cálculo y una configuración cuidadosa de la "expansión de la máscara" para evitar dejar pistas, el intercambio vale la pena. Los autores sugieren que este enfoque nos ayuda a confiar más en la IA, especialmente en situaciones en las que necesitamos saber exactamente por qué una computadora tomó una decisión, sin la confusión causada por artefactos antinaturales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →