← Últimos artículos
🤖 AI

ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

El artículo presenta ConceptSMILE, un marco de auditoría agnóstico al modelo que evalúa la confiabilidad de la IA explicable basada en conceptos mediante la perturbación de entradas para medir los cambios en la respuesta de los conceptos y el ajuste de modelos sustitutos, demostrando su efectividad al comparar la fiabilidad de las vías de conceptos visuales y semánticos en imágenes de fondo de ojo retiniano.

Autores originales: Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

Publicado 2026-07-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Mohadeseh Mollapour, Koorosh Aslansefat, Zeinab Dehghani, Bhupesh Kumar Mishra, Tejal Shah, Zhibao Mian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has construido un robot médico superinteligente que puede mirar fotos de ojos y decirte si algo anda mal. Le preguntas: "¿Por qué crees que este ojo está enfermo?" y responde: "Porque veo una lesión, un vaso sanguíneo y el disco óptico". Suena genial, ¿verdad? ¡Está usando palabras humanas! Pero aquí está el giro: el hecho de que el robot diga que está viendo una lesión no significa que realmente esté viendo una lesión. Podría estar haciendo trampa, mirando una mancha extraña en la lente de la cámara o un sello de fecha en la foto.

Esto es exactamente lo que investiga el artículo ConceptSMILE. Los autores son como "detectives de la confianza" para la IA. Introducen un nuevo marco llamado ConceptSMILE (Interpretabilidad a nivel de concepto estadísticamente agnóstica al modelo con explicaciones locales) para auditar si estas explicaciones con "palabras humanas" son realmente confiables o si son solo mentiras elegantes.

La gran idea: No confíes en las palabras, prueba la reacción

El artículo argumenta contra una suposición común: que si la explicación de una IA utiliza palabras que entendemos (como "lesión" o "vaso sanguíneo"), es automáticamente fiable. Los autores dicen: "¡No!". Un modelo puede dar una respuesta que suena perfecta mientras depende de trucos ocultos, como notar un logotipo específico en una foto o un artefacto extraño de cómo se tomó la imagen.

Para atrapar estos trucos, ConceptSMILE juega al "¿Qué pasaría si...?":

  1. La configuración: Toman una foto de un ojo y le preguntan a la IA: "¿Qué ves?".
  2. El giro: Alteran la foto secretamente. Cubren partes de la imagen (como poner un parche negro sobre un vaso sanguíneo) o añaden cosas falsas (como un sello de fecha o un logotipo).
  3. La prueba: Le preguntan a la IA de nuevo: "Bien, ahora que cubriste el vaso sanguíneo, ¿sigues pensando que está ahí?".
    • Si la IA dice: "Oh, ¿cubriste eso? Entonces ya no lo veo", eso es bueno. Significa que la IA realmente estaba mirando el vaso.
    • Si la IA dice: "¡Sigo viendo el vaso!", a pesar de que está cubierto, eso es malo. Significa que la IA estaba adivinando o mirando algo completamente distinto.

Los dos contendientes: El "Creador de mapas" vs. El "Narrador"

Para probar su idea, los autores organizan un enfrentamiento entre dos formas diferentes de obtener explicaciones de las fotos de ojos:

  1. El Creador de mapas (MedSAM): Esta IA dibuja un mapa. Recorta los vasos sanguíneos y el disco óptico como un rompecabezas. Es muy buena sabiendo dónde están las cosas.
  2. El Narrador (VLM): Esta IA mira la foto y escribe una frase describiendo lo que ve. Es excelente usando el lenguaje, pero puede ser un poco imprecisa en la ubicación exacta.

Los autores someten a ambos al "test de tortura" de ConceptSMILE utilizando 40 imágenes de retina de cuatro conjuntos de datos públicos diferentes (HRF, APTOS, ODIR e IDRiD).

Lo que encontraron (El marcador)

Los resultados fueron una mezcla de "Vaya, eso es genial" y "¡Cuidado!".

  • El Creador de mapas (MedSAM) gana en precisión: Cuando se trataba de señalar exactamente dónde estaban las cosas, el Cector de mapas fue el campeón. Logró una puntuación muy alta en cuanto a qué tan bien su lógica interna coincidía con los cambios en la foto. Específicamente, para los conceptos de "vaso sanguíneo" y "disco óptico", tuvo una fidelidad de sustitución (una medida de qué tan bien un modelo simple podía predecir su comportamiento) de R² = 0.8503 y R²w = 0.8465. Esto sugiere que cuando el Creador de mapas dice que ve un vaso, generalmente está mirando directamente al vaso.
  • El Narrador (VLM) gana en "fidelidad" para los vasos: Sorprendentemente, el Narrador fue en realidad mejor siendo "fiel" cuando se trataba de vasos sanguíneos. Esto significa que cuando los investigadores alteraron la parte del vaso en la imagen, la respuesta del Narrador cambió de una manera muy consistente y lógica en los cuatro conjuntos de datos. Sus puntuaciones de correlación (una medida de fidelidad) oscilaron entre r = 0.5794 y r = 0.7133, lo cual fue estadísticamente significativo.
  • La sorpresa de la "Estabilidad": Los autores probaron qué sucede si se añade una fecha falsa o un logotipo de un hospital a la foto.
    • El Creador de mapas fue súper estable al observar el disco óptico (el centro del ojo). Incluso con un logotipo falso, seguía viendo el disco correctamente el 98% de las veces en algunos conjuntos de datos.
    • El Narrador fue sorprendentemente estable al hablar de lesiones (manchas en el ojo). Mantuvo la calma incluso con fechas falsas añadidas, obteniendo una puntuación de 1.00 (estabilidad perfecta) en algunos conjuntos de datos.

El problema: No es una solución mágica

El artículo es muy cuidadoso al no decir que este es un problema resuelto. Los autores declaran explícitamente que ningún método fue el ganador en todas las categorías.

  • A veces, el Creador de mapas era excelente encontrando vasos pero inestable con las lesiones.
  • A veces, el Narrador era excelente siendo consistente pero malo localizando ubicaciones.
  • La "confiabilidad" de una explicación depende enteramente de qué concepto se esté tratando y de qué conjunto de datos se esté utilizando.

Los autores también señalan que su prueba fue una "prueba de concepto" utilizando un conjunto limitado de imágenes (10 de cada uno de los 4 conjuntos de datos). Aún no han probado esto en miles de pacientes o en un hospital real. También admiten que su método de "cubrir" partes de la imagen (enmascaramiento) es un poco artificial y podría no imitar perfectamente las enfermedades oculares del mundo real.

La conclusión

ConceptSMILE no nos dice qué IA es "la mejor". En cambio, nos entrega una boleta de calificaciones que muestra exactamente dónde es fuerte cada IA y dónde podría estar engañándonos.

La idea principal es simple: Solo porque una IA hable nuestro idioma no significa que nos entienda. Tienes que pincharla, provocarla y ver cómo reacciona antes de confiar en su diagnóstico. Los autores sugieren que en campos de alto riesgo como la medicina, necesitamos este tipo de "capa de auditoría" para asegurarnos de que la IA no esté simplemente inventando cosas, incluso si las cosas que inventa suenan muy convincentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →