← Últimos artículos
🤖 AI

Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation

Este estudio preregistrado demuestra que la evidencia de interpretabilidad mecánica para la regulación de la IA no cumple con los estándares de auditabilidad debido a que los resultados del descubrimiento de circuitos son altamente inestables y estructuralmente disjuntos a través de variaciones analíticas defendibles, lo que los hace poco fiables para la documentación de cumplimiento.

Autores originales: Ajay Pravin Mahale (Hochschule Trier)

Publicado 2026-08-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ajay Pravin Mahale (Hochschule Trier)

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de explicar un truco de magia a un amigo escéptico. Dices: "El mago no solo agitó una varita; usó una palanca oculta específica debajo del escenario". Pero luego tu amigo pregunta: "¿Cómo sabemos que es esa palanca? ¿Qué pasa si miro bajo una parte diferente del escenario, o uso una linterna diferente, o le pido a un mago diferente que revise?". Si tu explicación cambia completamente dependiendo de cómo busques el secreto, ¿puedes realmente llamarlo un hecho? Este es el corazón de un nuevo estudio en el mundo de la Inteligencia Artificial (IA).

En el campo de la "interpretabilidad mecanicista", los científicos intentan echar un vistazo dentro de los cerebros de la IA (como el famoso modelo GPT-2) para encontrar los "circuitos" específicos —pequeñas redes de conexiones— que hacen que la IA haga lo que hace. Es como intentar mapear el cableado eléctrico exacto en una casa para explicar por qué se encendió una luz. La Unión Europea tiene una nueva ley que dice que, si una IA toma una decisión de alto riesgo (como denegar un préstamo), la empresa debe presentar un informe explicando cómo decidió la IA. La forma obvia de hacer esto es presentar un mapa de los circuitos internos de la IA. Pero este artículo plantea una pregunta difícil: Si dos expertos inteligentes usan la misma IA y las mismas herramientas, pero toman decisiones ligeramente diferentes y razonables sobre cómo buscar los circuitos, ¿encontrarán el mismo mapa? ¿O encontrarán dos historias totalmente diferentes?

El autor de este artículo decidió probar esto configurando un experimento masivo de "elige tu propia aventura". No solo miró a la IA una vez; la miró 15,840 veces diferentes. Creó una cuadrícula de siete formas diferentes de analizar la IA, tomando cada configuración de las herramientas existentes y publicadas. Preguntó: "Si cambiamos la métrica, la semilla, el tamaño del circuito o la forma de probarlo, ¿la historia que contamos sobre el cerebro de la IA sigue siendo la misma?".

La respuesta, desafortunadamente, es un fuerte "No".

Cuando los investigadores ejecutaron su experimento, descubrieron que la evidencia es increíblemente inestable. De todas las formas diferentes en las que podrían haber analizado los datos, la historia que contaron sobre el circuito de la IA cambió a una versión completamente diferente el 73.2% de las veces. Eso significa que si dos auditores miraran la misma IA con las mismas herramientas pero con configuraciones ligeramente diferentes, probablemente presentarían dos informes completamente distintos. Incluso cuando intentaron ser súper estrictos y estandarizar las decisiones más importantes, la tasa de cambio solo bajó al 59.4%.

Para asegurarse de que esto no fuera solo una casualidad, comprobaron si los circuitos que encontraron eran en realidad la misma cosa descrita con palabras diferentes. No lo eran. Los circuitos eran estructuralmente casi totalmente diferentes (compartiendo solo alrededor del 4% de sus partes) y funcionalmente no estaban correlacionados. Es como si un auditor hubiera encontrado un mapa del cableado de la cocina y el otro hubiera encontrado un mapa de la fontanería, y ambos afirmaran: "¡Este es el secreto de cómo funciona la casa!".

El artículo también descubrió que una de las siete herramientas principales que utilizaron para encontrar estos circuitos no funcionó en absoluto en la tarea que estaban probando; colapsó inmediatamente. Además, más de la mitad de las explicaciones potenciales fueron descartadas porque no cumplían con las reglas estrictas de la prueba.

Entonces, ¿qué significa esto para el futuro? El autor no está diciendo que la IA esté rota o que no podamos entenderla. Está diciendo que los "recibos" que tenemos actualmente para demostrar cómo funciona la IA no están listos para ser presentados ante un regulador gubernamental. Si le entregas a un juez un mapa de circuitos hoy, y un segundo juez usa las mismas herramientas pero un método ligeramente diferente, podría descartar tu mapa y decir: "Esta no es la explicación correcta". La evidencia, tal como está ahora mismo, no pasa la prueba de ser lo suficientemente confiable como para ser un documento legal. El estudio sugiere que, antes de que podamos confiar estas explicaciones de IA en un tribunal o en controles de seguridad, necesitamos descubrir cómo hacer que los mapas sean estables, sin importar quién sostenga la linterna.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →