Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims
Este artículo sostiene que la investigación sobre interpretabilidad mecanicista con frecuencia confunde las métricas de validación con la identificación causal al no establecer explícitamente los supuestos necesarios, y propone una nueva norma de divulgación que exige que los autores articulen claramente sus estrategias de identificación y la robustez de sus afirmaciones causales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que eres un detective tratando de averiguar por qué una máquina compleja (una IA) hace lo que hace. Sospechas que un engranaje específico (un "circuito" o una "característica") es la causa de una acción específica. Sacas ese engranaje y la máquina deja de funcionar. Declaras: "¡Ajá! ¡Ese engranaje era la causa!".
Este artículo argumenta que en el campo de la "interpretabilidad mecánica" de la IA, los investigadores hacen estas declaraciones con demasiada frecuencia sin seguir las reglas de la evidencia. Están afirmando haber encontrado la causa, pero no han explicado por qué su experimento demuestra que es la causa y no simplemente una coincidencia.
Aquí está el desglose del argumento del artículo utilizando analogías simples:
1. El problema central: "Validación" no es "Identificación"
El artículo hace una distinción crucial entre dos cosas:
- Validación (El "Qué"): "Sacé el engranaje y la máquina dejó de funcionar". Esto es un hecho. Es una prueba exitosa.
- Identificación (El "Por qué"): "Sé con certeza que solo ese engranaje causó que la máquina dejara de funcionar, y no algún engranaje de respaldo oculto o un efecto secundario de mi extracción".
La analogía:
Imagina que eres un médico. Le das una pastilla a un paciente y su fiebre baja.
- Validación: "La fiebre bajó después de la pastilla". (Esto es cierto).
- Identificación: "La pastilla causó que la fiebre bajara". (Esto requiere suposiciones).
Quizás la fiebre bajó porque era la hora del día en que la fiebre naturalmente cede. Quizás el paciente bebió agua al mismo tiempo. Quizás la pastilla no funcionó, pero la fiebre se estaba yendo de todos modos.
En la investigación de IA, los artículos a menudo dicen: "Cambiamos esta parte de la IA y el comportamiento cambió, por lo que esta parte es la causa". El artículo argumenta que están saltándose el paso de probar que ninguna otra explicación podría haber causado ese cambio. Están tratando el "bajar de la fiebre" (validación) como prueba de que "la pastilla funcionó" (identificación) sin verificar si el paciente tenía un ciclo natural de fiebre.
2. La trampa de las "Suposiciones Ocultas"
Cada vez que un investigador afirma haber encontrado una causa, se apoya en un conjunto de suposiciones invisibles. El artículo dice que estas suposiciones están actualmente ocultas.
La analogía:
Imagina que un mago afirma: "Hice desaparecer al conejo porque agité mi varita".
- La suposición oculta: "El conejo no saltó por la puerta trasera".
- La suposición oculta: "El conejo no ya se había ido antes de que agitara la varita".
En los artículos de IA, los "trucos de magia" son cosas como:
- Parcheo de Activación: "Intercambiamos esta parte del cerebro de la IA. El comportamiento cambió".
- Suposición oculta: "No despertamos accidentalmente un sistema de respaldo dormido que también hace este trabajo".
- Autoencoders Escasos (SAE): "Encontramos una 'característica' específica en la IA que representa el concepto de 'honestidad'".
- Suposición oculta: "Esta característica es un bloque de construcción único e independiente, no simplemente una mezcla desordenada de otras cosas que casualmente parecen 'honestidad'".
El artículo audita 10 artículos principales (y revisa 30 más) y descubre que cero de ellos tienen una sección dedicada donde enumeran estas suposiciones ocultas. Solo muestran el truco de magia (el resultado) y dicen "¡Mira, funciona!" sin admitir qué reglas están asumiendo que sigue el universo.
3. El error de "Sustitución"
El artículo llama al hábito actual "Sustitución de Métricas de Validación".
La analogía:
Imagina que un mecánico de coches dice: "Arreglé tu motor porque el coche arrancó".
- El error: El mecánico está sustituyendo el resultado (el coche arrancó) por la prueba (sé exactamente qué parte arreglé y que nada más podría haber hecho arrancar el coche).
- La realidad: El coche podría haber arrancado porque la batería se recargó sola, o porque el mecánico golpeó la llave, o porque el motor estaba bien todo el tiempo.
En los artículos de IA, los investigadores informan métricas como "fidelidad" (¿coincide la explicación con el modelo?) o "completitud" (¿encontramos todas las partes?). El artículo argumenta que estas son solo momentos de "el coche arrancó". Son buenos de tener, pero no son prueba de causalidad a menos que se declaren las suposiciones que las convierten en prueba.
4. La solución propuesta: El "Protocolo de Divulgación"
El autor sugiere que el campo debería tomar prestada una regla de la Econometría (el estudio de datos económicos). En economía, si afirmas que "X causa Y", debes declarar explícitamente:
- Lo que estás afirmando: "Afirmamos que X causa Y".
- La estrategia: "Estamos utilizando el método Z para probarlo".
- Las suposiciones: "Asumimos que [Condición A] y [Condición B] son verdaderas".
- La prueba de estrés: "Si [Condición A] es falsa, nuestra conclusión se desmorona. Aquí mostramos cómo probamos si es verdadera".
La analogía:
En lugar de decir simplemente "la pastilla funcionó", el médico debe escribir un informe:
- "Afirmamos que la pastilla bajó la fiebre".
- "Asumimos que el paciente no tomó otros medicamentos".
- "Asumimos que la fiebre no estaba terminando naturalmente".
- "Si el paciente sí tomó otros medicamentos, nuestra conclusión es incorrecta. Aquí están los datos que muestran que no lo hizo".
5. Lo que encontró la auditoría
El autor examinó 10 artículos clave en el campo (que cubren diferentes métodos como el descubrimiento de circuitos y autoencoders) y luego revisó 30 más.
- Resultado: 0 de 30 artículos tenían una sección dedicada que enumeraba sus suposiciones de identificación.
- Resultado: La mayoría de los artículos (aproximadamente de 19 a 26 de 30, dependiendo de lo estricto que seas) utilizaron "métricas de validación" (como "la IA se comportó como se esperaba") como sustituto de probar que sus suposiciones eran verdaderas.
- Resultado: Incluso los artículos más cuidadosos, que encontraron errores en el trabajo de otros, no enumeraron explícitamente las suposiciones que estaban utilizando para encontrar esos errores.
Resumen
El artículo es un llamado a la honestidad y la claridad. No dice que la investigación de IA esté mal; dice que la investigación de IA está incompleta.
Actualmente, los investigadores dicen: "¡Mira, encontramos la causa!".
El artículo dice: "Por favor, detente y cuéntanos qué reglas estás asumiendo para hacer esa afirmación. Si no nos dices las reglas, no sabemos si tu 'causa' es real o solo una adivinanza afortunada".
Le está pidiendo al campo pasar de "Mira lo genial que es nuestro truco de magia" a "Aquí está exactamente cómo funciona el truco, y aquí está por qué sabemos que no es un truco".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.