← Últimos artículos
💬 NLP

Automated Interpretability and Feature Discovery in Language Models with Agents

Este artículo presenta un marco autónomo de múltiples agentes que automatiza la interpretabilidad mecanicista mediante el refinamiento iterativo de hipótesis y el descubrimiento de características internas en modelos de lenguaje grandes, demostrando un rendimiento superior al de los métodos de un solo intento en la generación de explicaciones más precisas, falsables y auditables.

Autores originales: Arnau Marin-Llobet, Javier Ferrando

Publicado 2026-05-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Arnau Marin-Llobet, Javier Ferrando

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una máquina gigante e increíblemente compleja (un Modelo de Lenguaje Grande) que escribe historias, responde preguntas y resuelve problemas. Dentro de esta máquina, hay miles de millones de interruptores y engranajes diminutos (neuronas y características) trabajando juntos. El problema es que no tenemos un manual. Podemos ver cómo funciona la máquina, pero no sabemos exactamente qué hace cada engranaje individual.

Durante mucho tiempo, los investigadores intentaron descifrar esto observando un engranaje, adivinando qué hace y anotando una etiqueta como "este engranaje es para matemáticas". Pero a menudo, esa suposición era incorrecta, demasiado vaga o se desmoronaba en cuanto se probaba con un ejemplo ligeramente diferente. Era como intentar adivinar la función de una pieza de un coche simplemente mirándola una vez.

Este artículo introduce un nuevo sistema llamado InterpAgent. En lugar de que un humano haga una sola suposición, InterpAgent es como un equipo de detectives robóticos que trabajan juntos para resolver el misterio de lo que realmente hacen los engranajes de la máquina.

Así es como lo hacen, usando analogías simples:

Los Dos Equipos de Detectives

El sistema utiliza dos agentes robóticos especializados que conversan entre sí:

  1. El "Buscador de Características" (El Explorador):
    Imagina que quieres encontrar todos los engranajes responsables del "idioma español". El Explorador no sabe cuál es ese engranaje. Así que entra en el "espacio de activación" de la máquina (un mapa de cómo se iluminan los engranajes) y busca patrones. Utiliza un mapa estadístico (como un GPS) para encontrar grupos de engranajes que se iluminan juntos cuando se usan palabras en español. No solo adivina; utiliza matemáticas para encontrar los engranajes que confiablemente separan las indicaciones en español de las en inglés.

    • La Analogía: Es como un detective escaneando una multitud para encontrar a la única persona que lleva un sombrero rojo y que solo aparece en fiestas francesas.
  2. El "Explicador de Características" (El Interrogador):
    Una vez que el Explorador encuentra un engranaje candidato, el Interrogador toma el relevo. Su trabajo no es solo nombrar el engranaje; es someter a prueba de estrés el nombre.

    • La Vieja Forma: Un humano podría decir: "Este engranaje es para 'tecnología'".
    • La Forma de InterpAgent: El Interrogador dice: "Vale, piensas que es para 'tecnología'? Probemos eso". Genera 12 ejemplos que deberían activar el engranaje (como "arreglar una computadora") y 12 ejemplos que no deberían (como "cocinar pasta"). Los ejecuta a través de la máquina.
    • El Giro: Si el engranaje se ilumina para "cocinar pasta", el Interrogador sabe que la etiqueta "tecnología" es incorrecta. Entonces reescribe la hipótesis: "¿Quizás es para 'arreglar cosas'?". Repite este proceso, generando nuevas pruebas, verificando los resultados y refinando la etiqueta hasta encontrar una descripción que resista la presión.

El "Bucle" de Descubrimiento

El artículo enfatiza que esto no es un evento único. Es un bucle.

  • Paso 1: El Explorador encuentra un engranaje potencial.
  • Paso 2: El Interrogador adivina qué hace.
  • Paso 3: El Interrogador intenta romper su propia suposición encontrando contraejemplos (cosas que deberían activar el engranaje pero no lo hacen, o cosas que no deberían pero sí lo hacen).
  • Paso 4: El Interrogador actualiza la suposición basándose en el fallo.
  • Paso 5: Repetir hasta que la suposición sea sólida.

Esto es como un científico que realiza un experimento una y otra vez. Si tu teoría es "Este botón enciende las luces", pero lo presionas y se enciende la radio, no solo dices "ay". Cambias tu teoría a "Este botón controla la energía" y la vuelves a probar.

Lo Que Encontraron

Los autores probaron esto en la familia de modelos Gemma-2 (un tipo de IA). Esto es lo que sucedió:

  • Mejores Etiquetas: El equipo robótico fue mucho mejor etiquetando características que el antiguo método de "un solo intento". El método antiguo a menudo daba respuestas vagas como "conocimiento". El equipo robótico encontró respuestas específicas y estrechas como "fraseo informal en francés en contextos de resolución de problemas técnicos".
  • Encontrando lo Desconocido: El sistema no solo explicó engranajes que los investigadores ya conocían. El Explorador encontró nuevos engranajes que los humanos no habían notado, como neuronas específicas que se activan solo para "contenido dañino" (como explosivos) o patrones de codificación específicos.
  • Verificación de Seguridad: En un estudio de caso, encontraron un engranaje relacionado con rechazar solicitudes peligrosas. Pudieron "dirigir" la máquina reduciendo ese engranaje, y la máquina dejó de rechazar la solicitud. Esto demostró que el engranaje estaba realmente causando el comportamiento de seguridad, no solo observándolo ocurrir.
  • Polisemia: A veces, los robots descubrieron que un solo engranaje estaba haciendo dos cosas muy diferentes a la vez (como un engranaje que maneja tanto "ecuaciones matemáticas" como "términos médicos"). El sistema es lo suficientemente inteligente como para decir: "Este engranaje es confuso; está haciendo dos trabajos", en lugar de forzar una sola etiqueta incorrecta.

La Conclusión

El artículo afirma que al tratar la interpretación de la IA como un experimento iterativo (adivinar, probar, fallar, corregir) en lugar de una etiqueta estática (mirar, adivinar, anotar), obtenemos explicaciones mucho más precisas y fiables.

El sistema produce un "rastro documental" de cada suposición, cada prueba y cada fallo, haciendo que el proceso sea transparente. Muestra que si permites que un agente de IA actúe como un científico riguroso, intentando constantemente probar que sus propias ideas son incorrectas, obtienes una imagen mucho más clara de cómo funciona realmente el cerebro de la máquina.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →