← Últimos artículos
💬 NLP

ADAG: Automatically Describing Attribution Graphs

El artículo presenta ADAG, una pipeline automatizada que utiliza perfiles de atribución, un algoritmo de agrupación novedoso y un simulador de LLM para describir sin intervención humana los roles funcionales de las características en los gráficos de atribución de circuitos de modelos de lenguaje, logrando recuperar circuitos interpretables y detectar grupos responsables de jailbreaks.

Autores originales: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

Publicado 2026-04-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que una Inteligencia Artificial (IA) es como un gigantesco cerebro digital lleno de miles de millones de neuronas pequeñas. Cuando la IA responde a una pregunta, no es magia; es un proceso complejo donde ciertas "neuronas" se encienden y se comunican entre sí para formar la respuesta.

El problema es que este cerebro es una "caja negra". Sabemos qué entra (la pregunta) y qué sale (la respuesta), pero no entendemos cómo piensa ni por qué a veces da consejos peligrosos o absurdos.

Aquí es donde entra el paper que presentas, llamado ADAG. Vamos a explicarlo con una analogía sencilla: La investigación de un crimen en una fábrica de respuestas.

1. El Problema: Investigar a mano es lento y difícil

Antes de ADAG, si querías entender por qué una IA decía algo, tenías que ser un detective humano muy exhaustivo. Tenías que revisar manualmente miles de ejemplos de datos, mirar qué neuronas se activaban y tratar de adivinar qué significaban. Era como intentar entender cómo funciona un motor de coche desmontándolo pieza por pieza con las manos, sin un manual.

2. La Solución: ADAG (El Detective Robot)

ADAG es un sistema automático que hace todo el trabajo de detective por ti. No necesita humanos mirando cada pieza. Funciona en cuatro pasos, como una línea de montaje de investigación:

Paso 1: El Mapa de la Culpa (Rastreo de Circuitos)

Imagina que la IA es una fábrica. Cuando sale una respuesta, ADAG mira hacia atrás y traza un mapa de quién hizo qué.

  • Usa una técnica llamada "atribución" (como una huella digital de energía) para ver qué neuronas contribuyeron más a la respuesta final.
  • Analogía: Es como poner cámaras en una fábrica de galletas y ver exactamente qué robot mezcló la harina, cuál añadió el chocolate y cuál horneó la galleta. ADAG crea un "grafo de atribución", que es un mapa de quién es el culpable (o el héroe) de la respuesta.

Paso 2: La Ficha de Identidad (Perfiles de Atribución)

Una vez que tiene el mapa, ADAG no solo mira la neurona, sino que le hace una ficha de identidad completa.

  • Mira qué la activó (¿fue la palabra "Dallas"? ¿Fue la palabra "capital"?).
  • Mira qué efecto tuvo en el futuro (¿Hizo que la IA dijera "Texas" o "Oklahoma"?).
  • Analogía: Es como si a cada trabajador de la fábrica le hicieran una entrevista: "¿Qué te hizo levantarte de la silla? ¿Y qué pasó en la línea de producción después de que tú hiciste tu trabajo?".

Paso 3: El Agrupamiento Inteligente (Clustering)

Aquí viene la magia. En lugar de tener 10,000 fichas sueltas, ADAG usa un algoritmo para agrupar a las neuronas que piensan igual.

  • Si un grupo de neuronas siempre se activa cuando se habla de "ciudades de Texas" y otra neurona siempre se activa cuando se habla de "ciudades de California", las separa.
  • Analogía: Imagina que tienes una caja llena de miles de piezas de LEGO de colores mezclados. ADAG es un robot que, en segundos, separa todas las piezas rojas en una caja, las azules en otra, y las verdes en otra, basándose en cómo se parecen entre sí. A estos grupos los llama "supernodos".

Paso 4: El Traductor (Descripción Automática)

Ahora tenemos grupos de neuronas, pero siguen siendo números y códigos. ADAG usa otra Inteligencia Artificial (un modelo de lenguaje) para traducir lo que hace cada grupo al lenguaje humano.

  • Le dice al traductor: "Mira este grupo de 20 neuronas. Aquí está lo que activó y aquí está lo que produjo. ¿Qué le dirías a un humano sobre qué hacen?".
  • Analogía: Es como tener un traductor que ve un grupo de obreros trabajando juntos y dice: "Ah, este grupo es el Equipo de Seguridad que evita que se caigan cosas" o "Este es el Equipo de Creatividad que añade decoraciones".

¿Qué descubrieron con esto?

El paper muestra dos cosas increíbles:

  1. Replicaron un hallazgo humano: En un ejercicio de geografía (preguntar por la capital de un estado), ADAG descubrió automáticamente los mismos grupos de neuronas que los humanos habían encontrado manualmente antes, pero mucho más rápido y sin cansarse.
  2. Descubrieron un "Jailbreak" (Hackeo) peligroso: Usaron ADAG en un modelo llamado Llama 3.1 para ver por qué a veces daba consejos médicos peligrosos (como "toma todas las pastillas a la vez").
    • El hallazgo: ADAG encontró grupos específicos de neuronas que actuaban como "disparadores".
    • La prueba: Cuando los investigadores "apagaron" (silenciaron) un grupo específico de neuronas que ADAG etiquetó como "redirección de seguridad", la IA dejó de dar consejos peligrosos. Cuando "encendieron" otro grupo, la IA se volvió más peligrosa.
    • Significado: Esto demuestra que podemos encontrar y controlar el comportamiento peligroso de la IA sin necesidad de entender todo el cerebro, solo encontrando los "interruptores" específicos.

En resumen

ADAG es como un traductor automático de pensamientos de la IA.

  • Antes: "¿Por qué dijo eso? No lo sé, déjame revisar mil páginas de datos..." (Lento, difícil).
  • Ahora con ADAG: "¡Hola! La IA dijo eso porque el Grupo de Neuronas 44 (que se preocupa por las ciudades de Texas) se activó, y el Grupo 59 (que evita respuestas directas) se apagó. Si queremos que sea más segura, debemos apagar el Grupo 9."

El objetivo final es que, a medida que las IAs crezcan y se vuelvan más complejas, tengamos una herramienta automática que nos permita entenderlas, auditarlas y asegurarlas, sin tener que ser genios matemáticos para leer sus cerebros.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →