← Últimos artículos
💻 computer science

DMDIntel: Interpreting Large Language Models via Dynamic Mode Decomposition

Este artículo presenta DMDIntel, un novedoso marco de interpretabilidad que aprovecha la descomposición de modos dinámicos para descomponer los estados ocultos de los LLM en modos prominentes y clasificar los tokens de entrada, demostrando un rendimiento superior sobre los métodos de atribución del estado del arte como PCA, gradientes integrados y SHAP a través de múltiples conjuntos de datos y familias de modelos.

Autores originales: Amogh Joshi, Animesh Mukherjee, Sergey Utyuzhnikov

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Amogh Joshi, Animesh Mukherjee, Sergey Utyuzhnikov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás viendo a un mago sacar un conejo de un sombrero. Ves el sombrero, ves al conejo, pero la magia ocurre en la fracción de segundo entre los dos, oculta dentro de las mangas del mago. Durante mucho tiempo, la Inteligencia Artificial (IA) ha sido ese mago. Le damos una frase y nos da una respuesta, pero nadie sabe realmente cómo decidió esa respuesta. La IA es una "caja negra", y los científicos están desesperados por mirar dentro para ver qué palabras le importaron realmente a la computadora. Este campo se llama "interpretabilidad". Para entender el nuevo artículo, primero necesitas saber dos cosas: cómo lee texto la IA y cómo intentamos mirar dentro habitualmente.

Los modelos de IA, específicamente los llamados "Modelos de Lenguaje Extensos" (LLM), no leen palabras como nosotros. En su lugar, convierten cada palabra en una larga lista de números (un vector) y las pasan a través de una serie de capas, como una carrera de relevos. En cada capa, los números cambian ligeramente, mezclando el significado de la palabra actual con las palabras que vinieron antes. Al final de la carrera, el modelo tiene un conjunto final de números que deciden la respuesta. Usualmente, para averiguar qué palabras importaron, los científicos usan herramientas que observan el estado "estático" del modelo, como tomar una sola foto de la carrera de relevos y adivinar quién corría más rápido. Pero este artículo sugiere que mirar una sola foto pierde toda la historia. Argumenta que deberíamos ver la película de la carrera, observando cómo evolucionan los números de un paso al siguiente, porque el secreto del pensamiento de la IA está en ese movimiento.

Entra DMDINTEL, un nuevo método introducido por Amogh Joshi y su equipo de el IIT Kharagpur y la Universidad de Manchester. Piensa en el procesamiento interno de la IA no como una lista estática de números, sino como un río que fluye. A medida que la IA lee una oración, el "agua" (la información oculta) ondula y cambia de forma con cada nueva palabra. Los investigadores utilizaron una herramienta matemática llamada Descomposición de Modos Dinámicos (DMD) —inventada originalmente para estudiar cómo el agua se arremolina en la mecánica de fluidos— para mapear estas ondulaciones.

Así es como funciona en la práctica la analogía del "río": Cuando la IA lee una oración, los estados ocultos de las palabras crean un patrón complejo y arremolinado. DMDINTEL descompone este patrón en unos pocos "modos" o formas simples y repetitivas, muy parecido a cómo una onda compleja en el océano puede describirse como una combinación de unas pocas formas de ondas básicas. El equipo descubrió que al observar cómo estas formas crecen, se encogen u oscilan a medida que la IA lee la oración, podían identificar qué palabras eran los "impulsores" de la decisión final. Trataron a la IA como un sistema dinámico, lo que significa que observaron el cambio entre una palabra y la siguiente, en lugar de solo la palabra en sí.

Los investigadores probaron esta idea en tres familias diferentes de modelos de IA (Llama, Qwen y Mistral) y tres tareas diferentes: determinar si una reseña es positiva o negativa, detectar noticias falsas y detectar discursos de odio. Compararon su método de la "película del río" contra los viejos métodos de la "foto estática", que incluyen técnicas como Gradientes Integrados, SHAP y Análisis de Componentes Principales (PCA).

Los resultados sugieren que DMDINTEL es un detective mucho mejor. En sus experimentos, el nuevo método encontró consistentemente las palabras más importantes (la "verdad fundamental" o ground truth) con más frecuencia que los otros métodos. Por ejemplo, cuando la IA decidía si una reseña era negativa, DMDINTEL clasificó correctamente palabras como "basura" y "incapaz" como los principales impulsores, mientras que otros métodos a veces se distraían con palabras menos importantes como "programado" o "conferencia". El artículo muestra que, al observar la evolución de los pensamientos de la IA, DMDINTEL captura mejor la lógica de la oración. Sugiere que el razonamiento de la IA no se trata solo de las palabras permaneciendo quietas; se trata de cómo el significado fluye y se transforma a medida que se construye la oración.

Sin embargo, los autores tienen cuidado en señalar que esto no es una solución mágica para todos los problemas de la IA. Su método funciona mejor cuando la IA solo está leyendo una oración y dando una respuesta simple (como una tarea de clasificación). Admiten que si la IA comienza a escribir una historia larga o a traducir un libro entero palabra por palabra, la matemática se vuelve complicada porque la IA comienza a retroalimentar sus propias palabras nuevas al sistema. Pero para el trabajo específico de explicar por qué una IA etiquetó una oración como "discurso de odio" o "noticia falsa", esta nueva forma de observar la danza de los números sugiere una imagen más clara y precisa de la mente de la máquina.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →