← Últimos artículos
🤖 AI

CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models

Este artículo presenta CARD, un método de diagnóstico que revela que los modelos de visión y lenguaje fallan al enrutar eficazmente las representaciones de creencias internas hacia sus predicciones de acción, una limitación identificada a través de un nuevo benchmark cooperativo de mundo de cuadrícula llamado Relay Chain.

Autores originales: Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

Publicado 2026-08-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el creciente campo de la inteligencia artificial, los investigadores están cada vez más interesados en si las máquinas pueden comprender la mente de los demás. Esta capacidad, conocida como "teoría de la mente", permite que una persona infiera lo que otra persona ve, sabe o quiere, incluso cuando esa información está oculta de su propia vista. Es el pegamento mental que hace posible la cooperación, permitiéndonos predecir el siguiente movimiento de un compañero basándonos en su perspectiva en lugar de solo en la nuestra. A medida que los sistemas de inteligencia artificial se despliegan para trabajar junto a los humanos —como asistentes robóticos, copilotos de conducción o miembros de un equipo—, los científicos necesitan saber si estos sistemas poseen esta misma capacidad. Si una IA no puede comprender verdaderamente lo que su compañero sabe, no podrá cooperar de manera efectiva, sin importar cuán inteligente parezca en otros aspectos.

Para investigar esto, un equipo de investigadores de la Universidad de Stuttgart desarrolló una nueva forma de mirar dentro del "cerebro" de los modelos modernos de visión y lenguaje. Estos son programas informáticos avanzados que pueden ver imágenes y comprender el lenguaje simultáneamente. Los investigadores querían saber si estos modelos realmente utilizan su comprensión interna del estado mental de un compañero al decidir qué acción tomar a continuación. Crearon un nuevo entorno de prueba llamado Relay Chain, un juego cooperativo jugado en una cuadrícula digital. En este juego, dos agentes sostienen palancas que abren puertas para que un tercer agente pase. El éxito depende enteramente de que los agentes sepan si su compañero puede ver al viajero cruzando. Si un agente no puede ver el cruce, debe mantener la palanca; si puede ver el cruce, debe soltar la palanca. Esta configuración obliga a la IA a tomar decisiones basadas en lo que cree que su compañero ve, en lugar de basarse solo en lo que está sucediendo en el mundo.

Los investigadores utilizaron una técnica llamada dirección de activación (activation steering) para sondear los modelos. Imagine los pensamientos internos de la IA como un vasto paisaje de señales. El equipo identificó señales específicas que representaban la "creencia": el registro interno de la IA sobre lo que su compañero ve. Luego, fortalecieron o debilitaron artificialmente estas señales de creencia mientras la IA jugaba el juego, esencialmente dando un empujón al estado interno del modelo para que estuviera más o menos seguro de la visión de su compañero. Si la IA estuviera usando realmente su comprensión de la mente del compañero para tomar decisiones, cambiar esa creencia interna debería cambiar la acción que la IA elige. Por ejemplo, si el modelo fuera impulsado a creer que el compañero podía ver al viajero, debería soltar la palanca. Si fuera impulsado a creer que el compañero no podía ver, debería mantenerla.

Los resultados revelaron un fallo crítico en cómo funcionan estos modelos. Los experimentos mostraron que los modelos sí poseían una representación clara y legible de la creencia del compañero. Cuando se les preguntaba directamente: "¿Ve tu compañero al viajero?", los modelos respondían correctamente, y los investigadores incluso pudieron cambiar la respuesta cambiando las señales internas. Sin embargo, cuando se les pedía realizar la acción cooperativa —decidir si soltar la palanca o mantenerla—, sus señales de creencia interna eran completamente ignoradas. Incluso cuando los investigadores alteraron a la fuerza la creencia interna del modelo sobre lo que el compañero veía, la decisión del modelo sobre qué hacer permaneció exactamente igual. Actuaba como si tuviera una memoria perfecta de la visión del compañero, pero simplemente elegía no usar esa memoria al realizar un movimiento.

Este desajuste fue consistente en cuatro tipos diferentes de modelos de código abierto probados, que iban desde sistemas más pequeños hasta más grandes. Los modelos no estaban fallando porque carecieran de la información; estaban fallando porque no estaban dirigiendo esa información a la parte del sistema que decide las acciones. Los investigadores descartaron otras posibilidades, como que los modelos estuvieran confundidos por la redacción de las preguntas o que el método de dirección fuera demasiado débil para registrarse. Probaron docenas de formas diferentes de redactar las instrucciones y descubrieron que ninguna cantidad de prompts podía obligar a los modelos a usar sus creencias internas para guiar sus acciones. Los modelos eran efectivamente "ciegos" a su propio conocimiento cuando se trataba de dar un paso.

El estudio concluye que, si bien estos sistemas de inteligencia artificial pueden ser entrenados para describir el estado mental de un compañero, no conectan automáticamente esa descripción con su propio comportamiento. Pueden hablar sobre lo que alguien más sabe, pero no utilizan ese conocimiento para decidir qué hacer. Esto sugiere que enseñar a un modelo a responder preguntas sobre creencias no es suficiente para crear un agente verdaderamente cooperativo. Para que la IA trabaje de manera fluida con los humanos, la comprensión interna de los demás debe estar conectada directamente con el proceso de toma de decisiones, una conexión que los modelos actuales parecen carecer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →