← Últimos artículos
🤖 machine learning

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

GroundBench es un benchmark contrafáctico y factorizado diseñado para aislar y diagnosticar las causas específicas de los fallos de asequibilidad en los modelos de visión y lenguaje, demostrando que muchos éxitos de localización aparentes están en realidad impulsados por asociaciones de categoría a acción en lugar de un razonamiento visual o mecánico genuino.

Autores originales: Sarthak Sattigeri

Publicado 2026-09-15
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Sarthak Sattigeri

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un brazo robótico alcanzando una taza de café. Para tener éxito, la máquina debe resolver tres acertijos distintos a la vez: debe decidir qué parte de la taza importa (el asa, no el borde), localizar exactamente dónde está esa parte en el mundo visual y comprender qué acción invita esa parte (agarrar, no empujar). Durante años, los investigadores han probado los sistemas de inteligencia artificial en estas tareas pidiéndoles que describan qué debería hacer un robot con un objeto. Un estudio complementario reciente sugirió que, si simplemente se le dice a la IA el nombre de la parte objetivo —diciendo "agarra el asa" en lugar de solo "agarra la taza"—, el rendimiento del sistema aumenta drásticamente. Esto llevó a una conclusión esperanzadora: la IA finalmente estaba aprendiendo a mirar la imagen y a razonar sobre la mecánica física del objeto.

Sin embargo, una nueva investigación llamada GroundBench sugiere que esta conclusión podría ser prematura. Los investigadores detrás de este estudio, liderados por Sattigeri en la Universidad de Manipal Jaipur, sospechaban que la IA no estaba realmente aprendiendo a ver mejor el objeto. En su lugar, hipotetizaron que el sistema podría estar recurriendo a un atajo: simplemente memorizar que ciertas palabras, como "asa", casi siempre se emparejan con la acción "agarrar", independientemente de lo que muestre la imagen real. Para probar esto, construyeron un nuevo y riguroso benchmark diseñado para separar la capacidad de encontrar una parte en una imagen de la capacidad de adivinar una acción basada en una palabra. No se limitaron a pedirle a la IA que realizara una tarea; despojaron sistemáticamente la información, pieza por pieza, para ver qué pista específica estaba impulsando realmente el éxito.

Los investigadores construyeron una serie de seis escenarios diferentes, o condiciones, para probar tres versiones distintas de un modelo de inteligencia artificial líder. En el primer escenario, la IA vio solo la imagen de un objeto, como un teclado o una puerta, sin instrucciones de texto. En el segundo, añadieron el nombre del objeto, como "teclado". En el tercero, nombraron la parte específica, como "la barra espaciadora". En el cuarto, proporcionaron la ubicación exacta de la parte en la pantalla —un punto específico y un recuadro alrededor de ella— pero omitieron deliberadamente el nombre de la parte. En el quinto, dieron tanto el nombre como la ubicación. Finalmente, en el sexto, añadieron detalles técnicos sobre cómo se mueve el objeto, como si una articulación es una bisagra o un deslizador.

Los resultados fueron sorprendentes y contraintuitivos. Cuando los investigadores dieron a la IA la ubicación exacta de la parte objetivo pero se negaron a decirle cómo se llamaba la parte, el rendimiento del sistema colapsó. A través de los tres modelos probados, la precisión para elegir la acción correcta cayó al nivel de un simple azar, o incluso menos. Un modelo, al recibir la ubicación de un botón pero no su nombre, obtuvo solo 0.26, mientras que una línea base simple que ignoraba la imagen por completo obtuvo 0.53. La IA podía reproducir perfectamente la ubicación que se le mostró, colocando su "dedo" exactamente donde los investigadores señalaban, pero no lograba comprender qué hacer con esa ubicación. Era como si el robot pudiera ver el botón, pero no tuviera idea de que los botones están hechos para ser presionados.

En marcado contraste, cuando los investigadores le dieron a la IA el nombre de la parte pero ocultaron su ubicación, el rendimiento se disparó. Los mismos modelos que fallaron con datos de solo ubicación saltaron a tasas de precisión entre 0.68 y 0.74 cuando se les dijo que la parte era un "botón" o una "puerta", incluso sin ver dónde estaba. Este patrón se mantuvo en todos los casos: en el momento en que la IA recibía el nombre de la categoría de la parte, casi siempre podía adivinar la acción correcta. Los investigadores descubrieron que, en su conjunto de objetos cuidadosamente curado, el nombre de la parte por sí solo era suficiente para determinar la respuesta. La IA no estaba mirando la imagen para entender la física; estaba leyendo la palabra y recordando una asociación previamente aprendida.

Para confirmar esta sospecha, los investigadores realizaron una prueba de control donde eliminaron la imagen por completo y pidieron a los modelos que respondieran basándose solo en el texto. Para el modelo más avanzado probado, eliminar la imagen no supuso ninguna diferencia en su rendimiento en las condiciones donde se proporcionaba el nombre de la parte. El modelo obtuvo un puntaje igual, o incluso ligeramente mejor, sin ver el objeto. Esto proporcionó una fuerte evidencia de que el sistema no estaba utilizando la fundamentación visual —el proceso de conectar palabras con píxeles específicos en una imagen— sino que, en su lugar, dependía de un atajo basado en texto. La IA sabía que "bisagra puerta" implica "tirar" y "deslizador botón" implica "empujar" porque había visto esas parejas en sus datos de entrenamiento, no porque entendiera la mecánica de la puerta o el botón específicos frente a ella.

El estudio también probó si la IA podía seguir una pregunta capciosa. Los investigadores tomaron la imagen de un objeto con múltiples partes, como un teclado con muchas teclas, y le pidieron a la IA que realizara una acción en una parte no estándar, como una tecla específica que se usaba raramente. Querían ver si la IA realmente miraría esa tecla específica o si recurriría a la acción más común para el objeto completo. Aunque los modelos generalmente seguían la nueva instrucción, tuvieron dificultades significativas cuando la acción solicitada era inusual, como levantar una parte verticalmente. En esos casos, los modelos a menudo volvían a la acción estándar, lo que sugiere que todavía se apoyaban en sus asociaciones más comunes en lugar de analizar verdaderamente la escena visual.

Quizás el hallazgo más sorprendente fue que añadir más información no siempre ayudaba. Cuando los investigadores dieron a la IA la ubicación y el nombre de la parte, y luego añadieron descripciones mecánicas detalladas sobre cómo se movía el objeto, el rendimiento en realidad bajó. Los modelos no mejoraron; se volvieron menos precisos. Esto sugiere que la información adicional confundió al sistema o lo distrajo del atajo simple y efectivo de usar solo el nombre de la parte. Los investigadores concluyeron que, para estas tareas específicas, más datos no equivalían a un mejor razonamiento.

Las implicaciones de este trabajo son significativas para el campo de la robótica y la inteligencia artificial. Revelan que los puntajes altos en ciertas pruebas pueden ser engañosos. Una IA puede parecer una maestra del razonamiento físico cuando en realidad es solo una maestra de las asociaciones de palabras. Los investigadores encontraron que la mejora dramática observada en estudios anteriores, donde nombrar una parte aumentaba la precisión por un margen considerable, probablemente no se debió a que la IA de repente aprendiera a ver mejor. En cambio, fue porque el nombre mismo contenía la respuesta. El estudio no afirma que estos modelos sean incapaces de razonamiento visual, pero sí muestra que, bajo estas condiciones específicas, no lo estaban utilizando.

GroundBench sirve como una herramienta de diagnóstico, una forma de pelar las capas del rendimiento de una IA para ver qué está sucediendo realmente debajo. Al separar la ubicación visual del nombre semántico, los investigadores expusieron una brecha entre lo que los modelos parecían estar haciendo y lo que realmente estaban haciendo. Encontraron que cuando se eliminaba el nombre de la parte, los modelos no podían hallar la acción, incluso cuando la ubicación era perfectamente clara. Esto sugiere que, para estos sistemas, el camino hacia el verdadero razonamiento mecánico es más largo de lo que se pensaba. Aún no han aprendido a mirar un objeto y comprender su función; han aprendido a escuchar una palabra y adivinar la función. El estudio no termina con una declaración de fracaso, sino con un mapa más claro de hacia dónde debe dirigirse el trabajo: construir sistemas que puedan conectar verdaderamente las palabras que escuchan con el mundo físico que ven, en lugar de depender de los atajos que les han servido tan bien hasta ahora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →