← Últimos artículos
🤖 AI

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

El artículo presenta ROSE, un banco de pruebas controlado que demuestra que los modelos de lenguaje de gran tamaño multimodales sufren una brecha de rendimiento significativa entre el conteo visual y las acciones condicionadas por el contexto, revelando un cuello de botella distintivo al traducir la evidencia visual compartida en comportamientos específicos de la tarea a pesar del alto desempeño humano.

Autores originales: Yihao Wang, Zijian He, Jie Ren, Keze Wang

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yihao Wang, Zijian He, Jie Ren, Keze Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás mirando una cuadrícula gigante de 100 calcomanías idénticas en una pared. De repente, notas que tres de ellas son ligeramente diferentes; tal vez una está al revés, o tiene un pequeño rasguño.

Ahora, imagina que un robot está parado junto a ti. Le haces tres preguntas diferentes sobre esta misma pared:

  1. El Conteo: "¿Cuántas calcomanías raras hay en total?"
  2. La Zona: "¿Cuántas calcomanías raras hay en la esquina superior izquierda?"
  3. La Acción: "Señala con tu dedo cada calcomanía rara en la esquina superior izquierda."

De acuerdo con el artículo ROSE, muchos de los modelos de IA más inteligentes de hoy son excelentes con las dos primeras preguntas, pero terribles con la tercera. Pueden contar las calcomanías extrañas perfectamente, pero cuando se les pide que señalen físicamente las correctas basándose en una regla específica, se confunden y señalan las incorrectas, o señalan calcomanías fuera de la zona.

Aquí tienes un desglose de lo que descubrió el artículo, utilizando analogías sencillas:

1. El Problema: "Lo veo, pero no puedo actuar sobre ello"

Los investigadores llaman a esto la "Brecha de Percepción-a-Acción".

Piensa en una IA como un bibliotecario muy inteligente que puede decirte instantáneamente cuántos libros rojos hay en un estante. Pero si le pides que "Vaya al tercer estante, busque los libros rojos y los saque", podría quedarse paralizado. Sabe qué buscar, pero le cuesta traducir ese conocimiento en una acción específica y precisa bajo un nuevo conjunto de reglas.

El artículo encontró que incluso los mejores modelos de IA (como GPT-5.5 o Gemini) disminuyen significamente su rendimiento al pasar de solo "contar" a "hacer clic en puntos específicos". Algunos modelos perdieron casi un 45% de precisión solo porque la tarea cambió de "decirme el número" a "mostrarme la ubicación".

2. La Prueba: El Juego de la Cuadrícula del "Intruso"

Para demostrar esto, el equipo construyó un benchmark llamado ROSE.

  • La Configuración: Crearon miles de imágenes de cuadrículas llenas de elementos casi idénticos (como caracteres chinos que se ven muy similares, o emojis renderizados en estilos ligeramente diferentes).
  • El Giro: En cada imagen, hay un elemento "mayoría" (el normal) y algunos "excepciones" (los raros).
  • El Desafío: La IA tiene que jugar un juego donde las reglas cambian cada vez, pero la imagen permanece igual.
    • Ronda 1: Cuenta todos los raros.
    • Ronda 2: Cuenta solo los raros que están dentro de un cuadro específico.
    • Ronda 3: Haz clic en los raros dentro de ese cuadro.
    • Ronda 4: Haz clic en los raros que están fuera de ese cuadro.

Es como jugar a "¿Dónde está Waldo?" donde las reglas cambian de "Encuentra a Waldo" a "Encuentra a Waldo solo en la cocina" a "Toca a Waldo en la cocina". La imagen no cambia, pero las instrucciones de la IA sí.

3. Los Resultados: La Brecha de "Contar vs. Hacer Clic"

Los resultados fueron sorprendentes:

  • Humanos: Casi perfectos. Si le mostraras la cuadrícula a un humano y le pidieras que contara, y luego le pidieras que hiciera clic, podría hacer ambas cosas con casi un 100% de precisión.
  • Modelos de IA: Podían contar correctamente (Percepción). Pero cuando se les pedía hacer clic en los puntos específicos (Acción), fallaban a menudo.
    • Ejemplo: Un modelo podría decir correctamente: "Hay 3 calcomanías raras". Pero cuando se le pide que haga clic en las de la esquina superior izquierda, podría hacer clic en 3 calcomanías, incluyendo una que está realmente fuera de la esquina, o podría hacer clic en las 3 equivocadas.

El artículo muestra que saber la respuesta no es lo mismo que ser capaz de ejecutar la respuesta. La IA se queda "atascada" en la imagen global y olvida aplicar la regla local (como el cuadro específico o la zona de exclusión).

4. ¿Por qué sucede esto?

Los investigadores investigaron por qué la IA falla. No es solo que la IA sea mala en matemáticas o que no pueda ver los píxeles.

  • No es un error de formato: La IA no solo está escribiendo las palabras incorrectas. Realmente está eligiendo las coordenadas incorrectas.
  • Es un problema de "Contexto": La IA tiene dificultades para tomar un entendimiento global ("Veo 3 cosas raras") y recalibrarlo para un contexto específico ("Pero solo quiero las que están dentro de este cuadro azul").
  • El Fallo de "Anclaje": A veces, la IA se queda "anclada" al conteo total. Si ve 3 cosas raras en total, y le pides las que están en un cuadro, puede que todavía intente hacer clic en 3 cosas, incluso si solo hay 2 en el cuadro. No puede soltar el número original.

5. La Conclusión

El artículo concluye que, si bien la IA se está volviendo muy buena en ver y describir el mundo, todavía tiene dificultades para actuar sobre ese mundo con precisión cuando las reglas cambian.

Piensa en ello como un conductor que es excelente detectando una luz roja desde una milla de distancia (Percepción), pero tiene dificultades para frenar exactamente cuando la luz se pone roja, especialmente si hay otros autos o señales que confunden la vista (Acción).

El benchmark ROSE es una nueva herramienta diseñada para medir exactamente esta brecha. Ayuda a los investigadores a ver que, para que la IA sea verdaderamente útil en tareas del mundo real (como hacer clic en botones en una pantalla o navegar por una habitación), necesita mejorar en la capacidad de tomar lo que ve y convertirlo en el movimiento exacto para la situación actual.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →