← Últimos artículos
💻 computer science

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

Este artículo presenta SceneFunRI, un nuevo conjunto de referencia compuesto por 855 instancias que evalúa la capacidad de los modelos de visión y lenguaje para razonar sobre las ubicaciones de objetos funcionales invisibles y ocluidos utilizando instrucciones de tarea y conocimiento común, revelando que los modelos actuales más avanzados tienen dificultades significativas con esta capacidad.

Autores originales: Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

Publicado 2026-05-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que entras en una habitación y alguien te pregunta: «¿Dónde está la mesita de noche junto a la cama?». Miras a tu alrededor, pero la mesita de noche está completamente oculta detrás de un armario grande. No puedes verla en absoluto. Sin embargo, sabes por sentido común que las mesitas de noche suelen estar junto a las camas, y puedes ver la cama. Así que, mentalmente, «rellenas el hueco» y señalas el lugar detrás del armario donde la mesita de noche debe estar.

Este artículo, SceneFunRI, trata de enseñar a las computadoras a realizar ese mismo truco mental.

El problema: el desafío de lo «invisible»

Los modelos de IA actuales (específicamente los Modelos Visuales-Lingüísticos, o VLM) son como detectives que solo confían en lo que pueden ver con sus propios ojos. Si una pista está oculta detrás de una pared, a menudo se rinden o adivinan al azar. Les cuesta utilizar el «sentido común» para determinar dónde están las cosas cuando estas son completamente invisibles.

Los investigadores crearon una nueva prueba llamada SceneFunRI (Razonamiento de lo Invisible).

  • La configuración: Tomaron 855 escenas del mundo real donde un objeto específico (como una lámpara o un cajón) está totalmente oculto a la vista.
  • La tarea: Se le da a la IA una imagen de la habitación y un comando como: «Abre el cajón de la mesita de noche a la derecha de la cama».
  • El objetivo: La IA debe señalar la ubicación de la mesita de noche invisible sin haberla visto nunca, utilizando solo la cama visible y su conocimiento sobre cómo suelen estar dispuestas las habitaciones.

Los resultados: la IA sigue siendo un detective novato

Los investigadores probaron muchos modelos de IA diferentes en esta tarea. Los resultados fueron humildes:

  • La mejor IA: Incluso el modelo más inteligente (Gemini 3 Flash) solo acertó la ubicación «suficientemente cerca» aproximadamente el 15% de las veces.
  • La línea base humana: Los humanos, por comparación, lo acertaron correctamente aproximadamente el 66% de las veces.
  • La brecha: Esto muestra que, aunque la IA es excelente para detectar lo que tiene delante, es terrible para imaginar lo que hay detrás de los obstáculos.

Cómo intentaron ayudar a la IA (los experimentos de «prompts»)

Los investigadores probaron tres formas diferentes de «entrenar» a la IA para que lo hiciera mejor, de manera similar a como un profesor podría ayudar a un estudiante:

  1. Instrucciones fuertes: Decirle a la IA: «Ignora lo que ves; enfócate en lo que debería estar allí».
    • Resultado: Esto ayudó un poco. Fue como decirle a un estudiante: «No solo mires la imagen; piensa en la historia».
  2. Pistas de sentido común: Darle a la IA hechos específicos, como «Los enchufes suelen estar en las esquinas».
    • Resultado: Esto no ayudó mucho. Fue como darle al estudiante una hoja de datos, pero no enseñarle cómo aplicarla a la habitación específica. La IA conocía el hecho, pero no podía traducirlo en una ubicación en el mapa.
  3. El «proceso de eliminación» (SPoE): Este fue el enfoque más creativo. En lugar de pedirle a la IA que adivinara el lugar exacto inmediatamente, le enseñaron a jugar un juego de «caliente y frío».
    • Cómo funciona: Se le muestra a la IA toda la habitación. Luego se le pregunta: «¿Está el objeto en la mitad izquierda o en la mitad derecha?». Elimina la mitad donde el objeto no puede estar. Luego divide la mitad restante otra vez.
    • Resultado: Esto funcionó sorprendentemente bien. Al descartar lentamente áreas imposibles, la IA se acercó mucho más al lugar correcto. Es como encontrar una llave perdida revisando cada habitación una por una, en lugar de adivinar inmediatamente el cajón exacto.

La gran conclusión

El artículo concluye que los modelos de IA actuales son «ciegos» al mundo invisible. Son buenos describiendo lo que ven, pero no han aprendido a construir un mapa mental de lo que no ven.

Los investigadores descubrieron que la IA es en realidad mejor para descartar malas conjeturas (como tachar habitaciones en un mapa) que para adivinar directamente el lugar correcto. Para hacer que la IA sea verdaderamente inteligente en el mundo real, necesitamos enseñarle a sentirse cómoda con la incertidumbre y a utilizar la lógica para rellenar los huecos cuando faltan las pruebas visuales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →