← Últimos artículos
💬 NLP

LVLMs and Humans Ground Differently in Referential Communication

El estudio demuestra que los modelos de lenguaje visuales grandes (LVLMs) carecen de la capacidad de generar y resolver expresiones referenciales de manera interactiva para establecer un terreno común con los humanos, lo que limita su eficacia en la comunicación colaborativa.

Autores originales: Peter Zeng, Weiling Li, Amie Paige, Zhengxiang Wang, Panagiotis Kaliosis, Dimitris Samaras, Gregory Zelinsky, Susan Brennan, Owen Rambow

Publicado 2026-04-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Peter Zeng, Weiling Li, Amie Paige, Zhengxiang Wang, Panagiotis Kaliosis, Dimitris Samaras, Gregory Zelinsky, Susan Brennan, Owen Rambow

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes que armar un rompecabezas con un amigo, pero hay una regla estricta: no puedes tocar las piezas tú mismo. Tu amigo (el "Director") ve el cuadro completo y debe describirte cada pieza para que tú (el "Encajador") la elijas de una pila gigante y la pongas en el lugar correcto.

Este es el experimento que hicieron los autores de este paper. Pero en lugar de solo humanos, mezclaron a personas con Inteligencia Artificial (IA) para ver cómo se llevan.

Aquí tienes la explicación de lo que descubrieron, usando analogías sencillas:

1. El Problema: El "Terreno Común" (Common Ground)

En una conversación normal entre humanos, hacemos algo mágico llamado crear un "terreno común".

  • La analogía: Imagina que intentas describir una cesta extraña. La primera vez, dices: "Es esa cesta alta, marrón, con asas que parecen orejas de conejo". Tu amigo la encuentra.
  • La segunda vez, no necesitas repetir todo. Solo dices: "La de las orejas de conejo".
  • La tercera vez, quizás solo digas: "La orejona".
  • Lo que pasa: Ambos han creado un acuerdo mental (un "pacto conceptual"). Se han puesto de acuerdo en cómo llamar a las cosas para ahorrar tiempo y esfuerzo. Es como si desarrollaran su propio dialecto privado.

2. Lo que hicieron los científicos

Crearon un juego donde:

  • Un Director ve 12 cestas en un orden específico.
  • Un Encajador ve esas mismas 12 cestas mezcladas con otras 4 falsas.
  • Tienen 4 rondas para poner las cestas en orden.
  • Probaron 4 combinaciones:
    1. Humano + Humano
    2. Humano + IA (Humano da órdenes)
    3. IA + Humano (IA da órdenes)
    4. IA + IA

3. Los Resultados: ¿Quién juega bien?

🏆 Los Humanos (Humano + Humano)

  • Lo que hicieron: Empezaron hablando mucho y usando descripciones largas. Pero, ¡miren esto! En la segunda y tercera ronda, sus descripciones se volvieron más cortas y precisas.
  • La analogía: Es como dos músicos que tocan juntos. Al principio, cada uno prueba notas, pero pronto encuentran un ritmo y empiezan a improvisar juntos, tocando menos notas pero sonando mejor.
  • Resultado: Se volvieron más rápidos, más precisos y usaron menos palabras porque habían creado ese "pacto mental".

🤖 Las IAs solas (IA + IA)

  • Lo que hicieron: Empezaron muy bien (casi perfectas), pero empeoraron con el tiempo.
  • El problema: A pesar de tener todo el historial de la conversación, las IAs no aprendieron a acortarse. Siguieron describiendo la cesta "orejona" como si fuera la primera vez que la veían: "Es una cesta alta, marrón, con asas que parecen orejas de conejo..." una y otra vez.
  • La analogía: Imagina a un robot que te explica cómo hacer un sándwich. La primera vez te da la receta completa. La segunda vez, te vuelve a dar la receta completa, aunque ya sabes qué ingredientes tienes. Nunca se adapta a lo que tú ya sabes. Además, a veces se confundían y ponían la cesta en el lugar equivocado, pero seguían hablando igual de largo.
  • Resultado: Hablaban mucho, gastaban mucha energía y cometían más errores en las rondas finales.

🤝 Las Mezclas (Humano + IA)

Aquí es donde se pone interesante, porque depende de quién lleva el timón:

  • Humano dando órdenes a IA: El humano intentaba crear el "pacto" (usando apodos cortos), pero la IA no entendía el chiste. La IA seguía usando términos largos y formales, ignorando las señales del humano. El humano se frustraba porque tenía que repetir cosas una y otra vez.
  • IA dando órdenes a Humano: La IA empezaba bien, pero luego se desordenaba. Empezaba a describir las cestas en el orden equivocado o a inventar detalles que no existían (alucinaciones). El humano intentaba corregirla, pero la IA no parecía escuchar realmente, y el error se acumulaba.

4. La Conclusión Principal

El paper nos dice algo muy importante: Las IAs actuales son muy buenas leyendo, pero muy malas "conociendo" a su compañero.

  • Los humanos construyen una relación: "Ya sé que tú sabes lo que yo sé, así que no necesito explicarte todo".
  • Las IAs (incluso las más avanzadas como GPT-5.2) tratan cada frase como si fuera nueva, sin recordar realmente lo que han establecido con su compañero. No tienen esa "intuición social" de saber cuándo pueden ser breves.

En resumen

Si quieres que una IA trabaje contigo en un equipo, no puedes esperar que aprenda a ser tu socio de conversación de la misma manera que lo hace un humano. La IA sigue siendo como un robot que sigue un manual: hace lo que se le dice, pero no "siente" la necesidad de ahorrar palabras para que la conversación fluya mejor.

Para que las IAs sean verdaderos socios, no basta con darles más datos; necesitan aprender a construir ese terreno común, a entender que "lo que ya hablamos" no necesita ser repetido. De momento, siguen siendo un poco torpes en esa danza de la conversación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →