← Últimos artículos
🤖 AI

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

El artículo introduce EgoGapBench, un banco de pruebas de diagnóstico que revela que los modelos actuales de lenguaje de gran tamaño multimodales tienen dificultades con la Selección de Acciones Egocéntricas en escenas de agentes múltiples al adoptar incorrectamente las acciones de otros, una brecha que persiste incluso después del ajuste fino con datos de primera persona existentes.

Autores originales: Jihyeok Jung (KAIST AI), Jeewu Lee (Sogang University), Sanghyeop Kim (Sogang University), Chanhee Han (Ministry of Science and ICT), Seong Joon Oh (KAIST AI)

Publicado 2026-07-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jihyeok Jung (KAIST AI), Jeewu Lee (Sogang University), Sanghyeop Kim (Sogang University), Chanhee Han (Ministry of Science and ICT), Seong Joon Oh (KAIST AI)

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás de pie en una habitación llena de gente, observando un partido de béisbol. No eres el bateador, ni el lanzador, ni el árbitro. Eres solo un observador de pie detrás del plato.

Ahora, imagina que un robot está de pie justo al lado tuyo, mirando exactamente la misma escena a través de tus ojos. El trabajo del robot es decidir: "¿Qué debería hacer yo en este momento?"

Según este artículo, los robots de IA actuales son terribles en este trabajo específico. Se confunden y piensan: "¡Oh, veo a un bateador sosteniendo un bate! ¡Debo ser el bateador!", a pesar de que claramente están de pie detrás del plato, no en la caja de bateo.

Aquí tienes un desgón de los hallazgos del artículo utilizando analogías sencillas:

1. El Problema: La muleta de las "pistas corporales"

Durante mucho tiempo, los científicos probaron la IA con videos en "primera persona" (como una GoPro sujeta a la cabeza de una persona). En estos videos, a menudo se pueden ver las manos, los pies o las herramientas que la persona sostiene.

  • La Analogía: Es como un estudiante haciendo un examen haciendo trampa al mirar sus propias manos. Si la IA ve manos sosteniendo un bate, sabe "Yo soy el bateador".
  • El Defecto: El artículo argumenta que la IA no está comprendiendo realmente la perspectiva; solo está reconociendo partes del cuerpo. Si giras el video boca abajo o eliminas las manos, la IA se pierde. No sabe quién es; solo sabe qué es lo que ve.

2. La Nueva Prueba: EgoGapBench

Los investigadores crearon una nueva prueba llamada EgoGapBench para ver si la IA puede comprender realmente la perspectiva sin hacer trampa.

  • La Configuración: Mostraron a la IA imágenes de escenas concurridas (como un partido de béisbol o una boda) donde no se ve la mano ni el cuerpo de nadie desde el punto de vista de la cámara.
  • La Trampa: En la imagen, hay un bateador haciendo un swing con un bate. Se supone que la IA es el árbitro que está de pie detrás del plato.
  • La Pregunta: "¿Qué deberías hacer a continuación?"
  • La Respuesta Incorrecta: La IA a menudo elige "Batear el bate" porque ve al bateador haciéndolo. Esto se llama un error de "Intrusión Motora". Es como si la IA pensara: "Veo a alguien corriendo, así que debo ser el corredor", aunque esté de pie sin moverse.

3. Los Resultados: Humanos vs. Robots

  • Humanos: Cuando las personas realizaron esta prueba, acertaron casi siempre (94.5%). Naturalmente entendemos: "Soy el árbitro, así que debo inclinarme hacia adelante para juzgar el lanzamiento, no batear".
  • Modelos de IA: Incluso los modelos de IA más inteligentes (como GPT-5 o Gemini) obtuvieron puntuaciones mucho más bajas (alrededor del 66% para el mejor, y cerca de un acierto al azar para otros). Consistentemente intentaban copiar las acciones de las personas que veían en la imagen.

4. El Error de "Entrenamiento"

Los investigadores intentaron arreglar la IA enseñándole con más videos en "primera persona" (videos donde se ven manos y cuerpos).

  • La Analogía: Es como intentar enseñar a alguien a conducir un coche mostrándole videos de personas conduciendo, pero sin dejarle nunca sentarse en el asiento del conductor.
  • El Resultado: Esto incluso empeoró la IA en la nueva prueba. La IA se volvió aún más adicta a buscar pistas corporales. Cuando esas pistas faltaban en la nueva prueba, la IA colapsaba.

5. La Conclusión

El artículo concluye que ver una escena es diferente de actuar desde una perspectiva específica.

  • La IA actual es excelente describiendo lo que ve ("Hay un bateador").
  • La IA actual es mala determinando qué debe hacer ella basándose en dónde está situada ("Soy el árbitro, así que debo observar").

Los investigadores dicen que debemos dejar de simplemente mostrar a la IA videos de personas haciendo cosas y empezar a enseñarle cómo entender su propio "asiento" en la habitación, separado de todos los demás. Han publicado esta prueba (EgoGapBench) para que otros científicos puedan intentar construir robots que no se confundan con las personas que están paradas junto a ellos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →