← Últimos artículos
💬 NLP

VideoGameBench: Can Vision-Language Models complete popular video games?

El artículo presenta VideoGameBench, una prueba de evaluación en la que los modelos de visión y lenguaje deben jugar videojuegos de la década de 1990 utilizando únicamente entradas visuales crudas e instrucciones de alto nivel, revelando que incluso los modelos más avanzados tienen dificultades significativas con el juego en tiempo real debido a limitaciones en la percepción, la navegación espacial y la latencia de inferencia.

Autores originales: Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

Publicado 2026-05-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot muy inteligente que ha leído todos los libros de la biblioteca y puede resolver problemas matemáticos complejos. Podrías pensar: «¡Genial! Veamos si puede jugar videojuegos».

Exactamente eso fue lo que hicieron los investigadores de la Universidad de Princeton. Crearon una nueva prueba llamada VideoGameBench para ver si estos modelos avanzados de inteligencia artificial (llamados Modelos Visuales-Lingüísticos) realmente pueden jugar videojuegos populares de la década de 1990, tal como lo haría un humano.

Aquí tienes el desglose de su experimento, los resultados y lo que significan, utilizando analogías sencillas.

La Configuración: La Prueba del «Jugador Vendado»

Por lo general, cuando los científicos prueban la inteligencia artificial en videojuegos, le dan a la IA una hoja de trucos. Podrían decirle a la IA: «El enemigo está en las coordenadas X, Y», o darle un mapa del nivel. Es como jugar a un videojuego con un libro de guía abierto en el regazo.

VideoGameBench cambió las reglas.

  • Las Reglas: A la IA se le dan únicamente imágenes crudas de la pantalla (como si tú miraras un televisor) y una descripción simple en texto de lo que hacen los botones (por ejemplo, «Presiona 'A' para saltar»).
  • El Desafío: La IA tiene que entender el juego, recordar dónde ha estado y reaccionar ante los enemigos en tiempo real, tal como lo haría un jugador humano.
  • Los Juegos: Seleccionaron 10 juegos clásicos de los 90, que van desde Doom II (un shooter rápido) hasta Civilization (un juego de estrategia lento) y Pokémon (una aventura de rol).

Incluso ocultaron tres juegos secretos a la IA. Esto fue para asegurarse de que la IA no solo estuviera memorizando respuestas de sus datos de entrenamiento, sino que realmente estuviera aprendiendo a jugar cosas nuevas sobre la marcha.

Los Resultados: El Problema del «Recién Nacido»

Los resultados fueron sorprendentes. Incluso los modelos de inteligencia artificial más inteligentes y potentes disponibles hoy en día (como Gemini 2.5 Pro y Claude 3.7) lucharon enormemente.

  • La Puntuación: Los mejores modelos solo lograron completar aproximadamente el 0,48 % de los juegos.
  • La Realidad: En español llano, esto significa que la IA se quedó atascada al principio mismo del juego. Ni siquiera pudo terminar el primer nivel.

Piénsalo así: le entregas a un matemático genio una consola de videojuegos totalmente nueva. Puede calcular la trayectoria de un cohete, pero cuando intenta jugar a Super Mario, sigue cayendo por un precipicio porque no entiende que «abajo» en la pantalla significa «caer», o se olvida de que ya recogió una llave hace tres minutos.

¿Por qué fallaron?

El artículo identifica tres razones principales por las que la IA se quedó atascada:

  1. La Brecha entre «Saber» y «Hacer»: La IA a menudo «sabía» lo que debía hacer (por ejemplo, «Necesito ir a la puerta»), pero seguía presionando el botón incorrecto. Era como una persona que sabe que necesita girar a la izquierda para llegar a la tienda, pero su pie sigue dando un paso a la derecha.
  2. Confusión Visual: A veces la IA no podía distinguir lo que estaba viendo. En Doom II, una IA podría disparar a un enemigo muerto que parece un montón de rocas, desperdiciando toda su munición. En Zelda, podría pensar que habló con un personaje simplemente porque se paró junto a él, aunque no hubiera ocurrido ninguna conversación.
  3. Memoria Corta: Los videojuegos requieren recordar cosas durante mucho tiempo (por ejemplo, «Necesito encontrar la llave azul para abrir la puerta roja»). La IA olvidaba su objetivo principal después de solo unos pocos pasos, sobrescribiendo su memoria con pensamientos nuevos y menos importantes.

El Experimento del «Botón de Pausa»

Los investigadores se dieron cuenta de que algunos juegos son muy rápidos (en tiempo real) y la IA es lenta pensando. Para cuando la IA decidía presionar un botón, el juego ya había cambiado, haciendo que la acción fuera inútil.

Para solucionar esto, crearon VideoGameBench Lite.

  • El Cambio: Pulsaron el botón de «pausa» en el juego mientras la IA pensaba. El juego solo se movía cuando la IA daba una orden.
  • El Resultado: Las puntuaciones subieron ligeramente (a aproximadamente el 1,6 %), pero la IA aún falló al terminar los juegos. Esto demostró que el problema no era solo que la IA fuera lenta; era que la IA simplemente no podía razonar la lógica del juego de manera efectiva.

La «Prueba de Práctica»

Para ver si la IA podía manejar tareas básicas, crearon tres juegos de práctica diminutos y sencillos:

  1. Hacer clic: Hacer clic en un punto en movimiento.
  2. Arrastrar: Arrastrar un punto a lo largo de una línea.
  3. Laberinto: Mover un cuadrado a través de un laberinto simple.

Incluso aquí, la IA luchó. Mientras que algunos modelos podían hacer clic en el punto, casi todos fallaron al arrastrar o navegar por el laberinto. Esto sugiere que la IA tiene dificultades con interacciones físicas básicas y razonamiento espacial, no solo con la lógica compleja de los juegos.

La Conclusión

El artículo concluye que, aunque la inteligencia artificial es increíble en matemáticas y programación, actualmente es terrible jugando videojuegos cuando debe depender únicamente de lo que ve y de su propia memoria.

Los investigadores esperan que, al crear esta prueba difícil, puedan impulsar a los desarrolladores de IA a construir sistemas que sean mejores en:

  • Entender lo que ven (percepción).
  • Recordar lo que sucedió antes (memoria).
  • Planificar pasos con anticipación (estrategia).

Hasta que la IA pueda vencer a Doom o a Pokémon sin una hoja de trucos, no ha dominado del todo la capacidad humana de aprender y adaptarse a entornos nuevos y complejos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →