← Últimos artículos
💻 computer science

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Este artículo presenta Game2World, un marco integral que cuenta con el G2WEngine para la extracción de activos de la interfaz de usuario y el modelo GameCleaner para la eliminación de HUD sin necesidad de máscaras, el cual transforma videos de jugabilidad sin procesar en datos de entrenamiento de alta calidad y libres de interfaz que mejoran significativamente el rendimiento del modelo de mundo.

Autores originales: Wenxuan Shen, Dongna Jin, Dongping Chen

Publicado 2026-08-26
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Wenxuan Shen, Dongna Jin, Dongping Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar enseñar a una computadora a entender cómo se mueve y cambia el mundo físico. Para lograrlo, los investigadores necesitan cantidades vastas de video que muestren cómo interactúan los objetos, cómo cambia la luz y cómo evolucionan las escenas a lo largo del tiempo. Durante años, los científicos han visto en los videojuegos una fuente perfecta para estos datos. Los juegos ofrecen entornos diversos e infinitos donde cada acción tiene una consecuencia clara, proporcionando una rica biblioteca de experiencias visuales que son difíciles de capturar en el mundo real. Sin embargo, existe un problema significativo al utilizar grabaciones puras de estos juegos. Cuando una persona juega, la pantalla está saturada de elementos digitales superpuestos: barras de salud, mapas, contadores de munición y ventanas de chat. Estos elementos no forman parte del mundo del juego en sí; son decoraciones de espacio de pantalla añadidas para el beneficio del jugador. Si una computadora aprende de videos llenos de estas superposiciones, se confunde, mezclando las reglas del juego con las reglas de la interfaz.

Un equipo de investigadores ha desarrollado un nuevo sistema para resolver este problema, eliminando eficazmente el desorden digital para revelar el mundo puro del juego que se encuentra debajo. Crearon un marco de trabajo que puede identificar automáticamente estas interfaces en pantalla, eliminarlas del video e incluso rellenar el fondo faltante para que la escena parezca completa y natural. Al hacer esto, han transformado millones de horas de metraje de jugabilidad desordenado en datos de entrenamiento limpios y de alta calidad. Su trabajo demuestra que cuando las computadoras aprenden de estos videos limpios, se vuelven significativamente mejores en la comprensión de cómo funciona el mundo, mejorando su rendimiento en la predicción de movimiento y calidad visual por un margen mensurable. Este avance sugiere que la vasta y desaprovechada biblioteca de videos de jugabilidad de internet puede finalmente utilizarse para construir sistemas de inteligencia artificial más inteligentes y capaces.

El núcleo de este proyecto es un nuevo motor de datos llamado G2WEngine. Los investigadores se dieron cuenta de que, para enseñar a una computadora sobre el mundo, primero tenían que enseñarle qué no es el mundo. Comenzaron creando un sistema de clasificación detallado para las interfaces de juego, organizando todo, desde brújulas y barras de salud hasta registros de chat y notificaciones emergentes, en categorías específicas. Utilizando este sistema, el motor escanea miles de videos de jugabilidad reales de cientos de juegos diferentes. Extrae cuidadosamente los activos digitales —las imágenes reales de las barras de salud o los mapas— y los convierte en piezas reutilizables y transparentes. Esto permite al sistema entender exactamente cómo lucen estas interfaces y dónde aparecen típicamente en la pantalla.

Una vez que el sistema comprende las interfaces, trabaja a la inversa para crear un nuevo conjunto masivo de datos. Toma clips de video de mundos de juego limpios y libres de interfaces y luego añade artificialmente las interfaces extraídas sobre ellos, creando pares perfectos de metraje "antes" y "después". Este proceso genera 96,000 pares de videos sintéticos donde la computadora sabe exactamente cómo se ve el mundo limpio y cómo se ve la versión saturada. Para asegurar que el sistema funcione con datos del mundo real, también recolectaron más de 1,000 clips de videos reales de internet, cubriendo 303 juegos diferentes. Esta combinación de datos sintéticos y reales proporciona un campo de prueba riguroso para ver si el proceso de eliminación se mantiene bajo presión.

Los investigadores entrenaron entonces un modelo especializado, al cual llamaron GameCleaner, para realizar la tarea de eliminación. A diferencia de métodos anteriores que requerían que los usuarios dibujaran manualmente cuadros alrededor de los elementos que querían eliminar, GameCleaner funciona de forma automática. Utiliza una comprensión profunda del contexto visual para identificar qué partes de la imagen son el mundo del juego y cuáles son las superposiciones digitales. Cuando elimina una barra de salud o un mapa, no solo borra los píxeles; reconstruye el escenario oculto detrás de ellos, asegurando que el fondo permanezca consistente y que el movimiento de los personajes se mantenga fluido. El modelo fue probado contra otras herramientas de edición de video y demostró ser muy superior, eliminando con éxito las interfaces mientras preservaba la escena subyacente con un alto grado de precisión.

Los resultados de este trabajo fueron probados en un experimento controlado para ver si los datos limpios realmente marcaban una diferencia. Los investigadores entrenaron dos modelos de generación de video idénticos: uno con los videos de jugabilidad originales y saturados, y otro con las versiones recién limpiadas. El modelo entrenado con los datos limpios funcionó significativamente mejor. Produjo videos con una calidad de movimiento mucho mayor y una mejor fidelidad visual general. Específicamente, el modelo entrenado con los datos limpios mostró una mejora del 18.8 por ciento en la captura de movimiento y una mejora del 6.83 por ciento en su puntuación de rendimiento general. Esto demuestra que las superposiciones digitales no eran solo ruido visual; estaban confundiendo activamente el proceso de aprendizaje, actuando como atajos que impedían que la computadora comprendiera verdaderamente la dinámica del entorno.

El impacto de esta investigación se extiende más allá de simplemente hacer que los videos luzcan más limpios. Al lograr separar la interfaz del mundo, los investigadores han desbloqueado un camino escalable para crear mejores modelos de mundo. Estos modelos son la base para la inteligencia artificial del futuro que pueda navegar entornos complejos, simular interacciones físicas e incluso controlar robots. La capacidad de procesar vastas cantidades de datos de jugabilidad de internet sin la necesidad de simuladores costosos y personalizados significa que el conjunto de datos de entrenamiento disponibles para estos sistemas es ahora efectivamente ilimitado. El equipo ha puesto su conjunto de datos, código y modelos a disposición del público, invitando a otros científicos a construir sobre esta base. Su trabajo demuestra que, con las herramientas adecuadas, los videos caóticos y saturados de interfaces de internet pueden transformarse en un recurso prístino y estructurado para enseñar a las máquinas cómo se mueve realmente el mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →