← Últimos artículos
🤖 AI

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

El artículo presenta VibeWorlding, un marco unificado que comprende el benchmark VWE-BENCH y el entorno de entrenamiento de RL VibeWorlding-Gym, para evaluar y mejorar la capacidad de los agentes multimodales para construir de forma autónoma mundos 3D interactivos a partir de consultas de usuario, demostrando que el aprendizaje por refuerzo puede permitir que los modelos de código abierto superen a los sistemas cerrados de vanguardia en esta tarea compleja.

Autores originales: Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

Publicado 2026-08-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina estar de pie en una habitación digital vacía y pedirle a una computadora que construya una bulliciosa calle de la ciudad, un tranquilo claro en un bosque o una estación espacial futurista, simplemente describiendo lo que quieres ver. Esta es la promesa de la "inteligencia artificial encarnada", un campo donde las máquinas aprenden a interactuar con y construir espacios tridimensionales tal como lo hacen los humanos. Durante años, los investigadores han intentado enseñar a las computadoras a organizar objetos digitales como muebles, árboles y edificios basándose en instrucciones de texto. Sin embargo, la mayoría de los intentos previos funcionaban solo con peticiones simples e idealizadas, como "pon una silla aquí". Les costaba enfrentarse a la naturaleza desordenada y abierta de la conversación humana real, donde un usuario podría pedir un "estudio acogedor y ligeramente desordenado" con una iluminación y un ambiente específicos. Además, debido a que las herramientas para construir estos mundos estaban dispersas y los métodos de prueba eran inconsistentes, era difícil saber si una inteligencia artificial estaba comprendiendo realmente una petición o simplemente adivinando.

Un equipo de investigadores ha abordado ahora este desafío con un nuevo marco llamado VibeWorlding. Crearon un sistema integral que permite a un agente artificial no solo escuchar la descripción de un usuario, sino también planificar activamente, buscar los objetos digitales adecuados, colocarlos en un espacio 3D y luego observar el resultado para ver si coincide con la visión. Los investigadores construyeron un enorme campo de pruebas que contiene más de 2.600 objetos 3D de alta calidad, que van desde pequeños accesorios hasta grandes edificios, y los utilizaron para crear cientos de escenas complejas. Luego generaron miles de peticiones de usuarios únicas, algunas con instrucciones precisas y otras con deseos vagos y abiertos, para ver qué tan bien diferentes inteligencias artificiales podían manejar la tarea. El sistema actúa como un juez riguroso, verificando no solo si los objetos están en el lugar correcto, sino si tienen sentido físico, asegurando, por ejemplo, que una mesa no esté flotando en el aire o que un árbol no esté creciendo dentro de una pared.

Cuando los investigadores probaron los modelos de inteligencia artificial más avanzados disponibles hoy en día, incluyendo aquellos de las principales empresas tecnológicas, encontraron una brecha significativa entre las capacidades actuales y el objetivo de construir estos mundos automáticamente. Incluso los modelos más potentes, que pueden escribir código y responder preguntas complejas, fallaron al construir exitosamente las escenas solicitadas más del 60 por ciento de las veces. La razón principal de este fallo no fue la falta de comprensión de las palabras del usuario, sino la dificultad en el acto físico preciso de editar el mundo 3D. Los modelos a menudo entendían que un usuario quería mover una estantería, pero calculaban la distancia incorrectamente o movían el objeto en la dirección equivocada, causando que colisionara con otros artículos o flotara de manera poco realista.

Para cerrar esta brecha, el equipo desarrolló un método de entrenamiento especializado que enseña a la inteligencia artificial mediante el ensayo y error, de forma similar a como un niño aprende a construir con bloques. El sistema permite al agente intentar construir una escena, verifica el resultado contra reglas estrictas sobre la física y la intención del usuario, y luego recompensa al agente solo cuando lo hace correctamente. Este proceso, conocido como aprendizaje por refuerzo, permitió a los investigadores entrenar un modelo de código abierto que eventualmente podría superar a los mejores modelos de código cerrado disponibles. Su mejor modelo entrenado, que comenzó con una base de 30 mil millones de parámetros, logró la tasa de éxito más alta de todos los sistemas probados. Aprendió a recuperar los objetos correctos, colocarlos sin colisiones y respetar las restricciones físicas del entorno, dominando efectivamente la "vibra" del mundo que el usuario quería crear.

El estudio también reveló que, si bien estos modelos están mejorando en la comprensión del panorama general, la parte más difícil sigue siendo los detalles finos del razonamiento espacial. Los agentes todavía luchan con las mediciones precisas, como mover un objeto exactamente siete metros hacia adelante sin pasarse o quedarse corto. Sin embargo, los investigadores encontraron que el método de entrenamiento mejoró significamente la capacidad de los agentes para razonar sobre el espacio 3D, convirtiendo una debilidad importante en una fortaleza. Al liberar sus datos, herramientas y modelos entrenados al público, el equipo espera acelerar el desarrollo de sistemas que algún día puedan construir mundos 3D interactivos para juegos, simulaciones y realidad virtual con la misma facilidad y creatividad que un diseñador humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →