← Últimos artículos
💻 computer science

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube es un novedoso método basado en difusión de dos etapas que permite la generación 3D compositiva precisa al aceptar prompts de texto globales junto con diseños semánticos y espaciales específicos a nivel de partes para producir objetos 3D de alta calidad con componentes controlables de forma independiente.

Autores originales: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

Publicado 2026-08-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La creación de objetos 3D digitales para películas, videojuegos y mundos virtuales ha sido tradicionalmente un oficio laborioso. Los artistas pasan horas esculpiendo, pintando y ensamblando modelos complejos manualmente, asegurándose de que cada rueda, ala o extremidad esté colocada exactamente donde debe estar. En los últimos años, la inteligencia artificial ha comenzado a automatizar este proceso, permitiendo que las computadoras generen formas 3D a partir de simples descripciones de texto. Sin embargo, estos sistemas de IA tempranos suelen producir objetos sólidos de una sola pieza que carecen de la estructura interna necesaria para el uso profesional. Si un desarrollador necesita un personaje con brazos móviles o un vehículo con ruedas desmontables, un modelo generado por IA estándar suele ser inútil porque es solo un bloque continuo de geometría. El desafío para los investigadores ha sido enseñar a las computadoras no solo a crear una forma, sino a comprender que una forma está compuesta de partes distintas y significativas que pueden controlarse individualmente.

Un equipo de investigadores ha presentado un nuevo sistema llamado MultiCube, diseñado para resolver este problema otorgando a los creadores un control preciso sobre la identidad y la ubicación de cada parte dentro de un objeto 3D generado. En lugar de simplemente pedirle a una computadora que "haga un robot", los usuarios ahora pueden especificar exactamente qué partes desean —como una cabeza, dos brazos y cuatro ruedas— y decirle al sistema exactamente dónde debe situarse cada parte en el espacio. El sistema genera entonces un objeto 3D completo donde cada componente es una pieza separada y editable, perfectamente alineada con las instrucciones del usuario. Este enfoque cierra la brecha entre la libertad creativa de la generación basada en texto y los requisitos estructurales rígidos del modelado 3D profesional.

La innovación central de MultiCube reside en cómo interpreta las instrucciones. Los métodos anteriores podrían tomar una descripción de texto y una idea aproximada de dónde van las cosas, pero a menudo tienen dificultades para mantener las partes distintas o en el lugar correcto. MultiCube funciona aceptando tres entradas específicas: una descripción del objeto general, una lista de las partes específicas necesarias y un conjunto de cajas invisibles que definen el tamaño y la posición de cada parte. Imagine que un usuario describe una "linterna de metal robusta" y enumera sus componentes como un mango, un interruptor y una lente. Luego, dibuja tres cajas en un espacio virtual: una para el mango, una para el interruptor y una para la lente. El sistema utiliza estas cajas como una guía estricta, asegurando que el mango generado quepa dentro de la primera caja, el interruptor en la segunda y la lente en la tercera, manteniendo al mismo tiempo la apariencia de una linterna cohesiva.

Para lograr esto, los investigadores construyeron un proceso de dos pasos. Primero, la computadora genera una forma única y sólida que contiene todas las partes solicitadas en sus ubicaciones correctas. Lo hace aprendiendo a asociar la descripción de texto de cada parte con la caja asignada a ella. Un componente especial en el sistema, llamado Adaptador de Diseño de Partes (Part Layout Adapter), actúa como un traductor que mantiene la información de cada parte separada, evitando que la computadora se confunda sobre qué parte pertenece a qué caja. Una vez que se crea esta forma sólida, el sistema pasa al segundo paso, donde separa cuidadosamente el objeto sólido de nuevo en las partes individuales que el usuario solicitó. Esto asegura que el resultado final no sea solo una malla única, sino una colección de modelos 3D distintos que encajan perfectamente entre sí.

Los resultados de este método suponen una mejora significativa respecto a las herramientas existentes. En las pruebas, MultiCube fue capaz de generar objetos complejos como un revólver de seis disparos con un cilindro expuesto, un majestuoso monstruo águila con múltiples cabezas o un robot mecánico con extremidades específicas, todo ello cumpliendo estrictamente con las instrucciones espaciales del usuario. Al compararse con otros sistemas, MultiCube produjo formas que eran mucho más precisas respecto al diseño previsto y que presentaban menos errores, como el solapamiento de piezas o la ausencia total de las mismas. El sistema también es lo suficientemente flexible como para manejar cambios; si un usuario decide cambiar las patas de una criatura por alas, o alargar una cola, el sistema puede regenerar el objeto con las nuevas partes manteniendo intacta el resto de la estructura.

Más allá de los objetos estáticos, esta tecnología abre la puerta a aplicaciones más dinámicas. Debido a que el sistema genera los objetos como piezas separadas y etiquetadas, estas partes pueden utilizarse inmediatamente para la animación. Un personaje creado con MultiCube puede mover sus brazos y piernas de forma independiente sin necesidad del tedioso proceso de rigging manual, que normalmente requiere que los artistas definan manualmente cómo se doblan y rotan las articulaciones. Los investigadores también demostraron que el sistema puede automatizarse por completo; al conectarlo a un modelo de lenguaje extenso, un usuario puede simplemente escribir una descripción como "un dormitorio acogedor" y el sistema determinará automáticamente las partes necesarias —cama, mesa de noche, lámpara— y las organizará en un diseño lógico sin necesidad de dibujar cajas manualmente.

Si bien el sistema es potente, los investigadores reconocen que no es perfecto. Si las cajas que definen las partes se dibujan de una manera que no tiene sentido físico, como colocar una rueda dentro de una cabeza, el objeto resultante puede verse extraño. Además, ocasionalmente el sistema produce partes que se solapan ligeramente, aunque esto es poco común. A pesar de estas pequeñas limitaciones, este trabajo representa un gran paso adelante para hacer que la creación 3D sea accesible y controlable. Al dar a los usuarios la capacidad de dictar no solo cómo se ve un objeto, sino cómo está construido y dónde van sus piezas, MultiCube acerca la inteligencia artificial al nivel de control que requieren los artistas profesionales, convirtiendo descripciones de texto simples y bocetos rudimentarios en activos 3D complejos y utilizables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →