← Últimos artículos
💻 computer science

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D es un marco de generación de texto a 3D eficiente que particiona los tokens de forma discretos en bloques contiguos para un denoise conjunto y emplea una corrección intra-bloque guiada por confianza, logrando una aceleración de 5.15× sobre las bases autorregresivas mientras mantiene una alta fidelidad geométrica.

Autores originales: Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

Publicado 2026-08-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La creación de objetos tridimensionales a partir de descripciones de texto simples se ha convertido en una herramienta poderosa para desarrolladores de videojuegos, cineastas y robóticos que necesitan convertir el lenguaje natural en activos digitales. Durante años, el desafío ha sido equilibrar la calidad con la velocidad. Los métodos existentes generalmente siguen uno de dos caminos. El primer enfoque construye las formas pieza por pieza, decidiendo sobre una parte diminuta del objeto a la vez. Si bien esto puede producir resultados detallados, es un proceso secuencial lento donde un error cometido al principio no puede corregirse fácilmente después. El segundo enfoque intenta refinar todo el objeto de una sola vez, ajustando cada parte simultáneamente. Esto es más rápido en teoría, pero se vuelve increíblemente costoso y lento a medida que el objeto gana detalle, porque la computadora debe procesar repetidamente toda la forma una y otra vez para lograr que sea correcta. Los investigadores han buscado durante mucho tiempo una forma de tener tanto una alta fidelidad geométrica como un bajo tiempo de generación, pero el equilibrio entre ambos ha permanecido obstinado.

Un equipo de investigadores de la Universidad de Zhejiang y varias instituciones internacionales ha introducido un nuevo método llamado Block3D que cambia la forma en que se construyen estas formas digitales. En lugar de construir un objeto un pequeño token a la vez o refinar toda la forma en un único bucle masivo, este nuevo sistema divide el proceso de generación en fragmentos manejables. Imagine el plano digital de un objeto 3D como una larga secuencia de instrucciones. Block3D divide esta secuencia en bloques contiguos, generándolos uno tras otro de izquierda a derecha. Sin embargo, dentro de cada bloque, el sistema no solo adivina la siguiente pieza; observa el bloque completo a la vez, refinando todas las piezas dentro de él simultáneamente. Esto permite que la computadora corrija errores dentro de esa sección específica antes de pasar a la siguiente, evitando que los pequeños errores se acumulen a medida que se construye el objeto.

La innovación clave reside en cómo el sistema maneja la incertidumbre. A medida que el modelo genera un bloque de la forma, asigna una puntuación de confianza a cada pieza. Si el sistema no está seguro de una parte específica, puede revisar esa parte antes de que el bloque se finalice y se fije en su lugar. Esta "corrección guiada por confianza" significa que el modelo puede corregir sus propios errores en tiempo real, pero solo dentro de la sección actual en la que está trabajando. Una vez que un bloque se completa y se añade a la forma en crecimiento, este queda fijo y el sistema avanza. Este enfoque evita el lento proceso de adivinación paso a paso de los métodos antiguos, mientras esquiva la pesadez computacional de refinar el objeto completo repetidamente.

En las pruebas utilizando un gran conjunto de datos de activos 3D emparejados con descripciones de texto, los resultados fueron sorprendentes. Los investigadores compararon su nuevo método con una línea base estándar ajustada que utilizaba el enfoque antiguo, pieza por pieza. El método tradicional tardó un promedio de 25.71 segundos en generar un solo objeto 3D. Block3D redujo este tiempo a solo 4.99 segundos, haciendo que el proceso fuera más de cinco veces más rápido. A pesar de este dramático aumento en la velocidad, la calidad de la geometría no sufrió. De hecho, el nuevo método produjo formas con mejor precisión geométrica y alineación con las instrucciones de texto que la línea base más lenta. El sistema generó con éxito formas complejas, desde caballeros estilizados y animales hasta muebles y elementos arquitectónicos, manteniendo una alta fidelidad mientras operaba a una velocidad que hace que las aplicaciones en tiempo real sean mucho más factibles.

El estudio confirma que, al reorganizar la forma en que la computadora piensa sobre la secuencia de creación de la forma, es posible romper la barrera de larga data entre la velocidad y la calidad. El método no depende de la magia o de una física nueva y compleja; simplemente cambia el cronograma de cómo la computadora procesa la información, permitiéndole trabajar en paralelo en grupos pequeños de datos en lugar de en una línea estricta o en un bucle masivo y repetitivo. Esta ganancia de eficiencia sugiere que la generación de 3D de alta calidad pronto podría convertirse en una parte estándar de los flujos de trabajo interactivos, donde la velocidad es tan crítica como el detalle visual del producto final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →