← Últimos artículos
💻 computer science

JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation

JoLT introduce un marco novedoso para la generación de imágenes de alta resolución que denoise simultáneamente trayectorias latentes de baja y alta resolución en dos flujos interconectados, combinando eficazmente el control del diseño global con la síntesis de detalles finos para producir imágenes ricamente detalladas y visualmente agradables.

Autores originales: Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mathis Koroglu, Guillaume Jeanneret, Hugo Caselles-Dupré, Matthieu Cord, Arnaud Dapogny

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Durante décadas, el sueño de crear arte con una computadora ha estado limitado por un simple compromiso: se podía tener una imagen clara y coherente, o se podía tener una imagen cargada de detalles intrincados, pero rara vez ambas cosas. La inteligencia artificial moderna, entrenada para convertir descripciones escritas en imágenes, se ha vuelto notablemente buena para capturar la visión general. Puede colocar un castillo sobre una colina o un gato sobre un tapete con una lógica perfecta. Sin embargo, cuando los artistas piden una imagen masiva de alta definición destinada a una pared grande o a una impresión de bellas artes, estos sistemas suelen tener dificultades. Tienden a producir imágenes que se ven nítidas desde la distancia, pero que se desmoronan cuando se miran de cerca, careciendo de las texturas densas y ricas que hacen que una escena se sienta real. La forma estándar de solucionar esto ha sido un proceso de dos pasos: primero, generar una imagen pequeña y de baja resolución para establecer el diseño correctamente, y luego intentar añadir detalles sobre ella. Pero este enfoque tiene un fallo fundamental. Una vez que se crea la imagen pequeña, la computadora no puede volver atrás y cambiar la imagen grande para acomodar los nuevos detalles, lo que conduce a un resultado final donde las texturas finas se sienten pegadas en lugar de tejidas dentro de la escena.

Un equipo de investigadores ha propuesto una forma diferente de resolver este problema, introduciendo un método llamado JoLT, que significa Trayectorias Latentes Conjuntas (Joint Latent Trajectories). En lugar de construir una imagen de abajo hacia arriba, comenzando pequeña y creciendo hacia lo grande, JoLT construye la imagen desde adentro hacia afuera, creando la composición amplia y los detalles finos al mismo tiempo. Imagine a un artista que, en lugar de hacer un boceto de un contorno tosco y luego rellenarlo más tarde, pinta todo el lienzo en un solo movimiento continuo, ajustando constantemente los trazos amplios de una cordillera mientras refina simultáneamente las hojas individuales de un árbol. Este es el núcleo del nuevo enfoque. El sistema ejecuta dos procesos paralelos que se comunican constantemente entre sí. Un proceso se enfoca en el diseño general y la composición, asegurando que la escena tenga sentido globalmente. El otro proceso se enfoca en los detalles de alta resolución, añadiendo textura y complejidad a áreas específicas. Crucialmente, estos dos procesos no son separados; comparten información en cada paso de la creación. El proceso de diseño le dice al proceso de detalle dónde colocar los elementos, y el proceso de detalle devuelve su riqueza evolutiva al proceso de diseño, permitiendo que la escena general se adapte y acomode la nueva complejidad.

Los investigadores probaron este método utilizando un generador de imágenes potente y lo compararon con las mejores técnicas existentes. Pidieron a la computadora que creara imágenes basadas en descripciones complejas que incluían muchos objetos y entornos diferentes, como un atrio de hotel inundado lleno de botes, relojes y árboles. Los resultados fueron impactantes. Las imágenes producidas por JoLT no solo eran más grandes; eran significativamente más complejas y detalladas que las hechas por otros métodos. Cuando los investigadores midieron la densidad de información en las imágenes, las creaciones de JoLT mostraron un aumento masivo en el detalle, con algunas métricas mostrando una mejora del cincuenta por ciento sobre el siguiente mejor método. Más importante aún, estas imágenes mantuvieron la coherencia. Los detalles adicionales no rompieron la escena ni la hicieron parecer caótica; en cambio, se sintieron como una parte natural del mundo representado. El sistema también otorgó a los usuarios un nuevo tipo de control. Al ajustar un parámetro simple, un usuario podía subir o bajar la cantidad de detalle, decidiendo exactamente qué tan intrincada quería la imagen final sin tener que reescribir toda la descripción.

Para ver si estas mejoras importaban a las personas reales, los investigadores realizaron un estudio donde participantes humanos compararon imágenes hechas por JoLT contra imágenes hechas por otros sistemas líderes. Los participantes prefirieron consistentemente las imágenes de JoLT, encontrándolas más detalladas, más visualmente complejas y más atractivas artísticamente. También sintieron que las imágenes coincidían con las descripciones escritas originales tan bien como los otros métodos, demostrando que añadir tanto detalle no tuvo un costo en la precisión. El estudio sugiere que la vieja forma de pensar sobre la generación de imágenes de alta resolución —comenzar pequeño e intentar expandirlo— no es el único camino a seguir. Al tratar la creación de una escena como un proceso único y unificado donde la imagen general y los detalles diminutos evolucionan juntos, es posible generar imágenes que sean tanto masivas en escala como ricas en textura. Esto abre nuevas posibilidades para artistas y creadores que necesitan imágenes que puedan resistir la inspección cercana, convirtiendo a la computadora de una herramienta que hace imágenes simples en un socio capaz de generar mundos densos y de alta fidelidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →