← Últimos artículos
💻 computer science

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

El artículo presenta Canvas360, un marco de dos etapas que aprovecha un conjunto de datos de 1 millón de muestras recién creado y técnicas de preentrenamiento conscientes de la geometría para lograr un rendimiento de vanguardia en diversas tareas de generación panorámica de contexto mientras asegura una consistencia geométrica y coherencia global superiores.

Autores originales: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

Publicado 2026-07-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando pintar un panorama perfecto de 360 grados de una habitación en una hoja de papel plana. ¿El problema? Cuando envuelves un mapa plano alrededor de una esfera, la parte superior e inferior se aplastan y se estiran como una extraña pizza de queso derretido. La mayoría de los generadores de arte por IA intentan solucionar esto usando mapas de "cubo" especiales o trucos en 3D, pero los autores de este artículo, Canvas360, sugieren que esos métodos aún dejan la geometría con un aspecto algo extraño. Argumentan que si quieres un mundo panorámico verdaderamente fluido y sin distorsiones, no puedes limitarte a mirar la imagen; necesitas comprender la profundidad y la forma del espacio mismo.

Entonces, ¿cómo lo arreglaron? Construyeron una canalización de entrenamiento de dos etapas que actúa como un maestro arquitecto y luego como un pintor versátil.

Etapa 1: El Campo de Entrenamiento de Geometría
Primero, el equipo enseñó a su modelo de IA a ver el mundo en 3D, no solo en 2D. No se limitaron a mostrarle imágenes al modelo; emparejaron cada una de las imágenes con un mapa de profundidad (un plano que muestra qué tan lejos está cada objeto). Alimentaron al modelo con 100,000 de estos ejemplos emparejados.

Para asegurarse de que el modelo no se confundiera entre la imagen y el plano, utilizaron un truco ingenioso: le dieron al mapa de profundidad un "desplazamiento posicional", como darle un número de asiento diferente en un teatro para que supiera que no es la misma imagen que tiene al lado. También añadieron una regla especial llamada "pérdida de similitud", que básicamente regañaba al modelo si la imagen y el mapa de profundidad empezaban a parecerse demasiado, obligándolos a mantenerse distintos.

La parte más genial fue que introdujeron el relleno circular de velocidad (velocity circular padding). Imagina un mundo de videojuegos donde, si caminas fuera del borde derecho de la pantalla, apareces instantáneamente en el lado izquierdo. Los autores se aseguraron de que la IA entendiera que los bordes izquierdo y derecho de un panorama son en realidad vecinos en una esfera. No se limitaron a copiar y pegar los bordes; le enseñaron al modelo que la "velocidad" (la dirección del cambio) en el borde debe fluecer perfectamente hacia el otro lado. Esto ayudó al modelo a aprender a mantener las costuras invisibles.

Etapa 2: El Pintor Versátil
Una vez que el modelo comprendió la geometría, pasaron a la segunda etapa: enseñarle a ser un maestro de la generación en contexto. Esto significa que la IA ahora puede tomar una imagen existente y un comando de texto para realizar todo tipo de trucos mágicos sin necesidad de los mapas de profundidad. Lo entrenaron con un nuevo conjunto de datos masivo llamado Canvas360Dataset, que contiene 1 millón de muestras de alta calidad.

Este conjunto de datos se construyó sintetizando 900,000 nuevos ejemplos que cubren cuatro tareas específicas:

  • Transferencia de Estilo: Convertir una foto en un boceto a lápiz o una pintura (200,000 muestras).
  • Outpainting: Expandir la vista más allá de los bordes originales (250,000 muestras).
  • Inpainting: Rellenar huecos faltantes en la imagen (250,000 muestras).
  • Edición: Eliminar objetos (como un sofá) o añadir nuevos (200,000 muestras).

Los autores argumentan explícitamente en contra de la idea de que se necesitan modelos separados para cada una de estas tareas o de depender de los antiguos métodos de "mapa de cubo". En su lugar, sugieren que un modelo único y unificado, preentrenado en geometría, puede manejar todos estos trabajos de mejor manera.

¿Funcionó?
Los resultados sugieren una fuerte mejora. Cuando probaron el modelo, obtuvo la mejor puntuación en una métrica específica llamada FAED (que mide qué tan fiel es el panorama a la geometría) y funcionó muy bien en otras comprobaciones de calidad. En un estudio con usuarios de 71 personas observando 10 imágenes, Canvas360 fue el favorito por tener los límites más fluidos y la mejor calidad general.

Los autores señalan que, mientras que los métodos anteriores a menudo dejaban bordes borrosos u objetos distorsionados al editar un panorama, Canvas360 logró mantener intacta la estructura 3D. No afirmaron haber resuelto todos los problemas del universo, pero sus experimentos sugieren que, al enseñar a la IA a respetar la forma esférica del mundo desde el principio, crearon una herramienta que genera imágenes panorámicas mucho más consistentes y realistas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →