← Últimos artículos
💻 computer science

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

InfiniVerse es un flujo de trabajo unificado que genera escenas urbanas de largo alcance realistas, controlables y temporalmente coherentes para la conducción autónoma mediante la reconstrucción de la ocupación 3D a partir de un solo fotograma, extendiéndola de forma autorregresiva y refinándola a través de un paradigma jerárquico de boceto y refinamiento que alinea las salidas de difusión de video con representaciones espaciales 3D.

Autores originales: Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

Publicado 2026-07-01
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un arquitecto intentando construir una película interminable y realista de una calle de la ciudad para que un coche autónomo aprenda de ella. Normalmente, esto es increíblemente difícil. Si simplemente le pides a un ordenador que "siga creando el vídeo", eventualmente empezará a tener alucinaciones: las carreteras podrían retorcerse en formas imposibles, los edificios podrían desaparecer o el coche podría conducir hacia el vacío. Si intentas obligarlo a seguir un mapa estricto, el vídeo se verá rígido y falso.

InfiniVerse es un nuevo sistema que resuelve esto actuando como un maestro constructor que trabaja tanto con un boceto tosco como con una cámara de alta definición.

Así es como funciona, paso a paso:

1. El "Esqueleto 3D" (La rejilla de ocupación)

Primero, el sistema observa una instantánea de una calle (tomada desde varios ángulos, como las cámaras de un coche). En lugar de ver solo una imagen plana, construye un "esqueleto 3D" del mundo. Piensa en esto como una gigantesca rejilla invisible de bloques donde el ordenador decide: "Este bloque es una carretera, este otro es un edificio, este otro es aire vacío".

  • Por qué es importante: Esto le da al sistema una estructura física sólida a la cual aferrarse, para que no pierda el rumbo a medida que el vídeo se alarga.

2. El "Boceto tosco" (Extensión autorregresiva)

Ahora, imagina que quieres que el coche conduzca por una nueva carretera que no existe en la foto original. Dibujas una línea sencilla (un "boceto") en un mapa mostrando por dónde quieres ir.

  • InfiniVerse utiliza este boceto para extender el esqueleto 3D hacia adelante. Rellena nuevos bloques de la ciudad a lo largo de tu trayectoria.
  • En esta etapa, la ciudad todavía es un poco cuadriculada y de baja resolución (como un mundo de Minecraft), pero tiene la forma y la disposición correctas.

3. La "Cámara de alta definición" (Generación de vídeo)

A continuación, el sistema toma ese esqueleto 3D cuadriculado y le pregunta a un potente generador de vídeo por IA: "Haz que esto parezca una película real y fotorrealista".

  • Transforma los bloques toscos en asfalto suave, coches brillantes y árboles realistas.
  • Crucialmente, hace esto mientras mantiene la cámara moviéndose exactamente a lo largo de la trayectoria que trazaste.

4. El "Bucle de retroalimentación" (El ingrediente secreto)

Esta es la parte más importante. Normalmente, los generadores de vídeo por IA se "emborrachan" con su propia creatividad y se desvían de la realidad después de un tiempo. InfiniVerse evita esto mediante una conversación bidireccional:

  1. El 3D guía al 2D: El esqueleto 3D tosco le dice al generador de vídeo: "Mantente en la carretera; no hagas que el edificio flote".
  2. El 2D guía al 3D: Después de que se crea el vídeo, el sistema observa las imágenes bellas y realistas y las proyecta de vuelta al esqueleto 3D. Dice: "Oye, el vídeo muestra un árbol aquí, así que actualiza el esqueleto 3D para incluir un árbol".

Esto crea un bucle cerrado. La estructura 3D evita que el vídeo se vuelva extraño, y el vídeo realista mantiene la estructura 3D precisa. Constantemente se revisan el trabajo el uno al otro.

El Resultado

El artículo afirma que este sistema puede generar vídeos de conducción largos y continuos que se mantienen realistas y físicamente consistentes durante mucho más tiempo que los métodos anteriores.

  • No necesita mapas mágicos: No necesita un mapa perfecto y preexistente del mundo. Construye el mundo sobre la marcha, basándose solo en una foto inicial.
  • Estabilidad: No sufre de la "deriva" donde la carretera se curva hacia una pared o el cielo se vuelve verde.
  • Control: Puedes decirle que gire a la izquierda, vaya recto o gire a la derecha, y construirá una ciudad realista que siga ese camino.

En resumen, InfiniVerse es como un director de cine que se autocorrige, que construye el decorado (3D) y filma la escena (2D) simultáneamente, comprobando constantemente que los actores sigan de pie en el decorado y que el decorado todavía parezca la película. Esto le permite crear escenarios de conducción infinitos y realistas para que los coches autónomos practiquen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →