← Últimos artículos
💻 computer science

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

Este artículo presenta un algoritmo generativo que elimina realistas a las personas y sus sombras de videos de recorridos peatonales en primera persona mediante un modelo de difusión de video ajustado con un conjunto de datos semisintético, permitiendo así la creación de modelos 3D/4D de entornos urbanos sin presencia humana.

Autores originales: Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

Publicado 2026-04-01
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que quieres crear un videojuego o una película de realidad virtual que te permita caminar por las calles de París, Tokio o Nueva York. Lo ideal sería usar videos reales de "tours a pie" que la gente sube a YouTube, porque son gratis, abundantes y muestran el mundo tal como es.

Pero hay un gran problema: están llenos de gente.

En estos videos, la cámara va a la altura de los ojos de una persona, y siempre hay peatones cruzando, grupos de turistas bloqueando la vista, y sombras que se mueven. Si intentas usar esos videos para crear un modelo 3D del mundo, la gente actúa como un "tapón" que impide ver la arquitectura, las paredes y el suelo. Es como intentar limpiar una ventana llena de huellas dactilares para ver el paisaje, pero las huellas son personas que se mueven.

Aquí es donde entra el estudio que acabas de leer. Presentan una herramienta llamada CrowdEraser (que podríamos traducir como "Borrador de Multitudes").

¿Cómo funciona? (La analogía del Chef y el Restaurante)

Imagina que eres un chef que quiere cocinar un plato perfecto (el video limpio), pero todos los ingredientes que tienes (los videos reales) están mezclados con cosas que no quieres (la gente y sus sombras).

  1. El Problema: Si intentas quitar la gente con herramientas antiguas, el resultado se ve borroso, como si hubieras pintado sobre la foto con un pincel sucio. O peor aún, la inteligencia artificial empieza a "alucinar" y pone personas fantasma donde no deberían estar.
  2. La Solución Creativa (El Laboratorio de Cocina): Como es imposible grabar la misma calle dos veces (una vez llena de gente y otra vez vacía) sin que cambie la luz o el viento, los autores decidieron cocinar sus propios ingredientes.
    • Crearon un "laboratorio" donde tomaron videos de calles vacías (o casi vacías) y videos de multitudes.
    • Usaron un programa para "pegar" digitalmente a la gente de los videos concurridos sobre los fondos vacíos.
    • El toque mágico: No solo pegaron a la gente; también les añadieron sombras simuladas. Piensa en esto como si el chef no solo pusiera el tomate en la ensalada, sino que también añadiera el jugo que el tomate deja en el plato para que se vea real. Sin la sombra, la persona parecería un pegote flotando.
  3. El Entrenamiento: Usaron miles de estos videos "falsos" (pero muy realistas) para enseñar a una Inteligencia Artificial (un modelo llamado Casper) cómo eliminar a la gente y sus sombras sin arruinar el fondo. Es como darle al robot millones de ejemplos de "antes y después" para que aprenda el truco.

¿Qué logra CrowdEraser?

Cuando les das un video real de una calle llena de gente a CrowdEraser, este hace lo siguiente:

  • Identifica a cada persona y su sombra.
  • Borra a la persona y su sombra.
  • Rellena el hueco imaginando qué habría estado ahí (una pared, una acera, un árbol) basándose en lo que ve a los lados y en los segundos anteriores y posteriores del video.

El resultado es un video donde la gente desaparece mágicamente, pero el mundo sigue intacto, con sus sombras y texturas perfectas.

¿Por qué es importante? (El ejemplo del Arquitecto)

El paper demuestra que esto es útil para algo muy concreto: construir mapas 3D del mundo.

Imagina un arquitecto que quiere crear un modelo digital de una ciudad para que los coches autónomos aprendan a conducir.

  • Sin CrowdEraser: El modelo 3D sale lleno de "baches" y formas raras porque la gente bloqueó la vista de las paredes. Es como intentar hacer un mapa de un país mientras alguien te tapa los ojos con un cartel.
  • Con CrowdEraser: Al eliminar a la gente, el arquitecto puede ver la estructura real de la ciudad. El modelo 3D sale nítido, con los patrones de los adoquines y las texturas de los edificios perfectamente definidos.

En resumen

Los autores crearon un "escáner de realidad" que limpia el ruido humano de los videos de viajes. Lo hicieron inventando un método para crear datos de entrenamiento (mezclando y pegando videos) y entrenando a una IA para que sea un experto en "borrar y rellenar" sin dejar rastro.

Es como tener una varita mágica que convierte un video caótico de una plaza llena de turistas en un recorrido tranquilo y solitario por la misma plaza, listo para ser usado en videojuegos, robótica o mapas del futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →