← Últimos artículos
💻 computer science

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE es un marco de ajuste fino eficiente para la eliminación de objetos en video basado en DiT que acelera la inferencia mediante la selección adaptativa de tokens esenciales a través de Indexación de Longitud Variable por Lotes y la simulación de regiones no enmascaradas con un Simulador de Proceso de Difusión, logrando una aceleración de hasta 2.5X mientras mantiene la calidad visual.

Autores originales: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

Publicado 2026-05-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un video de una calle concurrida y quieres eliminar a una persona específica que cruza el encuadre. En el pasado, los modelos de IA que intentaban hacer esto eran como un equipo de pintores que, en lugar de simplemente pintar sobre la persona, decidían repintar toda la calle, el cielo y cada coche del fondo cada vez que hacían un cambio. Esto era increíblemente lento y desperdiciado porque el 90% del video no necesitaba ser tocado.

Este artículo presenta YOSE (You Only Select Essential Tokens), un nuevo método que actúa como un editor quirúrgico e inteligente. En lugar de repintar todo el lienzo, YOSE solo pinta los puntos específicos que necesitan reparación, asegurándose al mismo tiempo de que la nueva pintura se mezcle perfectamente con las partes intactas.

Así es como funciona YOSE, desglosado en conceptos simples:

1. El Problema: El Enfoque de "Todo el Lienzo"

Las herramientas actuales de video con IA (basadas en algo llamado "DiT") son muy buenas eliminando objetos, pero son lentas. Incluso si solo quieres eliminar un pequeño pájaro de un video, la computadora procesa cada píxel de todo el video. Es como usar un martillo neumático para romper una nuez. El artículo señala que incluso las mejores herramientas existentes solo funcionan a aproximadamente 10 cuadros por segundo (FPS), lo cual es demasiado lento para un uso en tiempo real.

2. La Solución: Dos Herramientas Inteligentes

YOSE añade dos "artilugios" especiales a la IA existente para hacerla más rápida sin arruinar la calidad.

Artilugio A: El "Recortador Inteligente" (Indexación de Longitud Variable por Lotes)

  • La Analogía: Imagina que tienes una pila de 100 tareas escolares, pero solo 5 de ellas tienen errores. Un profesor normal califica las 100 tareas una por una. YOSE es como un profesor que instantáneamente recorta las 5 tareas con errores, califica solo esas y luego las vuelve a colocar en la pila.
  • Cómo funciona: La IA observa la "máscara" (el área que quieres cambiar). Utiliza una técnica llamada BVI para seleccionar físicamente solo los puntos de datos (tokens) dentro de esa máscara. Ignora el resto del video durante el trabajo pesado. Esto permite que la computadora trabaje en un número variable de elementos dependiendo del tamaño del objeto, en lugar de un número fijo y enorme.

Artilugio B: El "Susurrador Fantasma" (Simulador de Proceso de Difusión)

  • La Analogía: Si solo pintas el pequeño parche donde estaba la persona, la nueva pintura podría parecerse a una pegatina que no coincide con la iluminación o la textura de la calle que la rodea. Necesitas saber cómo se ve el resto de la calle para mezclar la nueva pintura.
  • El Problema: Si recortas las partes "malas" para ahorrar tiempo, la IA olvida cómo se ven las partes "buenas". Pierde el contexto.
  • La Solución: YOSE utiliza un módulo llamado DiffSim. No procesa realmente las partes "buenas" del video (lo cual sería lento). En su lugar, crea una simulación o un "fantasma" de lo que esas partes buenas están haciendo. Susurra a la IA: "Oye, el cielo por aquí es azul y el coche por allá se mueve hacia la izquierda", para que la IA sepa cómo mezclar el nuevo parche de manera perfecta. Es como tener un mapa de toda la ciudad mientras solo caminas por un vecindario.

3. La "Costura Perfecta" (Estrategia de Fusión)

Incluso con el susurrador fantasma, podría haber una línea diminuta visible donde el nuevo video se encuentra con el video antiguo. YOSE utiliza un truco final: superpone ligeramente los bordes y ajusta las estadísticas de brillo y color (media y varianza) para hacer la transición invisible. Es como difuminar los bordes de un recorte de foto para que desaparezca en el fondo.

Los Resultados: Rápido y Limpio

El artículo afirma que al usar estos trucos:

  • Velocidad: YOSE es 2.5 veces más rápido que los mejores métodos anteriores. Si el método antiguo tardaba 10 segundos, YOSE tarda unos 4.
  • Escalabilidad: La velocidad depende del tamaño del objeto que eliminas. Si eliminas una mota diminuta, es súper rápido. Si eliminas un edificio enorme, se ralentiza, pero nunca se vuelve más lento que el método antiguo.
  • Calidad: La calidad del video permanece tan buena como los métodos de procesamiento completo y lentos. De hecho, como no arruina accidentalmente el fondo (ya que lo ignora), el fondo a menudo se ve más estable.

Resumen

YOSE es un "editor inteligente" que se da cuenta de que no necesitas re-simular todo el universo para eliminar un solo objeto. Recorta el trabajo que no necesita hacer, utiliza una simulación inteligente para recordar el contexto de las partes que ignoró y une todo de nuevo tan perfectamente que no puedes notar la diferencia. Convierte un proceso lento y pesado en uno rápido y quirúrgico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →