← Últimos artículos
💻 computer science

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

Este artículo introduce el Muestreo de Áncora Árbol (ATS), un planificador de inferencia sin entrenamiento que mitiga la deriva y los problemas de continuidad en videos de largo horizonte al reemplazar las proyecciones autorregresivas secuenciales con una estrategia de imputación jerárquica acotada por anclas, logrando una calidad y estabilidad superiores en la generación de video a video con cámara estática.

Autores originales: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

Publicado 2026-05-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que intentas pintar un mural masivo de 40 minutos de una historia, pero solo tienes un lienzo pequeño que cabe 10 segundos de arte a la vez.

La Vieja Forma (Generación Autoregresiva): El "Efecto Dominó"
Actualmente, la mayoría de los generadores de video de IA funcionan como una fila de fichas de dominó. Para hacer un video largo, la IA pinta los primeros 10 segundos, luego usa esa pintura para adivinar cómo deberían verse los siguientes 10 segundos, luego usa esa para adivinar los siguientes, y así sucesivamente.

El artículo llama a esto "Deriva". Al igual que en un juego de "Teléfono", ocurren pequeños errores en cada fragmento de 10 segundos. Para cuando la IA llega al minuto 30, el rostro del personaje podría haberse transformado en un monstruo, el fondo podría haber cambiado de color, o la historia podría haber perdido su trama. La IA también tiene que esperar a que el fragmento anterior termine antes de comenzar el siguiente, lo que hace que el proceso sea muy lento.

La Nueva Forma (Muestreo de Árbol Anclado): El "Andamio de Construcción"
Los autores, de Descript, Inc., proponen una forma más inteligente llamada Muestreo de Árbol Anclado (ATS). En lugar de pintar el mural una pequeña tira a la vez, construyen un andamio.

Así es como funciona, usando una analogía de construcción:

  1. La Llamada Raíz (Fijando los Postes): Primero, la IA mira la historia completa de 40 minutos de una sola vez. No intenta pintar cada fotograma. En su lugar, coloca unos pocos "postes ancla" (fotogramas dispersos) en momentos clave: el muy principio, el muy final, y algunos puntos intermedios. Piensa en estos como los pilares principales que sostienen un puente.
  2. El Refinamiento (Llenando los Huecos): Ahora, la IA mira el espacio entre el primer poste y el segundo poste. Pinta el espacio entre ellos, sabiendo exactamente cómo se ven el inicio y el final. Hace lo mismo para el espacio entre el segundo y el tercer poste.
  3. Las Hojas (Los Detalles Finales): Finalmente, rellena los pequeños huecos entre esas secciones recién pintadas hasta que todo el video esté completo.

Por Qué Esto Es Un Cambio de Juego

  • Sin Más Deriva: Porque cada sección del video está "anclada" por un punto de inicio y un punto final conocidos, la IA no puede desviarse. Si le dices que pinte un coche rojo al principio y un coche rojo al final, mantendrá el coche rojo en el medio. No tiene que adivinar basándose en un fotograma anterior borroso y lleno de errores.
  • Super Velocidad: La vieja forma es como una sola persona pintando una pared de izquierda a derecha. La nueva forma es como un equipo de pintores. Una vez que se fijan los "postes", diferentes equipos pueden pintar las diferentes secciones de la pared al mismo tiempo. Esto hace que generar videos largos sea mucho más rápido.
  • Consistencia: El video se mantiene fiel a las instrucciones originales (como una pose específica o un dibujo de bordes) de principio a fin sin que el personaje cambie repentinamente de ropa o el fondo se desplace.

Donde Funciona Mejor (y Donde Tiene Dificultades)
El artículo muestra que este método funciona increíblemente bien para videos de cámara estática (donde la cámara no se mueve salvajemente, como una persona hablando a la cámara o un plano fijo de una escena). En estos casos, la IA puede predecir fácilmente los "postes ancla" porque el fondo no cambia mucho.

Sin embargo, los autores admiten que tiene límites por ahora:

  • Cámaras Dinámicas: Si la cámara está volando por una ciudad o girando, la IA a veces tiene dificultades para adivinar los "postes ancla" correctamente porque la vista cambia demasiado.
  • Nuevos Personajes: Si un nuevo objeto o persona aparece en medio del video que no estaba en los "anclajes" de inicio o final, la IA podría dibujarlo ligeramente diferente a como lo habría hecho si hubiera aparecido antes.
  • Texto-a-Video: Actualmente, esto funciona mejor cuando le das a la IA un video para modificar (Video-a-Video). Es más difícil de usar si solo escribes una instrucción de texto, porque la IA necesita esos "postes ancla" para empezar.

La Conclusión
El artículo introduce una estructura de "árbol" que divide los videos largos en fragmentos manejables y conectados. Al anclar el video en puntos específicos y rellenar los espacios en blanco en paralelo, resolvieron el problema de que los videos se volvieran "descuidados" con el tiempo y hicieron el proceso significativamente más rápido. Generaron con éxito videos de 40 minutos que mantuvieron consistencia y alta calidad, algo que los métodos anteriores tenían dificultades para lograr sin errores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →