← Últimos artículos
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

Este artículo presenta DyMoS, un método libre de entrenamiento y agnóstico al modelo que mejora la dinámica del movimiento en la generación de video a partir de imágenes al reequilibrar la dominancia del cuadro de referencia en el mecanismo de atención, superando así la supresión del movimiento sin comprometer la fidelidad visual ni requerir entrenamiento adicional.

Autores originales: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

Publicado 2026-05-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Problema: El Video "Congelado"

Imagina que tienes una foto de un caballo y le pides a una computadora que la convierta en un video del caballo corriendo. Esperarías que el caballo galopara. Pero a menudo, los modelos de IA actuales son demasiado "corteses" con la foto original. Mantienen al caballo congelado en su lugar, quizás moviendo solo ligeramente las orejas, porque tienen tanto miedo de cambiar la imagen que les diste.

El artículo llama a esto "Sesgo de Movimiento Estático". La IA está tan enfocada en mantener el primer fotograma (la imagen de referencia) perfecto que olvida hacer que el resto del video se mueva.

El Descubrimiento: El Estudiante "Demasiado Atento"

Los investigadores observaron el funcionamiento interno de estos modelos de IA. Descubrieron un comportamiento específico al que llaman "Dominancia del Marco de Referencia".

Piensa en el modelo de IA como un estudiante que está tomando un examen.

  • El Prompt de Texto es la pregunta: "Haz que el caballo corra".
  • La Imagen de Referencia es una foto del caballo sobre el escritorio.

En un modelo normal de Texto a Video, el estudiante mira la pregunta e imagina al caballo corriendo.
En un modelo de Imagen a Video, el estudiante está mirando demasiado fijamente la foto sobre el escritorio. Cada vez que el estudiante intenta dibujar el siguiente fotograma del video, mira la foto y dice: "Bien, debo hacer que este siguiente fotograma se vea exactamente como la foto".

Como el estudiante está tan obsesionado con copiar la foto, nunca dibuja realmente al caballo moviéndose. La "foto" está dominando la "imaginación".

La Solución: DyMoS (El "Deslizador de Movimiento")

Los investigadores crearon una herramienta llamada DyMoS (Deslizador de Movimiento Dinámico). No requiere reentrenar la IA ni cambiar la foto original. En su lugar, actúa como un botón de volumen para la obsesión del estudiante.

Cómo funciona:

  1. La Intervención: Durante los primeros momentos de la creación del video (los pasos de "desruido"), DyMoS le da un suave golpe en el hombro al estudiante. Le dice: "Oye, deja de mirar tan fijamente la foto de referencia. Necesitas imaginar el movimiento ahora".
  2. El Mecanismo: Técnicamente, ajusta un número específico (un "sesgo") en el sistema de atención de la IA. Reduce ligeramente la puntuación que la IA asigna a los tokens de la imagen de referencia cuando intenta decidir cómo debería verse el siguiente fotograma.
  3. El Resultado: A la IA todavía se le permite ver la foto (así que el caballo sigue pareciendo un caballo), pero ya no está forzada a copiarla perfectamente. Esto libera a la IA para dejar que el caballo corra, el coche conduzca o el agua salpique.

La Función de "Deslizador"

La parte más genial de DyMoS es que es un deslizador, no solo un interruptor de encendido/apagado. El usuario tiene un número que puede ajustar:

  • Bájalo (números negativos): La IA se vuelve más obsesionada con la foto. El video se vuelve aún más estático (útil si quieres una imagen fija que apenas se mueva).
  • Súbelo (números positivos): Se le dice a la IA que ignore más la naturaleza "congelada" de la foto. El video se vuelve muy dinámico y enérgico.
  • Punto medio: Puedes encontrar el equilibrio perfecto donde el video se mueve de forma natural pero el personaje sigue pareciendo exactamente como la foto con la que empezaste.

Por Qué Es Mejor que los Métodos Anteriores

Los intentos anteriores de solucionar este problema de "video congelado" eran como intentar arreglar un coche golpeando el motor o pintando sobre las ruedas.

  • Algunos métodos requerían reentrenar toda la IA (caro y lento).
  • Otros intentaban difuminar o estropear la imagen de entrada para forzar el movimiento, lo que a menudo hacía que el video se viera feo o distorsionado.

DyMoS es diferente porque:

  1. Es Libre de Entrenamiento: No necesitas enseñarle nada nuevo a la IA. Solo usas la herramienta mientras la IA trabaja.
  2. Es Agnóstico al Modelo: Funciona en casi cualquier IA de video moderna (como Wan 2.2, HunyuanVideo, CogVideoX).
  3. Mantiene la Calidad: Hace que el video se mueva sin hacer que la foto se vea borrosa o extraña.

Resumen

El artículo identifica que los modelos de Imagen a Video son "demasiado corteses" con sus imágenes de entrada, lo que provoca que los videos sean aburridos y estáticos. Lo solucionaron con DyMoS, una herramienta sencilla que actúa como un botón de volumen, bajando la obsesión de la IA con la foto inicial lo suficiente como para permitir que ocurra el movimiento, todo sin cambiar el modelo ni la imagen original.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →