← Últimos artículos
💻 computer science

Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation

Este artículo propone un marco de trabajo de flujo de trabajo de tres etapas y libre de entrenamiento que preserva la identidad del sujeto en la generación de videos de acciones secuenciales mediante la reescritura de prompts para estados terminales, la generación de fotogramas clave a través del condicionamiento conjunto de la identidad de referencia y los fotogramas predecesores, y la mejora de los segmentos intermedios con guía de múltiples referencias y búsqueda de ruido impulsada por la identidad.

Autores originales: Zhenjie Liu, Binyan Chen, Hao Chen, Tong Pan, Shangfei Wang

Publicado 2026-07-21
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Zhenjie Liu, Binyan Chen, Hao Chen, Tong Pan, Shangfei Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un director intentando filmar una película con un actor muy especial y obstinado. Este actor es un personaje digital creado por un programa informático llamado "modelo de difusión". Piensa en este modelo como un artista mágico y caótico que es increíblemente bueno pintando imágenes basadas en tus descripciones, pero que tiene una memoria terrible. Si le pides que dibuje la imagen de un "hombre con barba leyendo un libro", puede que dibuje un hombre perfecto. Pero si luego le pides que dibuje al mismo hombre de pie y saludando, el artista podría confundirse. La barba podría desaparecer, la forma de la cara podría cambiar, o el hombre podría parecer de repente una persona completamente distinta. Esto es el problema de la "deriva de identidad". En el mundo de la generación de vídeo por IA, mantener la apariencia de un personaje exactamente igual mientras se mueve y cambia de acciones es como intentar evitar que un copo de nieve se derrita mientras lo caminas sobre una acera caliente.

Ahora, imagina que no solo quieres que el actor haga una cosa; quieres que interprete todo un guion. Primero, lee un libro. Luego, mira hacia el cielo. Después, vuelve a mirar hacia abajo. Hacer esto en un solo estallido continuo es una pesadilla para la IA porque, cuanto más largo es el vídeo, más tiende la cara del personaje a "derivar" y cambiar. Este artículo aborda un desafío específico donde el objetivo es generar un vídeo de una persona específica realizando una secuencia de diferentes acciones, todo ello asegurando que la persona en el vídeo se vea exactamente igual que la foto de referencia con la que empezaste. Los investigadores de la Universidad de Ciencia y Tecnología de China decidieron dejar de intentar filmar toda la película en una sola toma. En su lugar, idearon una forma ingeniosa de dividir la película en escenas manejables, anclar el rostro del personaje al final de cada escena y luego unir las piezas para que el actor nunca olvide quién es.

El truco de magia de tres etapas

Los autores proponen un flujo de trabajo "libre de entrenamiento" (training-free), que es una forma elegante de decir que no necesitaron reenseñar a la IA cómo dibujar; solo necesitaban darle mejores instrucciones y un mejor flujo de trabajo. Llaman a su método "Preservación de Identidad Anclada a Keyframes", lo cual suena complicado pero es en realidad bastante lógico. Piensa en ello como construir un puente sobre un río. En lugar de intentar colocar toda la carretera de una vez (lo que podría colapsar), construyes pilares fuertes y sólidos (keyframes o fotogramas clave) en puntos específicos y luego rellenas la carretera entre ellos.

Etapa 1: El doctor del guion (Pulido de prompts consciente de la acción)
Primero, el equipo se dio cuenta de que las instrucciones dadas a la IA eran demasiado vagas. Los prompts originales eran como un director gritando: "¡Vale, ahora lee, luego mira hacia arriba!" a un artista que necesita una imagen clara del resultado final de cada acción. La IA se confundía sobre cuándo dejar de leer y cómo mirar hacia arriba.

Para solucionar esto, los investigadores utilizaron un asistente de IA inteligente (un Modelo de Lenguaje Grande o LLM) para reescribir el guion. En lugar de describir la acción de leer, el asistente reescribió el prompt para describir el estado del personaje después de leer. Es la diferencia entre decir "El hombre está girando la cabeza" y "El hombre ahora está mirando hacia la izquierda". Al centrarse en el "estado terminal" (la pose final) de cada acción, la IA obtiene un objetivo claro al que apuntar. Esto asegura que, cuando la IA genera el "keyframe" (el punto de anclaje), sepa exactamente cómo debería verse el personaje en ese momento específico.

Etapa 2: La reacción en cadena (Generación de keyframes de preservación de ID)
Después viene el dibujo real de los puntos de anclaje. Los investigadores no pidieron a la IA que dibujara todo el vídeo a la vez. En su lugar, le pidieron que dibujara una cadena de imágenes fijas, una tras otra.

  • Para dibujar la primera imagen, le mostraron a la IA la foto de referencia (la persona original) y el primer prompt reescrito.
  • Para dibujar la segunda imagen, le mostraron a la IA la misma foto de referencia (para mantener la cara igual) Y la primera imagen que acababan de hacer (para mantener la continuidad de la posición del cuerpo).
  • Repitieron esto para cada acción en el guion.

Esto es la parte de la "cadena". Al alimentar la imagen anterior en el siguiente paso, la IA sabe cómo mover el cuerpo de forma natural sin perder la conexión con la cara original. Es como un juego de "teléfono descompuesto" donde susurras las instrucciones, pero en lugar de que el mensaje se distorsione, estás pasando un boceto físico que asegura que el siguiente artista sepa exactamente dónde terminó el anterior. Esto separa la "identidad" (la cara, que permanece igual) de la "pose" (el cuerpo, que cambia), resolviendo el problema de la deriva.

Etapa 3: La red de seguridad (Mejora de inferencia consciente de la ID)
Finalmente, la IA tiene una serie de imágenes fijas (los keyframes), pero necesita rellenar el movimiento entre ellas para crear un vídeo fluido. Aquí es donde ocurre la magia. Los investigadores añadieron dos trucos especiales al proceso de generación de vídeo para asegurar que el personaje no cometa errores durante el movimiento.

  1. Guía de Referencia Múltiple: Imagina que estás intentando dibujar un cuadro mientras alguien te susurra tres cosas al oído: la descripción de texto, el fotograma anterior y la foto original. La IA suele escuchar al texto y al fotograma anterior. Los investigadores obligaron a la IA a escuchar extra atentamente a la foto original. Ajustaron las matemáticas para que la señal de "identidad" se amplificara, haciendo que fuera mucho más difícil que la IA cambiara accidentalmente el rostro del personaje mientras movía el cuerpo.
  2. Búsqueda de Ruido: Cuando una IA genera un vídeo, comienza con una pantalla llena de ruido estático (como la nieve de la televisión) y la limpia lentamente para revelar la imagen. Normalmente, la IA simplemente elige un parche de nieve aleatorio para empezar. Los investigadores decidieron ser exigentes. Generaron varios parches de "nieve" diferentes y los probaron rápidamente para ver cuál resultaba en el mejor rostro. Eligieron al ganador y lo usaron como punto de partida. Es como probar diferentes semillas para ver cuál produce la mejor flor antes de plantar todo el jardín.

Los resultados: ¿Funcionó?

El equipo probó su método en una competición llamada IPVG26 (Track 2), donde el objetivo era generar vídeos de personas específicas realizando secuencias de acciones. No solo conjetraron; midieron sus resultados frente a otros equipos punteros.

Su enfoque ocupó el tercer lugar en la tabla de clasificación oficial. Aunque no obtuvieron el primer lugar, los resultados fueron impresionantes, especialmente en las áreas que más importaban: mantener la cara de la persona reconocible (Preservación de Identidad) y asegurar que las acciones ocurrieran en el momento adecuado (Alineación Temporal).

Cuando probaron su sistema, descubrieron que la "Guía de Referencia Múltiple" era el motor principal. Cuando eliminaron esta característica, la puntuación para mantener la consistencia de la identidad cayó significativamente (de 0.4055 a 0.3520). Esto demostró que decirle explícitamente a la IA que se centrara en la foto de referencia era la clave para evitar que la cara derivara. La "Búsqueda de Ruido" también ayudó, pero fue un impulso menor.

El artículo también comparó dos "backbones" (motores de vídeo subyacentes) diferentes. Descubrieron que un modelo llamado LTX-2.3 funcionaba mejor que otro llamado Wan2.1-VACE en casi todas las métricas. El modelo LTX-2.3 logró una puntuación general de 0.4971, frente al 0.4818 del otro modelo.

Qué significa esto

El artículo no pretende haber resuelto el problema de la generación de vídeo por IA para siempre. No dice que el personaje nunca cambiará, ni que el método funcione perfectamente para cada escenario posible. En cambio, sugiere que dividir una tarea de vídeo compleja en pasos más pequeños y anclados es una forma muy eficaz de gestionarla.

Al tratar el vídeo como una cadena de "estados terminales" (el final de cada acción) en lugar de un flujo continuo, los investigadores lograron mantener intacta la identidad del personaje incluso cuando las acciones eran complejas y secuenciales. Demostraron que no siempre es necesario reentrenar a la IA desde cero; a veces, solo necesitas darle un mejor mapa, un ancla más fuerte y un poco de ayuda extra cuando elige por dónde empezar. Para cualquiera que intente crear historias digitales con personajes consistentes, este enfoque "anclado a keyframes" ofrece una forma fiable y libre de entrenamiento de mantener al actor en su papel, sin importar cuántas escenas tenga que interpretar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →