← Últimos artículos
💻 computer science

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

Este trabajo presenta InstructAV2AV, el primer marco de extremo a extremo para la edición conjunta de audio y video guiada por instrucciones, que aprovecha un nuevo conjunto de datos a gran escala (InsAVE-80K) y una estrategia de entrenamiento especializada en dos etapas para superar a los métodos existentes en la generación de contenido editado sincronizado y de alta calidad.

Autores originales: Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

Publicado 2026-05-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un video casero de un amigo dando un discurso. Ahora, imagina que quieres cambiar lo que está diciendo, o incluso sustituirlo por una persona completamente diferente, pero deseas que el ruido de fondo, la iluminación y la sincronización permanezcan perfectamente naturales.

Por lo general, editar video y editar audio son dos trabajos separados. Si cambias el video, el audio a menudo se desincroniza o suena extraño (como una voz en off que no coincide con los labios). Este artículo presenta InstructAV2AV, una nueva herramienta que trata el video y el audio como un paquete único e inseparable. Le das una instrucción de texto simple y reescribe tanto la imagen como el sonido juntos, instantáneamente.

Así es como funciona, desglosado en conceptos simples:

1. La "Receta Mágica" (El Problema de los Datos)

Para enseñar a una computadora a hacer esto, necesitas miles de ejemplos de videos "Antes" y "Después". Pero nadie tiene una biblioteca de videos donde alguien diga "Hola" y luego mágicamente cambie a decir "Adiós" mientras el fondo permanece igual.

Los autores construyeron una fábrica de datos (llamada InsAVE-80K). Piensa en esto como una cocina de alta tecnología:

  • Tomaron videos crudos de internet.
  • Utilizaron un "chef robot" guiado por máscaras para recortar partes específicas (como el rostro de una persona o un automóvil).
  • Usaron inteligencia artificial para generar nuevo audio y video para esas partes específicas basándose en instrucciones de texto (por ejemplo, "Cambia al hombre por una mujer").
  • Luego, insertaron estas nuevas partes de nuevo en el video original, manteniendo el fondo intacto.
  • Finalmente, hicieron que humanos y computadoras inteligentes probaran los resultados para asegurarse de que parecían y sonaban reales. Esto creó un enorme libro de cocina con 80.000 ejemplos de entrenamiento.

2. El "Editor Inteligente" (El Modelo)

El núcleo del sistema es un Cerebro de Doble Flujo. Imagina a un director de orquesta liderando dos orquestas a la vez: una para la escena visual (video) y otra para el sonido (audio).

  • El Ancla: Cuando pides una edición, el sistema no solo adivina. Mira el video y el audio originales como un "ancla de seguridad" para asegurarse de que no cambie accidentalmente el cielo, los árboles o el ruido de fondo.
  • La Instrucción: Escribes un comando como: "Cambia al hombre por una mujer joven con cabello castaño diciendo 'Creo que deberíamos intentarlo de nuevo'".
  • La Atención Puenteada (SIGA): Este es el ingrediente secreto del artículo. Imagina un dimmer o un semáforo para cada momento individual del video.
    • Si la luz está en Rojo, el sistema dice: "Mantén el video/audio original exactamente como está" (preservando el fondo).
    • Si la luz está en Verde, dice: "Cambia esta parte para que coincida con la instrucción".
    • Este interruptor se ajusta automáticamente, por lo que el sistema sabe exactamente qué cambiar y qué dejar intacto, asegurando que la nueva voz coincida perfectamente con el nuevo rostro.

3. La "Danza de Dos Pasos" (Estrategia de Entrenamiento)

Enseñar a una computadora a editar video y audio simultáneamente es difícil. Si intentas enseñarle todo a la vez, se confunde.

Los autores utilizan una Estrategia de Entrenamiento en Dos Etapas:

  1. Paso 1 (Práctica en Solitario): Primero, enseñan a la parte de video a editar, y a la parte de audio a editar, por separado. Aprenden sus propios movimientos sin preocuparse por el otro.
  2. Paso 2 (El Dúo): Una vez que son buenos actuando en solitario, se les enseña a bailar juntos. Aprenden a sincronizarse perfectamente para que, cuando el video muestre un motor de automóvil arrancando, el audio reproduzca el rugido del motor en el mismo milisegundo exacto.

¿Qué Puede Hacer?

El artículo demuestra cuatro "movimientos" principales usando solo instrucciones de texto:

  • Intercambio de Identidad: Cambiar a un hombre por una mujer (o viceversa) manteniendo la voz y los movimientos de los labios sincronizados.
  • Reescritura de Discurso: Mantener el rostro y la voz de la persona, pero cambiar las palabras que está diciendo por algo nuevo.
  • Inserción: Añadir un nuevo objeto (como un automóvil vintage pasando) y generar el sonido de motor correspondiente.
  • Eliminación: Borrar un objeto (como una ardilla sobre una roca) y silenciar su chillido, haciendo que parezca que nunca estuvo allí.

La Conclusión

En resumen, InstructAV2AV es el primer sistema que te permite editar la historia de un video y su banda sonora simultáneamente usando solo un prompt de texto. No se limita a pegar un nuevo sonido sobre un video antiguo; entiende que si cambias lo visual, el sonido debe cambiar también, y si cambias el sonido, lo visual debe coincidir. Lo hace aprendiendo de una enorme biblioteca autoconstruida de ejemplos y utilizando un "dimmer" inteligente para decidir exactamente qué mantener y qué cambiar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →