← Últimos artículos
💻 computer science

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Baton es un nuevo marco que mejora la generación conjunta de video y audio mediante la introducción de un VA-Planner para crear "planos" explícitos y semánticamente alineados, y un mecanismo de RoPE Semántico Relativo, superando así las limitaciones de orientación y coordinación de los modelos de difusión existentes para producir contenido audiovisual estable, sincronizado y de granularidad fina.

Autores originales: Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

Publicado 2026-05-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando dirigir una escena de película donde los actores (el video) y los efectos de sonido (el audio) deben ocurrir perfectamente sincronizados.

El Problema: El "Director Vago"
Los modelos actuales de IA para crear video y audio son como directores que solo dan instrucciones muy vagas. Podrían decir: "¡Hazlo emocionante!" y luego encomendar el trabajo a dos equipos separados: uno para el equipo de cámara y otro para el equipo de sonido.

  • El equipo de cámara escucha "emocionante" y comienza a filmar explosiones.
  • El equipo de sonido escucha "emocionante" y comienza a reproducir música fuerte.
  • El Resultado: La explosión ocurre después de que comienza la música, o el sonido no coincide con la acción. Como los equipos no tenían un plan compartido y detallado, se desvían, lo que lleva a extraños errores, rostros distorsionados o sonidos que no coinciden con los labios.

La Solución: Los "Planes" de Baton
El artículo presenta un nuevo sistema llamado Baton. En lugar de dar solo una orden vaga, Baton actúa como un arquitecto maestro que dibuja un plan detallado antes de que comience la construcción.

Así es como funciona, paso a paso:

1. El Arquitecto (VA-Planner)

Antes de que la IA comience a "dibujar" el video o a "mezclar" el audio, primero ejecuta un módulo de planificación especial llamado VA-Planner.

  • Lo que hace: Lee tu prompt (por ejemplo, "Un soldado se estremece cuando una explosión lo impacta") y lo desglosa en un cronograma preciso, paso a paso.
  • La Analogía: Piensa en esto como escribir un guion que dice: "En el segundo 1, el soldado mira a la izquierda. En el segundo 1.5, ocurre el sonido del estruendo. En el segundo 2, se tapa los oídos."
  • La Magia: Crea dos listas sincronizadas de "tokens planificados" (notas digitales). Una lista es para el video, otra para el audio. Crucialmente, estas listas se escriben juntas, por lo que saben exactamente cuándo coincidir. Esto evita que el equipo de video y el equipo de audio adivinen.

2. El Lugar de Construcción (El Modelo de Difusión)

Una vez que el plan está listo, ocurre la generación real. La IA utiliza un motor potente (llamado DiT) para crear el video y el audio.

  • El Problema con los Planes: Por lo general, el plan (el proyecto) y el lugar de construcción (los fotogramas del video que se están dibujando) hablan idiomas diferentes. El plan podría decir "Segundo 1", pero el lugar de construcción está contando en "píxeles" y "fotogramas". No se alinean perfectamente, como intentar encajar un clavo cuadrado en un agujero redondo.
  • La Solución (Relative Semantic RoPE): Baton inventa un traductor especial llamado Relative Semantic RoPE.
    • La Analogía: Imagina que el plan y el lugar de construcción son dos mapas diferentes de la misma ciudad. Un mapa usa "millas" y el otro usa "cuadras urbanas". El traductor convierte las "millas" del plan en "cuadras urbanas" para el lugar de construcción en tiempo real.
    • El Resultado: Ahora, cuando el lugar de construcción está trabajando en la "Cuadra 5", sabe exactamente qué parte del plan consultar. Asegura que el sonido de un puñetazo ocurra en el momento exacto del píxel en que el puño conecta.

3. El Resultado: Una Película Perfectamente Sincronizada

Como Baton separa el pensamiento (planificar la historia) del hacer (dibujar los píxeles), resuelve el problema más grande en el video de IA: la estabilidad.

  • Antigua Forma: La IA adivina toda la historia de una vez, se confunde y el video se deforma o el audio se desvía.
  • Forma Baton: La IA primero acuerda una línea de tiempo compartida (el plan) y luego sigue esa línea de tiempo estrictamente. Incluso para escenas complejas con múltiples personas hablando, objetos en movimiento y sonidos cambiantes, el video y el audio permanecen bloqueados juntos.

En Resumen
El artículo afirma que al obligar a la IA a planificar la historia primero (usando el VA-Planner) y luego traducir ese plan perfectamente al proceso de dibujo (usando Relative Semantic RoPE), podemos generar video y audio que sean estables, sincronizados y que sigan instrucciones complejas mucho mejor que los modelos de código abierto anteriores. Convierte una improvisación caótica en una actuación bien ensayada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →