← Últimos artigos
💻 computer science

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

Este artigo apresenta o InstructAV2AV, o primeiro framework de ponta a ponta para edição conjunta de áudio e vídeo guiada por instruções, que aproveita um novo conjunto de dados em larga escala (InsAVE-80K) e uma estratégia de treinamento especializada em duas etapas para superar os métodos existentes na geração de conteúdo editado sincronizado e de alta qualidade.

Autores originais: Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

Publicado 2026-05-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um vídeo caseiro de um amigo dando um discurso. Agora, imagine que você quer mudar o que ele está dizendo, ou até mesmo trocá-lo por uma pessoa completamente diferente, mas deseja que o ruído de fundo, a iluminação e o sincronismo permaneçam perfeitamente naturais.

Geralmente, editar vídeo e editar áudio são duas tarefas separadas. Se você altera o vídeo, o áudio frequentemente fica dessincronizado ou soa estranho (como uma narração que não corresponde aos lábios). Este artigo apresenta o InstructAV2AV, uma nova ferramenta que trata vídeo e áudio como um único pacote inseparável. Você fornece um comando de texto simples, e ele reescreve tanto a imagem quanto o som juntos, instantaneamente.

Veja como funciona, dividido em conceitos simples:

1. A "Receita Mágica" (O Problema dos Dados)

Para ensinar um computador a fazer isso, são necessários milhares de exemplos de vídeos "Antes" e "Depois". Mas ninguém possui uma biblioteca de vídeos onde alguém diz "Olá" e, em seguida, muda magicamente para dizer "Tchau", enquanto o fundo permanece o mesmo.

Os autores construíram uma fábrica de dados (chamada InsAVE-80K). Pense nisso como uma cozinha de alta tecnologia:

  • Eles pegaram vídeos brutos da internet.
  • Usaram um "chef robô" guiado por máscaras para recortar partes específicas (como o rosto de uma pessoa ou um carro).
  • Usaram IA para gerar novo áudio e vídeo para essas partes específicas com base em instruções de texto (por exemplo, "Mude o homem para uma mulher").
  • Em seguida, recolocaram essas novas partes no vídeo original, mantendo o fundo intocado.
  • Finalmente, fizeram humanos e computadores inteligentes testarem os resultados para garantir que parecessem e soassem reais. Isso criou um vasto livro de receitas com 80.000 exemplos de treinamento.

2. O "Editor Inteligente" (O Modelo)

O cerne do sistema é um Cérebro de Duplo Fluxo. Imagine um maestro conduzindo duas orquestras ao mesmo tempo: uma para a cena visual (vídeo) e outra para o som (áudio).

  • A Âncora: Quando você pede uma edição, o sistema não apenas adivinha. Ele olha para o vídeo e áudio originais como uma "âncora de segurança" para garantir que não altere acidentalmente o céu, as árvores ou o ruído de fundo.
  • A Instrução: Você digita um comando como: "Mude o homem para uma jovem mulher de cabelo castanho dizendo 'Acho que devemos tentar novamente'".
  • A Atenção Portada (SIGA): Este é o segredo do artigo. Imagine um dimmer ou um semáforo para cada momento individual do vídeo.
    • Se a luz estiver Vermelha, o sistema diz: "Mantenha o vídeo/áudio original exatamente como está" (preservando o fundo).
    • Se a luz estiver Verde, ele diz: "Mude esta parte para corresponder à instrução".
    • Este interruptor ajusta-se automaticamente, para que o sistema saiba exatamente o que mudar e o que deixar intocado, garantindo que a nova voz corresponda perfeitamente ao novo rosto.

3. A "Dança em Dois Passos" (Estratégia de Treinamento)

Ensinar um computador a editar vídeo e áudio simultaneamente é difícil. Se você tentar ensinar tudo de uma vez, ele fica confuso.

Os autores usam uma Estratégia de Treinamento em Duas Etapas:

  1. Passo 1 (Prática Solo): Primeiro, eles ensinam a parte do vídeo a editar e a parte do áudio a editar, separadamente. Eles aprendem seus próprios movimentos sem se preocupar com o outro.
  2. Passo 2 (O Dúo): Uma vez que estão bons em solos, são ensinados a dançar juntos. Eles aprendem a sincronizar perfeitamente para que, quando o vídeo mostrar um motor de carro sendo ligado, o áudio toque o rugido do motor no mesmo milissegundo exato.

O Que Ele Pode Fazer?

O artigo demonstra quatro principais "movimentos" usando apenas instruções de texto:

  • Troca de Identidade: Mude um homem para uma mulher (ou vice-versa) mantendo a voz e os movimentos labiais sincronizados.
  • Reescrita de Fala: Mantenha o rosto e a voz da pessoa, mas mude as palavras que ela está dizendo para algo novo.
  • Inserção: Adicione um novo objeto (como um carro antigo passando) e gere o som de motor correspondente.
  • Remoção: Apague um objeto (como um esquilo em uma pedra) e silencie seu pio, fazendo parecer que ele nunca esteve lá.

A Conclusão

Em resumo, o InstructAV2AV é o primeiro sistema que permite editar a história de um vídeo e sua trilha sonora simultaneamente usando apenas um prompt de texto. Ele não apenas cola um novo som sobre um vídeo antigo; ele entende que, se você alterar o visual, o som deve mudar também, e se você alterar o som, o visual deve corresponder. Ele faz isso aprendendo com uma vasta biblioteca de exemplos, criada por si mesma, e usando um "dimmer" inteligente para decidir exatamente o que manter e o que mudar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →