← Últimos artigos
💻 computer science

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

O Vorch-IR é um framework multimodal unificado construído sobre o LTX2 que permite a substituição flexível de identidade de uma ou duas pessoas com edição opcional de fundo em vídeos de longa duração ao condicionar conjuntamente em vídeos de condução, imagens de referência e instruções textuais, enquanto supera a escassez de dados através de um pipeline de síntese automática e se estende para gerações de minutos através de uma estratégia de inferência de sobreposição temporal.

Autores originais: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

Publicado 2026-08-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está segurando um controle remoto da realidade, mas em vez de mudar o canal, você quer trocar os atores de um filme, mantendo o roteiro, os ângulos de câmera e os passos de dança exatamente iguais. Este é o sonho da "substituição de identidade de vídeo", um tópico quente no mundo da inteligência artificial. Por muito tempo, a IA conseguia gerar novos vídeos do zero, mas editar um já existente era como tentar mudar o rosto de um personagem em um filme live-action sem estragar a iluminação ou o movimento. As tentativas iniciais exigiam que a IA recebesse um mapa detalhado de onde a pessoa estava parada, um desenho de esqueleto de sua pose ou uma máscara para cobrir seu rosto. Era como pedir a um chef para cozinhar uma refeição apenas se você lhe desse uma lista de ingredientes pré-cortados e um diagrama da cozinha. Esses métodos eram rígidos e difíceis de usar. A grande questão que os pesquisadores estão fazendo agora é: Podemos ensinar uma IA a entender uma frase simples como "Troque o dançarino à esquerda por esta foto" e simplesmente entender, sem precisar de um mapa complexo ou de um esqueleto?

Apresentamos o Vorch-IR, um novo sistema de IA que atua como um editor de filmes mágico e superinteligente. Pense nele como um diretor que não precisa de um assistente de direção ou de um coordenador de dublês. Você dá ao Vorch-IR três coisas: o vídeo original (o vídeo "condutor"), algumas fotos das novas pessoas que você deseja inserir (as "referências") e uma nota de texto simples dizendo quem vai para onde. A magia é que as fotos não precisam corresponder à pose ou posição do vídeo. Se o vídeo mostra uma pessoa dançando com os braços levantados, e sua foto mostra ela sentada, o Vorch-IR descobre como fazer a pessoa sentada dançar de qualquer maneira. Ele lida com pessoas individuais, duas pessoas dançando juntas e até a troca do cenário de fundo, tudo com um único modelo.

Os pesquisadores por trás do Vorch-IR construíram este sistema sobre um poderoso gerador de vídeo chamado LTX2. Eles o ensinaram a olhar para o vídeo, as fotos e as instruções de texto ao mesmo tempo. Em vez de usar mapas rígidos, a IA usa um "cérebro visão-linguagem" (um tipo de IA que entende tanto imagens quanto palavras) para entender a conexão. É como se a IA lesse sua nota, olhasse para a foto e dissesse: "Ah, você quer que esta pessoa tome o lugar daquela à esquerda", e então ela usa sua "autoatenção" interna para misturar o novo rosto no corpo em movimento perfeitamente.

Um dos maiores obstáculos neste campo é o dado. Para ensinar uma IA a trocar rostos, você precisa de milhares de exemplos de vídeos de "antes" e "depois". Como esses não existem no mundo real, a equipe construiu um pipeline robótico para criá-los. Eles pegaram vídeos reais, usaram outras ferramentas de IA para trocar os rostos no primeiro quadro e, em seguida, usaram um robô guiado por movimento para fazer o resto do vídeo seguir os novos rostos. Eles então filtraram as tentativas ruins (como quando a IA acidentalmente deu três braços ao dançarino) para criar um conjunto de treinamento perfeito. Isso permitiu que treinassem um único modelo para fazer tudo: trocar uma pessoa, trocar duas pessoas e até mudar o cenário de fundo, tudo sem precisar de ferramentas separadas para cada tarefa.

Mas e quanto a fazer um filme inteiro? A maioria dos geradores de vídeo por IA fica confusa ou borrada após alguns segundos. O Vorch-IR usa um truque inteligente chamado "inferência de sobreposição temporal". Imagine tentar pintar um mural longo. Em vez de pintar um pequeno quadrado, deixá-lo secar e depois pintar o próximo (o que poderia fazer com que as cores parecessem diferentes), o Vorch-IR pinta seções sobrepostas ao mesmo tempo e as mistura de forma contínua. Isso permite que ele gere vídeos de um minuto inteiro sem que os rostos dos personagens derivem ou que o movimento fique estranho, tudo sem precisar gerar o vídeo um clipe por vez.

A equipe testou o Vorch-IR contra outros modelos de ponta. Em comparações diretas, o Vorch-IR sugeriu que era melhor em manter o rosto da nova pessoa exatamente como na foto (preservação de identidade) e em manter o fundo consistente, enquanto ainda se movia suavemente. Em testes humanos, as pessoas preferiram os resultados do Vorch-IR em relação a outros métodos, especialmente quando se tratava de fazer o novo personagem parecer real e fisicamente plausível. O artigo sugere que, embora alguns modelos mais antigos possam ser ligeiramente melhores em coisas específicas, como a correspondência perfeita de pose em cenários muito específicos, o Vorch-IR oferece uma maneira muito mais flexível e unificada de editar vídeos, provando que você não precisa de mapas complexos para obter ótimos resultados. É um passo em direção a um futuro onde editar um vídeo será tão fácil quanto digitar uma frase.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →