← Últimos artigos
💻 computer science

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

O UniSwap é um framework inovador que possibilita a primeira substituição de identidade audiovisual contínua em vídeos de fala ao utilizar um único transformador de difusão com um pipeline de treinamento de troca e reconstrução e técnicas de amostragem eficientes para alcançar uma geração de longa duração sincronizada, consistente e estável.

Autores originais: Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

Publicado 2026-08-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um filme, mas o ator na tela de repente começa a falar com uma voz diferente e a parecer uma pessoa completamente diferente, mas continua dizendo exatamente as mesmas palavras e movendo os lábios em perfeita sincronia. Este é o sonho da "troca de identidade" em vídeos falados. Por muito tempo, os computadores foram ótimos em fazer apenas uma parte deste truque: ou mudar o rosto de uma pessoa mantendo sua voz original, ou mudar uma voz mantendo o rosto original. Mas tentar fazer ambos ao mesmo tempo tem sido como tentar fazer malabarismo com duas bolas diferentes enquanto se anda de monociclo; os resultados eram frequentemente fora de sincronia, com lábios se movendo para as palavras erradas ou vozes soando robóticas. Este artigo mergulha no mundo da IA generativa, olhando especificamente para como podemos ensinar os computadores a trocar tanto a aparência quanto a voz de uma pessoa simultaneamente, em tempo real, sem que o vídeo trave ou o áudio atrase.

Os pesquisadores por trás deste projeto, o UniSwap, construíram um novo sistema que atua como um mestre marionetista, puxando as cordas tanto para o lado visual quanto para o lado de áudio de um vídeo no exato mesmo momento. Em vez de usar duas ferramentas separadas — uma para o rosto e outra para a voz — eles criaram um único "cérebro" que entende como o rosto de uma pessoa se move e como sua voz soa como uma experiência conectada. Pense nisso como um tradutor bilíngue que não apenas traduz palavras, mas também captura o sotaque e as expressões faciais do falante instantaneamente.

O artigo introduz uma maneira inteligente de ensinar este sistema. Como é quase impossível encontrar vídeos da vida real da mesma pessoa falando as mesmas falas enquanto parece e soa como duas pessoas diferentes, a equipe inventou um jogo de "troca e reconstrução". Eles pegam um vídeo real, removem digitalmente o rosto e a voz da pessoa para criar uma versão "fantasma" e, em seguida, pedem à IA para reconstruir o vídeo original usando um novo rosto e voz como guia. É como dar a um chef uma tela em branco e uma receita, e depois pedir que ele recrie um prato específico perfeitamente. Ao treinar em milhões desses "reconstruções", a IA aprende a trocar identidades enquanto mantém os movimentos originais e o fundo intactos.

O que torna isso verdadeiramente especial é que funciona como uma transmissão ao vivo, em vez de um filme pré-gravado lento. A maioria dos geradores de vídeo precisa assistir ao clipe inteiro antes de começar a desenhar o primeiro quadro, o que é muito lento para uso interativo. O UniSwap, no entanto, gera o vídeo em pequenos blocos, como uma esteira de produção, permitindo produzir cerca de 13,6 quadros por segundo em um chip de computador poderoso (um NVIDIA H100). Embora isso ainda não seja rápido o suficiente para uma interação em tempo real instantânea, é um salto enorme, permitindo que o sistema gere vídeos longos — de até uma hora de duração — sem que o rosto ou a voz do personagem se desequilibrem ou se tornem distorcidos ao longo do tempo. Os autores descobriram que, ao usar um "truque de memória" especial chamado Decomposição Feature-RoPE, a IA consegue se lembrar da identidade original mesmo após gerar milhares de quadros, garantindo que o personagem permaneça consistente do primeiro ao último segundo.

Em resumo, o UniSwap sugere que finalmente podemos ter um sistema unificado que troca tanto a aparência quanto a voz em vídeos falados com alta sincronização e estabilidade. Embora a versão atual não seja rápida o suficiente para uma conversa ao vivo em tempo real (é ligeiramente mais lenta que a velocidade de uma reprodução de vídeo padrão), ela prova que um único modelo pode lidar com ambas as tarefas juntas melhor do que tentar costurar dois sistemas separados. Os resultados mostram que os movimentos dos lábios permanecem perfeitamente sincronizados com a nova voz, e a identidade do personagem permanece constante mesmo em clipes longos, ofereando um passo promissor em direção a avatares digitais mais naturais e interativos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →