← Últimos artigos
💻 computer science

VicEdit: Learning to Edit Videos from Visual In-Context Examples

O artigo apresenta o VicEdit, um framework unificado que avança a edição de vídeo ao aproveitar um novo conjunto de dados em larga escala (VicEdit-400K) e técnicas inovadoras como Destilação Semântica Adaptativa à Modalidade e Injeção de Contexto Duplo para integrar efetivamente exemplos visuais de contexto com instruções textuais para um desempenho de edição superior.

Autores originais: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

Publicado 2026-08-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Durante anos, o sonho de editar vídeo tem sido simplesmente dizer a um computador o que fazer. Se você quisesse mudar a cor de um carro em uma cena de filme ou substituir um céu nublado por um pôr do sol, poderia digitar uma frase como "deixe o céu laranja", e o software tentaria o seu melhor. Essa abordagem, conhecida como edição baseada em instruções, fez progressos notáveis. Ela depende de modelos poderosos de inteligência artificial que compreendem a linguagem e podem gerar imagens e vídeos do zero. No entanto, um problema fundamental permanece: as palavras são frequentemente vagas demais para capturar o visual e a sensação específicos de uma cena. Uma descrição textual pode dizer "carro vermelho", mas não consegue transmitir facilmente o tom exato de vermelho, a maneira como a luz incide sobre o metal ou o movimento específico do veículo. Quando um computador tenta adivinhar esses detalhes apenas por meio de uma frase, o resultado muitas vezes parece errado, com cores que oscilam, objetos que aparecem no lugar errado ou movimentos que parecem rígidos e artificiais.

Para resolver isso, pesquisadores começaram a explorar uma maneira diferente de ensinar os computadores: mostrando-lhes exemplos em vez de apenas dizer a eles. Esse conceito, chamado de aprendizado em contexto (in-context learning), é semelhante à forma como um aprendiz humano aprende um ofício. Em vez de ler um manual sobre como pintar uma parede, o aprendiz observa um mestre pintor aplicar uma pincelada específica a uma superfície específica. Ao observar a relação entre a parede original e o resultado final, o aprendiz aprende a técnica precisa. No mundo da edição de vídeo, isso significa fornecer ao computador referências visuais — como uma única imagem, um par de imagens mostrando um antes e depois, ou até mesmo um pequeno clipe de vídeo da mudança desejada. O desafio era que nenhum sistema único conseguia lidar com todos esses diferentes tipos de pistas visuais ao mesmo tempo, e não havia uma grande coleção de exemplos para ensinar o sistema a usá-los de forma eficaz.

Uma equipe de pesquisadores agora preencheu essa lacuna com um novo sistema chamado VicEdit. O trabalho deles representa uma mudança significativa, passando de depender exclusivamente de descrições textuais para usar exemplos visuais como o guia principal para a edição. Para construir este sistema, a equipe primeiro criou uma biblioteca massiva de dados de treinamento. Eles geraram 400.000 exemplos de alta qualidade, um conjunto de dados que nomearam VicEdit-400K. Esta coleção é única porque abrange dez tipos diferentes de tarefas de edição, desde mudar o estilo de uma cena inteira até adicionar ou remover objetos específicos. Crucialmente, cada exemplo nesta biblioteca é emparelhado com o tipo certo de referência visual: uma única imagem para mudanças de estilo, um par de imagens para mudanças espaciais ou um par de vídeos para movimentos complexos. Esta vasta biblioteca permitiu que ensinassem o computador a interpretar pistas visuais com um nível de precisão que o texto sozinho jamais poderia proporcionar.

O núcleo do novo sistema é um método que permite ao computador adaptar sua compreensão com base no tipo de pista visual que recebe. Quando o computador vê uma única imagem, ele aprende a focar em texturas e cores. Quando vê um par de imagens, aprende a entender como os objetos se movem de uma posição para outra. Quando vê um par de vídeos, aprende a seguir o fluxo do tempo e do movimento. Os pesquisadores projetaram um processo que extrai essas lições específicas dos exemplos visuais e as combina com as instruções escritas. Isso garante que o computador não apenas siga o texto cegamente, mas use os exemplos visuais para ancorar as mudanças na realidade. Por exemplo, se um usuário pede para transformar uma garrafa de água em uma galáxia brilhante, o texto fornece a ideia, mas um exemplo visual de uma galáxia brilhante garante que o computador saiba exatamente como ela é, evitando que crie um resultado genérico ou distorcido.

Os resultados desta abordagem são impressionantes. Quando testado contra métodos existentes, o novo sistema produziu consistentemente vídeos de maior qualidade que eram mais fiéis à intenção do usuário. Em tarefas onde outros sistemas tiveram dificuldade em manter objetos no lugar certo ou manter o estilo correto, este novo método teve sucesso. Ele conseguiu integrar perfeitamente um novo objeto em uma cena, mudar o fundo sem distorcer o primeiro plano ou aplicar estilos artísticos complexos que pareciam naturais e coerentes. O sistema provou que, ao mostrar ao computador o que fazer, em vez de apenas dizer a ele, a qualidade da edição melhora dramaticamente. Este trabalho estabelece um novo padrão para a edição de vídeo, demonstrando que exemplos visuais são uma ferramenta poderosa e necessária para guiar a inteligência artificial. Os pesquisadores disponibilizaram seu conjunto de dados e sistema para que outros possam usar, abrindo as portas para ferramentas de edição de vídeo mais precisas e criativas no futuro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →