← Últimos artigos
💻 computer science

Aurora: Unified Video Editing with a Tool-Using Agent

O artigo apresenta o Aurora, um framework de edição de vídeo agêntico que emprega um modelo visão-linguagem aumentado por ferramentas para traduzir solicitações brutas do usuário em planos de edição estruturados, resolvendo assim a subespecificação textual e visual para aprimorar o desempenho dos transformadores de difusão de vídeo unificados.

Autores originais: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

Publicado 2026-05-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer editar um vídeo caseiro, mas só tem uma ideia vaga na cabeça. Você diz a um editor de vídeo: "Faça o cara ao fundo parecer um super-herói", mas não diz qual super-herói, nem aponta exatamente onde o cara está de pé.

No mundo da edição de vídeo com IA atual, isso é um problema. A maioria dos modelos avançados de IA é como chefs incrivelmente talentosos, mas literalistas. Eles podem cozinhar qualquer coisa, mas apenas se você lhes der uma receita perfeita, com ingredientes exatos e medidas precisas. Se você apenas disser: "Fica apimentado", eles podem adicionar sal em vez de pimenta, ou podem se recusar a cozinhar de todo porque não sabem como é "apimentado".

Aurora é um novo sistema que resolve isso adicionando um assistente inteligente na frente do chef.

O Problema: A Lacuna dos "Ingredientes Faltantes"

Os modelos atuais de IA para edição de vídeo são poderosos. Eles podem substituir objetos, remover pessoas ou alterar fundos. Mas têm uma regra estrita: precisam de tudo pronto antes de começar.

  • Se você quiser substituir uma camisa por um "lenço xadrez da Burberry", a IA precisa de uma foto desse lenço específico.
  • Se você quiser remover uma pessoa, a IA precisa de um mapa (uma máscara) mostrando exatamente onde essa pessoa está.
  • Se você disser "faça mais rápido", a IA precisa saber o que é "isso".

Pessoas reais geralmente não fornecem esses detalhes. Damos instruções vagas. O artigo chama isso de "subespecificação". A IA está pronta para trabalhar, mas o usuário não lhe deu as ferramentas necessárias para começar.

A Solução: A Equipe "Aurora"

Os autores criaram a Aurora, que funciona como uma equipe de duas pessoas:

  1. O Agente (O Assistente Inteligente): Este é um grande modelo de IA (um VLM) que atua como gerente de projeto. Ele ouve seu pedido vago ("Faça a camisa da mulher parecer um lenço da Burberry") e percebe: "Espere, não tenho uma foto desse lenço e preciso saber exatamente onde está a camisa dela."

    • Ele vai às compras: Usa uma ferramenta para pesquisar na web uma foto de um lenço da Burberry.
    • Ele desenha um mapa: Usa uma ferramenta para encontrar o contorno exato da camisa da mulher no vídeo.
    • Ele reescreve a receita: Traduz seu pedido casual em uma instrução superdetalhada e técnica que o editor de vídeo pode entender perfeitamente.
  2. O Modelo de Vídeo (O Chef): Este é o motor real de edição de vídeo (um "Transformador de Difusão"). Ele não conversa diretamente com você. Só recebe as instruções perfeitas e pré-embaladas do Agente. Ele pega o vídeo de origem, a nova foto do lenço e o contorno da camisa, e faz a mágica da edição.

Como Funciona na Vida Real

O artigo mostra exemplos disso em ação:

  • Cenário A: Você diz: "Substitua a camisa da mulher por um lenço da Burberry."
    • Sem Aurora: A IA pode adivinhar um lenço genérico ou falhar.
    • Com Aurora: O Agente pesquisa uma imagem real de um lenço da Burberry, encontra a camisa no vídeo e diz ao Modelo de Vídeo: "Aqui está o vídeo, aqui está a imagem exata do lenço e aqui está a localização exata da camisa. Vá."
  • Cenário B: Você diz: "Remova o pedestre."
    • Sem Aurora: A IA pode remover a pessoa errada ou deixar um buraco bagunçado.
    • Com Aurora: O Agente descobre qual pessoa é um pedestre, desenha um contorno preciso ao redor dela e diz ao Modelo de Vídeo exatamente o que apagar e com o que preencher o fundo.

Os Resultados: Um Novo Marco de Referência

Os pesquisadores criaram um novo teste chamado AgentEdit-Bench. Este teste foi projetado especificamente para enganar a IA com instruções vagas.

  • Quando testaram modelos padrão de IA com esses pedidos vagos, eles obtiveram pontuação baixa (cerca de 67-70%).
  • Quando adicionaram o Agente Aurora à mistura, a pontuação saltou significativamente (até 87,9%).

O artigo também mostrou que esse "Assistente Inteligente" não serve apenas para o modelo de vídeo específico deles. Eles o testaram com outros modelos de edição de vídeo, e o Agente ainda ajudou-os a performar melhor. É como dar um tradutor universal a qualquer chef; não importa quem esteja cozinhando, a comida fica melhor se os ingredientes forem preparados corretamente primeiro.

Resumo

A Aurora não apenas edita vídeos; ela entende o que você quer dizer antes de começar a editar. Ela preenche a lacuna entre a vagueza humana e a precisão da máquina, atuando como um agente que usa ferramentas para coletar imagens faltantes, desenhar mapas faltantes e escrever instruções claras, garantindo que o vídeo final corresponda exatamente à sua visão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →