← Últimos artigos
💻 computer science

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

Este artigo apresenta o MultiRef-Compass, um benchmark unificado composto por 350 amostras curadas e um protocolo de avaliação quadridimensional com 14 submétricas, projetado para avaliar de forma abrangente a capacidade emergente dos sistemas de geração de áudio e vídeo a partir de múltiplas referências em preservar, vincular e compor múltiplas referências em conteúdo sincronizado coerente.

Autores originais: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

Publicado 2026-07-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um diretor tentando filmar uma cena de um filme. Nos velhos tempos da IA de vídeo, você só podia dar ao computador um roteiro simples: "Faça um vídeo de um gato". A IA adivinharia como o gato era, onde ele estava e qual som ele fazia. Mas agora, os criadores querem mais controle. Eles querem dizer: "Use esta foto específica do meu cachorro para o rosto, esta outra foto para o seu perfil lateral e esta terceira foto para o seu brinquedo favorito, tudo isso enquanto ele late em um som específico". Este é o mundo da geração de Vídeo-Áudio-Referência-Múltipla (MR2AV). É como pedir a uma IA para ser um mestre chef que não deve apenas cozinhar uma refeição, mas também usar ingredientes específicos de três potes diferentes, arranjá-los no prato exatamente como mostrado em uma foto e garantir que o som do chiado combine perfeitamente com a ação de cozinhar. O problema é que não tínhamos uma boa maneira de avaliar o quão bem a IA estava realizando essa dança complexa. Tínhamos testes para receitas simples, mas nada para este desafio multissensorial e de múltiplos ingredientes.

Surge o MultiRef-Compass, um novo "boletim escolar" projetado por pesquisadores para testar exatamente essa habilidade. Pense nisso como um teste de sabor rigoroso para criadores de vídeo por IA. A equipe construiu um conjunto de dados especial de 350 cenários cuidadosamente elaborados — como um desafio de programa de culinária onde cada competidor recebe exatamente as mesmas três fotos de uma pessoa, um sapato e um cliente, além de um roteiro dizendo: "A pessoa experimenta o sapato e pergunta se serve". Eles então pediram a oito modelos de IA diferentes (incluindo grandes nomes como Kling, Seedance e Gemini) que gerassem o vídeo.

Os pesquisadores não apenas observaram se o vídeo parecia "bonito". Eles dividiram a avaliação em quatro categorias específicas, como uma rubrica detalhada:

  1. Qualidade Básica: O vídeo parece nítido e o som é bom, ou está borrado e com ruídos?
  2. Consistência de Referência: A IA realmente usou as fotos que você forneceu? Ela manteve o rosto da pessoa igual ou acidentalmente o trocou por o de um estranho? Ela colou o sapato no pé corretamente ou apenas colou um adesivo de sapato na tela?
  3. Consistência Áudio-Visual: Quando a pessoa no vídeo fala, os lábios dela se movem? Quando ela pisa no chão, você ouve um passo?
  4. Seguimento de Instruções: A IA fez exatamente o que o roteiro pediu ou ignorou a parte do sapato e apenas mostrou a pessoa caminhando?

Para avaliar isso, eles usaram uma mistura de ferramentas de computador e um "juiz de IA superinteligente" (um Modelo de Linguagem Multimodal Grande) que atua como um crítico de cinema. Eles até adicionaram uma etapa especial de "re-julgamento" para garantir que o crítico de IA não fosse severo demais ou condescendente demais, garantindo que as pontuações fossem justas.

Os resultados foram um choque de realidade. Embora alguns modelos estejam ficando muito bons em fazer as coisas parecerem bonitas, eles ainda estão enfrentando as partes difíceis. O artigo sugere que os modelos atuais frequentemente falham na vinculação (binding) — eles podem reconhecer o rosto na foto, mas esquecer de anexá-lo ao corpo, ou podem confundir quem deveria estar falando. Um modelo, o Seedance 2.0, ficou no topo geral porque foi o mais equilibrado, indo bem em todas as quatro categorias. No entanto, mesmo os melhores modelos mostraram "espaço substancial para melhoria". Eles descobriram que, quando você pede a uma IA para fazer malabarismos com múltiplas referências e instruções complexas ao mesmo tempo, ela frequentemente deixa a bola cair, criando vídeos onde os personagens parecem recortes, as vozes não combinam com os falantes ou a história fica bagunçada.

Em resumo, o MultiRef-Compass mostra que, embora o vídeo por IA esteja se tornando impressionante, ele ainda não está pronto para ser um diretor confiável para histórias complexas de múltiplas referências. É uma ferramenta que precisa de mais treinamento para entender como tecer múltiplas pistas em uma única cena coerente e de aparência natural. O benchmark em si está aberto para que todos o utilizem, servindo como uma base para ajudar futuros modelos de IA a aprenderem a ser melhores neste tipo específico e difícil de trabalho criativo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →