← Últimos artigos
💻 computer science

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

Este artigo apresenta o LongAV-Compass, uma avaliação sistemática projetada para unificar a avaliação da geração áudio-visual em escala de minutos através das modalidades de condicionamento por texto, imagem e vídeo, empregando um quadro abrangente que avalia mais de 20 dimensões de granularidade fina de qualidade, consistência e coerência.

Autores originais: Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Hao
Publicado 2026-05-27
📖 4 min de leitura☕ Leitura rápida

Autores originais: Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um diretor de cinema. Por muito tempo, a indústria cinematográfica só lhe pedia para fazer tráilers de 5 segundos. Você podia fazê-los parecer incríveis, e havia muitos juízes para dizer se a iluminação era boa ou se o ator sorria no momento certo.

Mas agora, a indústria está pedindo filmes completos de 60 minutos. De repente, fazer uma única cena boa não é suficiente. Você precisa garantir que o personagem principal tenha a mesma aparência na cena final como tinha na primeira, que a história faça sentido do início ao fim e que os efeitos sonoros correspondam perfeitamente à ação.

O problema? Os juízes (ferramentas de avaliação) ainda são treinados apenas para avaliar tráilers de 5 segundos. Eles não sabem identificar um buraco no enredo que ocorre aos 40 minutos, ou quando o rosto de um personagem começa a derreter porque o filme ficou longo demais.

Aí entra o "LongAV-Compass".

Este artigo apresenta um novo "Juiz" especializado, projetado especificamente para avaliar esses novos vídeos longos. Veja como funciona, explicado de forma simples:

1. Os Três Tipos de Diretores (As Tarefas)

O novo juiz testa três maneiras diferentes de fazer um filme:

  • Texto para Filme (T2AV): Você dá ao juiz um roteiro (texto), e ele precisa fazer o filme inteiro.
  • Foto para Filme (I2AV): Você dá ao juiz uma única foto de um personagem, e ele precisa fazê-lo mover-se e atuar em uma história mantendo o rosto exatamente igual à foto.
  • Vídeo para Filme (V2AV): Você dá ao juiz os primeiros 15 segundos de um filme, e ele precisa terminar o restante da história sem alterar o estilo ou os personagens.

2. O Mapa "Bússola" (O Benchmark)

Os pesquisadores criaram uma biblioteca de 284 casos de teste específicos. Pense neles como 284 "roteiros" ou "desafios" diferentes, variando de vlogs simples a comerciais complexos.

  • Eles organizaram esses casos por dificuldade: Alguns são fáceis (uma pessoa falando), enquanto outros são difíceis (uma perseguição de carro com múltiplas pessoas e física específica).
  • Eles cobrem diferentes gêneros: Como "Comerciais de Marca" (vender um produto) ou "Criador de Conteúdo" (contar uma história engraçada).

3. Como o Juiz Avalia (As Métricas)

Em vez de apenas dar uma pontuação única como "8 de 10", o LongAV-Compass age como um médico de diagnóstico. Ele verifica o vídeo em mais de 20 "sinais vitais" diferentes:

  • A história aconteceu? (Cumprimento do Evento): O vídeo realmente fez o que o roteiro pediu?
  • O ator permaneceu o mesmo? (Consistência de Identidade): O rosto ou as roupas do personagem principal mudaram de forma estranha no meio do caminho?
  • A história é fluida? (Continuidade): O vídeo pulou ou congelou entre as cenas?
  • Os sons correspondem? (Sincronização): Quando uma porta bate no vídeo, o som do estalo ocorre exatamente no mesmo momento?
  • O filme inteiro é assistível? (Apresentação Holística): Se você assistisse a tudo, sentiria que é um produto completo e polido?

4. Os Resultados (Quem Passou no Teste?)

Os pesquisadores testaram 11 geradores de vídeo de IA diferentes (uma mistura de grandes empresas comerciais e projetos de código aberto) usando esta nova Bússola.

  • Os Grandes Vencedores: Os modelos comerciais de ponta (como "Seedance" e "Kling") geralmente se saíram melhor. Eles conseguiam manter os personagens consistentes e contar uma história coerente por um minuto inteiro.
  • As Dificuldades: Muitos modelos de código aberto conseguiam fazer uma imagem bonita por alguns segundos, mas, conforme o vídeo ficava mais longo, as histórias se desfeziam, os personagens mudavam de rosto ou o áudio ficava estranho.
  • O Problema do "Produto": O teste mais difícil foi "Comerciais de Marca" (vender um produto). A maioria das IAs teve dificuldades aqui. Elas não conseguiam mostrar de forma confiável um produto sendo usado passo a passo sem estragar a lógica ou os visuais.

5. Por Que Isso Importa

O artigo argumenta que não podemos mais olhar apenas para uma "Classificação" com um único número. Uma IA pode ser ótima em fazer um clipe de 5 segundos, mas péssima em um de 60 minutos.

O LongAV-Compass é uma ferramenta que nos ajuda a ver exatamente onde esses sistemas de IA estão falhando. É como o computador de diagnóstico de um mecânico que diz: "O motor funciona bem por 10 minutos, mas os freios falham após 20", em vez de apenas dizer: "Este carro está quebrado".

Em resumo: O mundo do vídeo de IA está amadurecendo, passando de fazer clipes curtos para fazer filmes completos. Este artigo construiu a primeira régua capaz de medir realmente se esses filmes são bons.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →