← Últimos artigos
💻 computer science

MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

MARQUIS é um pipeline de três estágios que aprimora significativamente a geração aumentada por recuperação de vídeo ao abordar limitações no tratamento de consultas complexas e na síntese de múltiplos vídeos por meio de expansão de consultas, extração estruturada de evidências e geração controlada de artigos, alcançando desempenho de última geração na tarefa compartilhada MAGMaR2026.

Autores originais: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um jornalista encarregado de escrever uma notícia detalhada sobre um evento complexo, como uma tempestade massiva ou uma eleição política. No entanto, você não tem um único repórter no local; em vez disso, possui uma biblioteca contendo 100.000 clipes de vídeo diferentes do evento, gravados por centenas de câmeras distintas. Sua tarefa é encontrar os clipes adequados, descobrir o que realmente aconteceu neles e escrever uma história coerente que cite exatamente qual vídeo provou cada fato.

Este é o desafio que o sistema MARQUIS enfrenta. O artigo argumenta que as ferramentas de IA atuais são ruins nesse trabalho específico. Elas ou não conseguem encontrar os vídeos certos quando a pergunta é complicada, ou ficam sobrecarregadas ao tentar ler muitos vídeos de uma vez e acabam alucinando (inventando coisas).

O MARQUIS resolve isso atuando como uma linha de montagem de redação em três etapas, dividindo o trabalho massivo em etapas menores e gerenciáveis.

Etapa 1: A Busca do Detetive (Recuperação)

O Problema: Se você pedir a uma IA: "Conte-me tudo sobre os resultados da eleição de 2025", um mecanismo de busca padrão pode ficar confuso. Ele tenta transformar toda essa pergunta longa em um único "código de busca" (embedding), o que frequentemente perde a nuance. É como tentar encontrar uma agulha específica num palheiro descrevendo o palheiro inteiro de uma só vez.

A Solução MARQUIS:
Em vez de uma única busca grande, o MARQUIS age como um detetive que divide um grande caso em pequenas pistas.

  1. Decomposição: Ele pega sua pergunta grande e a divide em 20+ perguntas minúsculas e específicas (ex: "Quantos assentos os Liberais ganharam?" "Qual foi a participação eleitoral?" "Quais distritos mudaram de lado?").
  2. Busca Paralela: Ele pesquisa a biblioteca de vídeo para cada uma dessas perguntas minúsculas separadamente.
  3. A Fusão: Ele pega todas as listas de vídeos encontrados para as perguntas minúsculas e as funde em uma lista mestre.
  4. O Reordenador: Finalmente, um "juiz de vídeo" especializado examina os principais candidatos e os reordena para garantir que os mais relevantes estejam no topo.

O Resultado: Este método é como usar uma lupa para encontrar agulhas específicas em vez de adivinhar onde está o palheiro inteiro. Isso melhorou a capacidade do sistema de encontrar os vídeos corretos, saltando de uma pontuação de 0,195 para 0,759 (um salto massivo).

Etapa 2: Os Verificadores de Fatos (Extração de Informações)

O Problema: Uma vez que você tem os vídeos, não pode simplesmente enviar o arquivo de vídeo inteiro para um escritor. O escritor precisa de fatos específicos. Além disso, vídeos podem ser traiçoeiros; às vezes uma pessoa diz algo que não é verdade, ou o ângulo da câmera é enganoso.

A Solução MARQUIS:
O MARQUIS não apenas "lê" o vídeo; ele extrai "afirmações" específicas e depois as calibra.

  1. Três Tipos de Anotações:
    • Anotações Gerais: "Uma mulher em um casaco vermelho está falando." (Fatos que podem ser úteis mais tarde).
    • Afirmações Direcionadas: "O vídeo mostra 50 pessoas resgatadas." (Fatos que respondem especificamente à sua pergunta).
    • Perguntas e Respostas: O sistema faz perguntas específicas ao vídeo e obtém respostas.
  2. A Calibração (O Detector de Mentiras): Esta é uma etapa crucial. Antes que o escritor veja uma afirmação, um modelo "calibrador" examina a afirmação e o vídeo original lado a lado. Ele pergunta: "Este vídeo realmente prova esta frase?" Ele atribui uma pontuação de probabilidade (0 a 1). Se o vídeo não apoiar a afirmação, ela é filtrada.

A Analogia: Imagine uma equipe de verificadores de fatos que lê cada frase que um repórter escreve e depois volta às filmagens brutas para verificá-la. Se as filmagens não correspondem, a frase é jogada no lixo.

Etapa 3: Os Escritores (Geração de Artigo)

O Problema: Mesmo com bons fatos, escrever um artigo fluido é difícil. Se você der a um escritor 500 tópicos desconexos, ele pode escrever uma lista bagunçada. Se você der a ele uma transcrição de vídeo de 2 horas, ele pode se perder nos detalhes e esquecer o ponto principal.

A Solução MARQUIS:
O sistema oferece três maneiras de escrever o artigo, mas a melhor usa uma abordagem estruturada:

  1. Agrupamento: Ele agrupa os fatos verificados em temas (ex: "Vítimas", "Esforços de Resgate", "Resposta do Governo").
  2. Resumo: Ele escreve uma frase curta e citada para cada tema.
  3. Polimento: Ele costura essas frases juntas em uma história de notícias fluida e legível, garantindo que cada fato tenha uma citação (como [Vídeo #45, 0:12-0:15]).

A Opção "Recursiva" (MARQUIS-RLM):
O artigo também introduz uma IA especial "Gerente" (baseada em Modelos de Linguagem Recursivos). Em vez de apenas escrever uma vez, este Gerente age como um gerente de projeto com um caderno persistente.

  • Ele olha para os fatos que possui.
  • Ele percebe: "Estou faltando a contagem de vítimas para o distrito norte."
  • Ele volta às Etapas 1 e 2, pede especificamente essa informação faltante, adiciona-a ao seu caderno e verifica conflitos.
  • Apenas quando o caderno está completo e consistente é que ele escreve o artigo final.

A Conclusão

O artigo afirma que, ao dividir o problema — buscando de forma mais inteligente, verificando fatos rigorosamente e organizando o processo de escrita — o MARQUIS produz resultados muito melhores do que os métodos atuais.

  • Recuperação: Encontrou os vídeos certos com muito mais frequência.
  • Geração: Produziu artigos que humanos avaliaram mais alto (3,83 de 5 contra 3,09 para a linha de base) porque eram mais coerentes e melhor fundamentados.
  • Confiabilidade: O sistema é projetado para ser "fundamentado", o que significa que se recusa a escrever fatos que não são apoiados pela evidência do vídeo, evitando as "alucinações" comuns em outros sistemas de IA.

Em resumo, o MARQUIS transforma uma pilha caótica de 100.000 vídeos em um artigo de notícias confiável e bem fundamentado, atuando como uma redação altamente organizada e multi-etapa, em vez de um único escritor sobrecarregado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →