← Últimos artigos
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

Este artigo apresenta o VideoSearcher, um framework de agente de ciclo fechado que aproveita o raciocínio multi-ferramenta e um novo algoritmo de aprendizado por reforço de Otimização de Política de Sequência de Bi-ramificação (BiSPO) para avançar na Pesquisa Profunda de Vídeo ao unificar localização temporal, foco espacial e busca multimodal, acompanhado pelo novo benchmark VideoSearch-QA para avaliação.

Autores originais: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Publicado 2026-07-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando resolver um mistério, mas em vez de uma cena de crime, sua "cena de crime" é um vídeo longo e entediante.

O Probleo: O Detetive da "Caixa Fechada"
A maioria dos modelos atuais de IA de vídeo são como detetives que estão trancados em uma sala com apenas o arquivo de vídeo. Dizem a eles: "Tudo o que você precisa saber está neste vídeo". Se a resposta não estiver explicitamente escrita ou mostrada no vídeo, eles ficam travados. Eles não podem procurar um nome, verificar uma data ou validar um fato porque não têm permissão para sair da sala.

A Solução: VideoSearcher
O artigo apresenta o VideoSearcher, um novo tipo de detetive de IA que tem permissão para sair da sala. Ele trata o vídeo não como a resposta final, mas como uma pista.

Pense no VideoSearcher como um detetive com um smartphone, uma lupa e um mapa. Veja como ele funciona, passo a passo:

  1. Escaneando a Cena do Crime (O Vídeo): O detetive assiste ao vídeo. Em vez de encarar o conteúdo todo de uma vez, ele sabe como avançar rapidamente para as partes interessantes (como encontrar um personagem específico) e dar zoom em detalhes minúsculos (como ler uma placa de carro ou um logotipo).
  2. Chamando Reforços (As Ferramentas): Assim que ele avista uma pista (ex: "Isso parece um personagem de um videogame"), ele não adivinha. Ele usa suas ferramentas:
    • Busca de Imagem: Ele tira uma foto da pista e a pesquisa na internet para descobrir o que é.
    • Busca na Web: Ele lê artigos e wikis para descobrir fatos sobre aquele personagem (como "Qual é o seu movimento especial?").
  3. Juntando as Peças: Ele combina o que viu no vídeo com o que encontrou na internet para dar a resposta final.

O Ingrediente Secreto: Como ele Aprendeu
Ensinar uma IA a fazer isso é difícil. Se você apenas disser "obtenha a resposta correta", ela pode acertar por sorte uma vez, mas falhar na próxima. Os autores criaram um método de treinamento especial chamado BiSPO (Bi-branch Sequence Policy Optimization).

Pense nisso como treinar um aluno com dois boletins separados:

  • Boletim A (A Resposta): Você obteve a resposta final correta?
  • Boletim B (O Processo): Você usou as ferramentas certas? Deu zoom no lugar certo? Pesquisou na web no momento certo?

A maioria do treinamento de IA só se importa com o Boletim A. O VideoSearcher se importa com ambos. Isso garante que a IA não apenas adivinhe a resposta; ela aprende o hábito de ser um bom pesquisador. Ela aprende a parar de pesquisar quando já tem informações suficientes e a pesquisar com mais afinco quando está travada.

O Novo Teste: VideoSearch-QA
Os autores perceberam que os testes antigos não eram justos porque só faziam perguntas passíveis de serem respondidas apenas com o vídeo. Então, eles construíram um novo teste chamado VideoSearch-QA.

Imagine um teste onde você mostra a um aluno um vídeo de um ponto turístico famoso e pergunta: "Quando este local foi inaugurado?". Se o vídeo não mostrar uma placa com a data, o aluno precisa saber que deve pesquisar. Este novo benchmark testa exatamente isso: a IA consegue encontrar a pista no vídeo e, em seguida, ir buscar o restante da resposta na web aberta?

Os Resultados
Quando testaram o VideoSearcher contra outros modelos de IA (tanto gratuitos quanto caros), ele venceu. Ele foi muito melhor em:

  • Encontrar momentos específicos em vídeos longos.
  • Usar a internet para preencher as lacunas.
  • Resolver questões complexas que exigiam tanto a visão quanto a pesquisa.

Em Resumo
O VideoSearcher é uma IA que se graduou de observadora passiva para pesquisadora ativa. Ela não apenas "assiste" a vídeos; ela investiga, usa ferramentas para reunir evidências do mundo real e resolve enigmas que eram anteriormente impossíveis de serem decifrados por um computador.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →