← Últimos artigos
🤖 AI

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

Este artigo apresenta o \textsc{Ptah}, um framework multiagente que orquestra o planejamento, a coleta de evidências com uma memória de trabalho visual e a geração de relatórios enforced por verificador para produzir relatórios de pesquisa profunda multimodais confiáveis, fiéis às citações e com intercalação visual.

Autores originais: Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Zhicheng Dou

Publicado 2026-05-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Zhicheng Dou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você pede a um assistente inteligente que escreva um relatório detalhado e profissional sobre um tópico complexo, como "Como funcionam as redes neurais profundas?" ou "Qual é o estado atual do mercado de veículos elétricos?"

No passado, esses assistentes apenas vomitavam um bloco de texto. Às vezes, eles erravam fatos (alucinavam), e se tentassem adicionar imagens, as imagens frequentemente seriam aleatórias, não relacionadas ou colocadas de forma desajeitada, como uma colagem feita por alguém que não leu as instruções.

Este artigo apresenta o PTAH, um novo sistema projetado para atuar como uma equipe mestra de construção para a elaboração desses relatórios. Em vez de um único trabalhador tentando fazer tudo de uma vez, o PTAH utiliza uma equipe de agentes especializados trabalhando juntos sob supervisão rigorosa para construir um relatório que mistura texto e imagens perfeitamente.

Veja como o PTAH funciona, dividido em etapas simples:

1. O Projeto (Planejamento)

Primeiro, um Agente Planejador atua como um arquiteto. Antes de assentar um único tijolo, ele desenha um projeto detalhado. Ele decide:

  • Quais seções o relatório precisa.
  • Quais fatos precisam ser encontrados.
  • Crucialmente: Onde as imagens devem ficar e que tipo de imagens é necessário (por exemplo, "Precisamos de um gráfico aqui para mostrar o crescimento das vendas" ou "Precisamos de um diagrama para explicar o motor").

2. A Equipe de Coleta (Pesquisa)

Em seguida, uma equipe de Agentes Pesquisadores vai à internet coletar materiais.

  • Eles encontram os fatos e os anotam.
  • Eles também atuam como uma caça ao tesouro visual. Eles não pegam apenas qualquer imagem; procuram imagens específicas que correspondam ao projeto.
  • Eles colocam essas imagens "alinhadas à fonte" (imagens que realmente vêm dos sites que visitaram) em uma Memória de Trabalho Visual especial. Pense nisso como uma caixa de ferramentas digital onde cada ferramenta (imagem) é rotulada exatamente de onde veio e o que se supõe que prove.

3. O Inspetor de Controle de Qualidade (O Verificador)

Esta é a parte mais importante. Antes de o relatório avançar para a próxima etapa, um Agente Verificador atua como um inspetor de construção rigoroso.

  • Ele verifica: "Você realmente encontrou os fatos que alegou?"
  • Ele verifica: "Esta imagem realmente vem do site que você citou?"
  • Ele verifica: "Esta imagem faz sentido ao lado deste parágrafo?"
  • Se a resposta for "Não", a equipe tem que voltar e corrigir. Isso impede que o sistema invente fatos falsos ou cole imagens aleatórias e confusas.

4. A Linha de Montagem (Escrita)

Finalmente, um Agente Escritor monta o produto final. Em vez de apenas digitar texto e esperar que uma imagem se encaixe depois, ele escreve o texto e as instruções da imagem juntos, como um maestro conduzindo uma orquestra.

  • Ele usa a "caixa de ferramentas" de imagens verificadas.
  • Se um gráfico específico for necessário e ainda não existir, ele pode gerar um.
  • Em seguida, ele transforma tudo em uma página web polida e interativa (como um mini-site) que parece profissional e é fácil de ler.

O "Escalonamento no Tempo de Execução" (O Polimento)

Antes de entregar o relatório para você, o PTAH faz uma rodada final de "polimento". Ele examina todo o relatório novamente para corrigir espaçamentos, garantir que as imagens não estejam muito lotadas e assegurar que o layout pareça bom em uma tela. É como uma visita final antes da casa ser vendida.

Como Eles Testaram (PTAHEval)

Os pesquisadores perceberam que os testes antigos verificavam apenas se o texto era bom. Eles criaram um novo teste chamado PTAHEval para julgar o pacote completo:

  • Qualidade do Conteúdo da Imagem: A imagem está clara? Ela realmente ajuda a explicar o texto?
  • Qualidade da Apresentação: A página web final parece boa? É fácil de ler ou é um emaranhado confuso?

Os Resultados

Quando testaram o PTAH contra outros sistemas inteligentes:

  • Fatos Melhores: O PTAH cometeu menos erros e citou fontes reais com muito mais frequência.
  • Imagens Melhores: As imagens eram realmente relevantes e úteis, não apenas decoração.
  • Layout Melhor: Os relatórios finais pareciam documentos profissionais, não rascunhos bagunçados.

Em resumo: O PTAH é como contratar uma equipe de arquitetos, construtores e inspetores para construir uma casa, em vez de pedir a uma única pessoa que adivinhe o projeto e construa tudo de uma vez. O resultado é um relatório que não é apenas inteligente, mas também visualmente confiável e fácil para os humanos entenderem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →