← Últimos artigos
💻 computer science

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

O OpenResearcher é um pipeline totalmente aberto e reprodutível que sintetiza trajetórias de pesquisa profunda de longo prazo em um ambiente offline, permitindo o treinamento de agentes de IA que alcançam ganhos significativos de desempenho em tarefas de busca complexas sem depender de APIs proprietárias.

Autores originais: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

Publicado 2026-03-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer ensinar um robô a ser um detetive de internet extremamente competente. O robô precisa não apenas fazer uma busca no Google, mas ler dezenas de sites, cruzar informações, verificar fatos e montar um quebra-cabeça complexo para responder a perguntas difíceis.

O problema é que, para treinar esse robô, você precisaria de milhões de tentativas reais na internet. Isso seria caríssimo (pagar por cada busca), instável (a internet muda todo dia) e impossível de repetir exatamente da mesma forma duas vezes.

É aqui que entra o OpenResearcher, o projeto apresentado neste artigo. Eles criaram uma "fábrica de detetives" totalmente nova. Vamos explicar como funciona usando uma analogia simples:

1. O Problema: Treinar na "Selva Real" vs. Um "Parque de Diversões"

Antes, para treinar esses agentes de IA, eles tinham que deixá-los vagar pela internet real (o "Google Search" de verdade).

  • O Custo: Cada vez que o robô clicava em um link, custava dinheiro. Se ele errasse 100 vezes, você pagava 100 vezes.
  • O Caos: A internet muda. Um link que funcionava hoje pode estar quebrado amanhã. Isso tornava os dados de treinamento bagunçados e difíceis de analisar.

A Solução OpenResearcher: Eles construíram um "Parque de Diversões" (um ambiente offline).
Em vez de ir para a internet real, eles criaram uma cópia gigante e congelada da internet (15 milhões de documentos) dentro de um computador. É como se eles tivessem baixado a biblioteca inteira do mundo e a colocaram em uma sala fechada. Agora, o robô pode praticar quantas vezes quiser, sem pagar nada e sem que o mundo lá fora mude.

2. Os Três Superpoderes (As Ferramentas do Detetive)

Para que o robô não seja apenas um "leitor de títulos", eles deram a ele três ferramentas específicas, como se fosse um kit de detetive:

  1. 🔍 Buscar (Search): O robô faz uma pergunta e recebe uma lista de "cartões de visita" (títulos e resumos) de sites. É como olhar o índice de um livro.
  2. 📖 Abrir (Open): O robô escolhe um cartão e abre a página inteira. É como pegar o livro da estante e ler o capítulo completo.
  3. 🔎 Encontrar (Find): O robô usa o "Ctrl+F" dentro da página aberta para achar exatamente onde está a informação que ele precisa. É como usar uma lupa para achar uma palavra específica em meio a milhares de linhas de texto.

A Mágica: A maioria dos robôs antigos só tinha o "Buscar". Eles ficavam perdidos porque os resumos não tinham a resposta. Com as três ferramentas, o robô aprende a pesquisar, ler profundamente e localizar a prova exata, exatamente como um humano faria.

3. O Mestre e o Aprendiz (Como eles treinaram)

Eles usaram um "Mestre" superinteligente (um modelo de IA gigante chamado GPT-OSS-120B) para gerar milhões de histórias de detetives.

  • O Mestre recebeu uma pergunta difícil.
  • Ele usou as três ferramentas no "Parque de Diversões" (internet offline) para resolver o caso.
  • Ele escreveu todo o passo a passo: "Primeiro busquei X, depois abri Y, encontrei Z, e conclui que a resposta é A".
  • Eles geraram 97.000 dessas histórias (trajetórias), algumas com mais de 100 passos!

Depois, pegaram um "Aprendiz" (um modelo menor e mais barato) e ensinaram a ele lendo essas histórias. O resultado? O Aprendiz ficou tão bom que superou sistemas proprietários muito maiores e mais caros em testes de raciocínio complexo.

4. O Que Eles Descobriram (Lições Importantes)

Ao analisar como o robô falhava e acertava, eles descobriram coisas incríveis:

  • Não basta apenas achar o documento: O robô pode encontrar o site certo (o "ouro"), mas se não o abrir e ler com atenção, ele ainda vai errar a resposta.
  • Mais passos não significam melhor: Às vezes, o robô fica dando voltas em círculos. O segredo não é fazer 1.000 buscas, mas saber qual busca fazer.
  • Falhas são úteis: Até as tentativas onde o robô erra a resposta são valiosas para o treinamento, porque mostram como ele tentou raciocinar.

Resumo Final

O OpenResearcher é como ter uma academia de detetives onde você pode treinar seus alunos (IAs) em um ambiente controlado, sem custo, e com ferramentas que simulam a realidade.

Eles provaram que, ao invés de gastar milhões em APIs de busca reais, você pode criar um "universo paralelo" de dados, treinar seus robôs lá dentro e depois soltá-los na internet real, onde eles continuarão sendo mestres em encontrar respostas complexas. É uma revolução barata, reproduzível e aberta para o futuro da inteligência artificial.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →