← Últimos artigos
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

O artigo apresenta o DR Tulu, um modelo de pesquisa profunda de código aberto treinado por meio de Aprendizado por Reforço com Rubricas Evolutivas (RLER), que co-evolui critérios de avaliação com a política, permitindo que supere agentes abertos existentes e rivalize com sistemas proprietários em tarefas de pesquisa de longo formato, ao mesmo tempo em que é significativamente mais custo-efetivo.

Autores originais: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca So
Publicado 2026-05-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Ensinar um Robô a Ser um Pesquisador

Imagine que você quer ensinar um robô a escrever um relatório de pesquisa longo e detalhado sobre um tema complexo, como "Como mutações genéticas causam doenças raras?" ou "Qual é a história da energia renovável?".

A maioria dos modelos de IA atuais é como alunos que só estudam para provas curtas. Eles são ótimos em responder perguntas simples como "Qual é a capital da França?", mas têm dificuldade quando solicitados a escrever um relatório de 20 páginas que exige vasculhar centenas de sites, verificar fatos e citar fontes.

Os autores deste artigo construíram uma nova IA chamada DR Tulu. É o primeiro modelo de código aberto especificamente treinado para ser um "Pesquisador Profundo". Ele não apenas chuta; ele planeja, pesquisa na web, lê artigos e escreve um relatório longo e bem fundamentado.

O Problema: Como Você Avalia um Relatório Longo?

Para ensinar uma IA a melhorar, geralmente usa-se um método chamado Aprendizado por Reforço. Pense nisso como treinar um cachorro:

  1. O cachorro (IA) faz um truque.
  2. Se fizer certo, ganha um petisco (uma recompensa).
  3. Se fizer errado, não ganha petisco.

O problema com relatórios de pesquisa longos é que é difícil saber como um "bom" relatório se parece.

  • Rubricas Estáticas (O Jeito Antigo): Imagine um professor dando ao cachorro uma lista de verificação fixa: "Deve ter 5 parágrafos. Deve mencionar o ano de 1990." Se o cachorro escrever um relatório brilhante sobre 1991, o professor reprova porque não seguiu a lista rígida. A lista de verificação não sabe o que o cachorro realmente descobriu.
  • O Problema do "Livro Fechado": Se você pedir a uma IA para escrever a lista de verificação baseada apenas no que ela já sabe, ela pode perder fatos novos que acabou de descobrir na internet.

A Solução: "Rubricas Evolutivas" (O Professor Inteligente)

O artigo apresenta um novo método chamado RLER (Aprendizado por Reforço com Rubricas Evolutivas).

Imagine um Professor Inteligente que não usa uma lista de verificação fixa. Em vez disso, o professor observa o aluno (a IA) fazendo sua pesquisa em tempo real.

  1. O Aluno Pesquisa: O aluno sai, encontra novos fatos e escreve um rascunho.
  2. O Professor Adapta: O Professor Inteligente olha para o que o aluno encontrou. "Ah, eu não sabia que esse fato existia! Devo adicionar uma nova regra à minha lista de verificação: 'Deve explicar este novo fato'."
  3. O Ciclo de Feedback: O professor atualiza a lista de verificação enquanto o aluno está aprendendo. Se o aluno tentar trapacear (como copiar texto sem lê-lo), o professor imediatamente adiciona uma regra: "Nenhuma trapaça permitida".

Em termos técnicos, o artigo chama isso de Rubricas Evolutivas. São critérios de avaliação que mudam e ficam mais inteligentes à medida que a IA explora mais informações. Isso permite que a IA aprenda com suas próprias descobertas, em vez de ficar presa a um conjunto estático de regras.

O Resultado: Um Super-Pesquisador com Orçamento Limitado

Os autores treinaram o DR Tulu usando este método de "Professor Inteligente". Eis o que aconteceu:

  • É Mais Inteligente: O DR Tulu superou outros modelos de pesquisa de código aberto por uma grande margem. Escreveu melhores relatórios, encontrou fatos mais precisos e citou fontes corretamente.
  • Concorre com os Gigantes: Desempenhou-se tão bem quanto (e às vezes melhor do que) sistemas proprietários e caros de grandes empresas como OpenAI e Google.
  • É Barato: Este é o maior ganho. Os sistemas caros custam cerca de US$ 1,80 por pergunta. O DR Tulu custa cerca de US$ 0,002 por pergunta. Isso é aproximadamente 1.000 vezes mais barato.

O Teste da "Doença Genética"

Para provar que realmente funciona, a equipe deu ao DR Tulu uma tarefa muito difícil: analisar mutações genéticas para ver se poderiam ser tratadas com medicamentos específicos. Esta é uma tarefa geralmente reservada para especialistas médicos humanos.

  • O DR Tulu pesquisou com sucesso em bancos de dados médicos, encontrou artigos relevantes e sintetizou um relatório.
  • Foi capaz de competir com os sistemas de IA mais caros e de código fechado nesta tarefa.
  • Outros modelos de código aberto falharam porque não conseguiam encontrar as citações corretas ou verificar os fatos.

O Kit de Ferramentas: "dr-agent-lib"

O artigo também lançou uma "caixa de ferramentas" chamada dr-agent-lib.

  • Pense nisso como um Canivete Suíço para pesquisadores de IA.
  • Permite que a IA use diferentes ferramentas: Pesquisa Google, leitura de páginas web específicas e busca de artigos acadêmicos.
  • Crucialmente, a IA aprende a escolher a ferramenta certa para o trabalho. Se a pergunta é sobre ciência, usa a ferramenta "Busca de Artigos". Se é sobre notícias gerais, usa "Pesquisa na Web". Não usa apenas uma ferramenta cegamente.

Resumo

O artigo apresenta o DR Tulu, uma IA de código aberto que aprende a fazer pesquisas profundas e de formato longo. Usa um método especial de treinamento (Rubricas Evolutivas) onde as "regras de avaliação" da IA são atualizadas em tempo real com base no que a IA descobre. Isso torna a IA muito mais inteligente, mais precisa e significativamente mais barata do que as ferramentas de pesquisa mais avançadas atuais. Os autores compartilharam o código, os dados e o modelo para que qualquer pessoa possa usá-los.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →