← Últimos artigos
💬 NLP

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

Este artigo apresenta o CORE-Bench, um benchmark abrangente composto por 270 tarefas em três disciplinas científicas, projetado para avaliar e melhorar a capacidade de agentes de IA de reproduzir computacionalmente resultados de pesquisa, destacando limitações atuais significativas na automação de fluxos de trabalho científicos.

Autores originais: Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

Publicado 2026-06-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef que acabou de publicar uma receita famosa para um suflê perfeito. Você diz ao mundo: "Aqui está a receita, aqui estão os ingredientes e aqui está uma foto do resultado fofinho". Mas quando seus amigos tentam fazer, o suflê desmorona, queima ou tem gosto de papelão. Por quê? Talvez eles tenham usado o forno errado, a marca errada de ovos, ou perderam um passo porque suas instruções foram vagas.

No mundo da ciência, isso é chamado de crise de reprodutibilidade. Cientistas publicam artigos com código e dados, mas outros pesquisadores frequentemente não conseguem obter os mesmos resultados quando tentam executar esse código.

Este artigo apresenta uma nova "cozinha de testes" chamada CORE-Bench para ver se robôs de IA (chamados de "agentes") podem ser contratados para consertar essa bagunça.

O Problema: A "Caixa Preta" da Ciência

A ciência depende da confiança. Se um estudo diz que um novo medicamento funciona, precisamos ser capazes de executar a mesma matemática e o mesmo código para verificar. Mas, muitas vezes, o código é bagunçado, o software está desatualizado ou as instruções estão faltando. É como tentar montar um móvel da IKEA sem as instruções, usando ferramentas que você não tem, em uma sala com a iluminação errada.

A Solução: Um Novo "Teste de Chef Robô"

Os autores construíram o CORE-Bench, um enorme circuito de obstáculos para agentes de IA.

  • A Configuração: Eles pegaram 90 artigos científicos reais de ciência da computação, medicina e ciências sociais.
  • A Tarefa: Eles pediram a agentes de IA para agirem como assistentes de pesquisa. O trabalho do agente é:
    1. Baixar o código e os dados.
    2. Instalar todo o software necessário (como baixar os aplicativos certos para um novo celular).
    3. Executar o código.
    4. Analisar os resultados (gráficos, números, texto) e responder a perguntas específicas sobre eles.
    5. Enviar um relatório dizendo: "Obtive o mesmo resultado do artigo original".

Os Níveis de Dificuldade

Assim como em um videogame, o teste tem três níveis:

  1. Modo Fácil: A IA recebe a "foto" final do resultado. Ela só precisa olhar para a imagem e responder às perguntas. (Como ser solicitado a ler um menu).
  2. Modo Médio: A IA recebe um contêiner "Docker" (uma caixa pré-embalada de ferramentas) e é instruída a executá-lo. Ela precisa saber como abrir a caixa e apertar o botão "iniciar".
  3. Modo Difícil: A IA recebe apenas a "receita" (o arquivo README). Ela tem que descobrir quais ferramentas comprar, instalá-las, corrigir quaisquer erros e executar o código do zero. Este é o teste do mundo real.

Os Resultados: Os Robôs Ainda Estão Aprendendo

Os pesquisadores testaram dois tipos de "chefs" de IA:

  1. AutoGPT: Um robô de propósito geral que tenta fazer qualquer coisa.
  2. CORE-Agent: Um robô especificamente treinado e orientado para fazer este trabalho específico.

O Placar:

  • No Modo Fácil: O robô especializado (CORE-Agent) foi muito bem, acertando cerca de 60% das tarefas.
  • No Modo Difícil: A pontuação caiu significativamente. Mesmo o melhor robô acertou apenas 21% das tarefas mais difíceis.

O que deu errado?

  • Perder-se: Os robôs frequentemente olhavam para o gráfico ou arquivo errado quando havia muitos arquivos na pasta.
  • A Armadilha da Instalação: No nível difícil, os robôs ficaram presos tentando instalar softwares. Eles tentavam instalar a mesma coisa repetidamente, ficavam sem dinheiro (custos de API) e desistiam.
  • Problemas de Visão: Era muito mais difícil para os robôs "lerem" gráficos e imagens do que ler texto puro.
  • Problemas de Linguagem: Os robôs tiveram mais dificuldade com códigos escritos na linguagem R em comparação com Python.

A Conclusão

O artigo conclui que, embora a IA esteja melhorando na codificação, ela ainda está longe de ser capaz de reproduzir de forma confiável pesquisas científicas complexas por conta própria.

No entanto, há boas notícias: o treinamento especializado ajuda. Quando os pesquisadores deram ao robô geral algumas dicas e regras específicas (como "sempre verifique a pasta de saída primeiro" ou "não adivinhe, olhe o arquivo"), seu desempenho saltou significativamente.

O Ponto Principal:
Não podemos simplesmente entregar um artigo científico a um robô e esperar que ele verifique a ciência hoje. Mas, se dermos ao robô um pouco de orientação e as ferramentas certas, ele pode começar a ajudar. O objetivo não é substituir os cientistas, mas construir um "assistente robô" que possa realizar o trabalho chato e repetitivo de verificar se a matemática realmente fecha, liberando os humanos para a verdadeira descoberta.

Os autores esperam que, ao lançar este teste (CORE-Bench), outros desenvolvedores construam robôs melhores para ajudar a tornar a ciência mais confiável.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →