← Últimos artigos
🤖 AI

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

O artigo apresenta o ScientistOne, um sistema de pesquisa autônomo construído sobre uma estrutura de Cadeia de Evidências que garante verificabilidade por construção, eliminando assim citações alucinadas e alcançando verificação de pontuação perfeita e alinhamento superior entre método e código, ao mesmo tempo que iguala ou supera o desempenho de especialistas humanos em diversas tarefas de pesquisa de fronteira.

Autores originais: Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarishi Sinha, Parthasarathy Ranganathan, Burak Gokturk, Jinsung Yoon, Tomas Pfister

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarishi Sinha, Parthasarathy Ranganathan, Burak Gokturk, Jinsung Yoon, Tomas Pfister

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde você pode contratar um cientista robô para fazer sua lição de casa, escrever seu artigo de pesquisa e até mesmo publicá-lo. Você esperaria que o robô fosse inteligente, certo? Mas e se o robô for um contador de histórias habilidoso que inventa fatos, cria fontes falsas e escreve uma bela narrativa que não corresponde à realidade desordenada de seus experimentos?

Esse é o problema que o ScientistOne visa resolver.

O Problema: O Cientista de "Notícias Falsas"

O artigo explica que os agentes de pesquisa de IA atuais estão ficando muito bons em duas coisas:

  1. Fazer o trabalho: Eles podem escrever código e executar experimentos.
  2. Escrever a história: Eles podem produzir artigos que parecem profissionais e soam convincentes.

No entanto, há uma lacuna perigosa entre a história e a verdade. O artigo chama isso de "falha de verificabilidade".

Pense nisso como um mágico tirando um coelho de um chapéu.

  • O Jeito Antigo: O mágico (a IA) diz: "Olhe, um coelho!" e você vê um coelho. Você acredita. Mas você não sabe se o coelho estava realmente lá, se era um adereço falso ou se o mágico apenas o tirou do bolso.
  • A Realidade: Em 75 artigos testados pelos pesquisadores, quase todos os sistemas de IA cometeram erros. Alguns inventaram citações (livros falsos que não existem). Alguns relataram pontuações impossíveis de reproduzir. Alguns descreveram uma máquina complexa no artigo, mas o código que enviaram era, na verdade, um brinquedo simples e quebrado.

O artigo descobriu que até 21% das referências em alguns artigos de IA eram completamente inventadas. É como um aluno escrevendo um ensaio de história e citando um livro que nunca foi escrito.

A Solução: A "Cadeia de Evidências"

Para corrigir isso, os pesquisadores criaram uma nova regra chamada Cadeia de Evidências (CoE).

Imagine que você está construindo uma casa.

  • Sem CoE: Você apenas pinta as paredes e coloca um letreiro "À Venda". Parece bonito, mas a fundação pode ser feita de papelão.
  • Com CoE: Cada tijolo na parede deve ter um recibo. Cada viga deve ter uma etiqueta mostrando exatamente de onde veio. Se você afirmar que a casa é "À Prova de Terremotos", deve mostrar o relatório de engenharia que prova isso.

O ScientistOne é um novo sistema de IA construído do zero para seguir essas regras. Ele não apenas escreve um artigo; ele constrói uma cadeia de prova para cada frase que escreve.

Como o ScientistOne Funciona (O Processo de Três Etapas)

  1. O Detetive (Investigador de Problemas):
    Antes de escrever qualquer coisa, esta parte do robô vai à biblioteca (bases de dados acadêmicas) e lê 100 livros reais. Ela não adivinha quais livros existem; ela baixa os PDFs reais. Ela constrói um mapa de fatos reais. Se não encontrar uma fonte, não a usa. Isso impede o problema do "livro falso".

  2. O Explorador (Motor de Descoberta):
    Esta parte tenta resolver o problema de matemática ou ciência. Ela executa experimentos e mantém um registro rigoroso de cada número que obtém. É como um cientista mantendo um caderno de laboratório onde cada número está vinculado a uma execução de teste específica.

  3. O Editor (Escritor de Artigos e Verificador de Afirmações):
    Esta é a parte mais importante. Quando o robô escreve o artigo, ele não apenas digita palavras. Ele escreve uma frase e imediatamente anexa uma "etiqueta" a ela.

    • Frase: "Nosso método é 50% mais rápido."
    • Etiqueta: [Link para o Caderno de Laboratório, Página 4, Linha 12].

    Antes que o artigo seja concluído, um Verificador de Afirmações verifica cada etiqueta. Ele pergunta: "Esse número realmente existe no caderno? Este livro é real?" Se a resposta for "Não", a frase é excluída ou corrigida. É como um editor rigoroso que se recusa a publicar uma história a menos que cada fato seja respaldado por um recibo.

Os Resultados: Quem Passou no Teste?

Os pesquisadores testaram o ScientistOne contra outros cinco sistemas de pesquisa de IA usando uma "Auditoria de Integridade". Eles verificaram quatro coisas:

  1. As pontuações corresponderam? (O artigo dizia 90% e o código realmente obteve 90%?)
  2. Eles trapacearam? (O código tentou enganar o teste?)
  3. As referências são reais? (Os livros existem?)
  4. O código corresponde à história? (Eles descreveram um Ferrari, mas enviaram uma bicicleta?)

Os Resultados:

  • Os Outros Sistemas: Todos falharam em pelo menos um teste. Alguns tinham referências falsas. Alguns tinham pontuações que não correspondiam. Alguns descreviam algoritmos que não existiam em seu código.
  • ScientistOne: Foi o único sistema a passar em tudo.
    • 0 referências falsas (de 337).
    • 100% de precisão nas pontuações (cada número correspondeu).
    • 93% de alinhamento de código (a história correspondeu ao código).

Além do Teste

Os pesquisadores também testaram o ScientistOne em outras seis tarefas difíceis, como imageamento médico e detecção de objetos 3D. Nessas provas, o ScientistOne não apenas passou na verificação de integridade; ele realmente venceu. Ele ganhou "Medalhas de Ouro" em competições onde os outros sistemas de IA falharam completamente ou produziram resultados inválidos.

A Grande Conclusão

O artigo conclui que a confiança é uma característica arquitetônica. Você não pode apenas adicionar uma "verificação de confiança" no final de um processo; você precisa construir o sistema de modo que ele não possa mentir sem quebrar sua própria cadeia de evidências.

O ScientistOne prova que uma IA pode ser tanto uma pesquisadora de alto desempenho quanto uma veraz, mas apenas se for projetada para manter um recibo para cada afirmação que faz. É a diferença entre um mágico que te engana e um cientista que te mostra a matemática.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →