← Últimos artigos
🤖 AI

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

O artigo apresenta "Formal Conjectures", um benchmark dinâmico e de código aberto composto por 2.615 problemas matemáticos formalizados em Lean 4, provenientes de pesquisa ativa, projetado para avaliar e impulsionar as capacidades de sistemas de raciocínio automatizado na descoberta de novas provas, ao mesmo tempo que garante a integridade dos dados por meio da colaboração comunitária e da verificação auditada por IA.

Autores originais: Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

Publicado 2026-05-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a fazer matemática avançada. No passado, você poderia ter dado ao robô uma pilha de antigos exercícios de matemática. Mas há um grande problema: o robô poderia simplesmente ter memorizado as respostas da internet em vez de realmente aprender a pensar. É como um aluno que memorizou o gabarito de uma prova, mas não entende a matemática.

Este artigo apresenta uma nova e mais inteligente maneira de testar esses robôs. Eles chamam isso de Conjecturas Formais.

Veja como funciona, dividido em ideias simples:

1. O Teste de "Carne Fresca" (Sem Contaminação)

A maioria dos testes de matemática para IA está "velha". As respostas já estão online, então a IA pode estar apenas copiando-as.

  • A Analogia: Imagine uma competição de culinária onde os juízes dão aos chefs uma receita que nunca viram antes, escrita em um código secreto. Se o chef conseguir preparar o prato, ele realmente sabe cozinhar. Se não conseguir, está apenas chutando.
  • A Solução do Artigo: Os autores criaram uma biblioteca de 1.029 problemas matemáticos não resolvidos (conjecturas). São problemas que matemáticos humanos reais estão tentando resolver atualmente. Como ninguém os resolveu ainda, a IA não pode ter memorizado as respostas. Se a IA resolver um, é uma descoberta genuína, não um trabalho de copiar e colar.

2. O "Juiz Rigoroso" (Lean 4)

Na matemática normal, você pode escrever uma prova que parece boa, mas tem um pequeno erro lógico. Humanos podem não percebê-lo.

  • A Analogia: Pense em um videogame onde você precisa construir uma ponte. Se usar um tijolo fraco, a ponte desaba. Neste artigo, a "ponte" é uma prova matemática. Os autores usam uma linguagem de computador especial chamada Lean 4 como juiz.
  • A Solução do Artigo: O Lean 4 é como um árbitro super rigoroso. Não importa se sua prova parece bonita; ele verifica cada passo lógico individual. Se houver até mesmo um pequeno erro, o árbitro diz: "Não, isso está errado". Isso garante que, quando a IA diz que resolveu um problema, ela realmente o fez.

3. A "Biblioteca Viva" (Um Benchmark Evolutivo)

Geralmente, uma vez que um teste é criado, ele permanece o mesmo para sempre. Mas a IA fica mais inteligente todos os dias, então testes antigos tornam-se fáceis demais.

  • A Analogia: Imagine um videogame que atualiza toda semana. À medida que os jogadores ficam melhores, o jogo adiciona níveis mais difíceis e corrige bugs no mapa.
  • A Solução do Artigo: Este benchmark é um projeto "vivo".
    • Ele cresce: Eles continuam adicionando novos problemas de artigos de pesquisa reais.
    • Ele se corrige: Às vezes, os próprios problemas matemáticos são escritos de forma vaga. Quando a IA tenta resolvê-los, pode falhar porque o problema estava pouco claro. Essa falha ajuda matemáticos humanos a perceberem: "Ah, escrevemos esse problema errado!". Eles então corrigem a declaração do problema.
    • Ele tem duas trilhas:
      1. A Trilha de Descoberta: Tentar resolver os problemas não resolvidos (a "carne fresca").
      2. A Trilha de Tradução: Pegar problemas que humanos resolveram e ensinar à IA a escrevê-los na linguagem de computador rigorosa (Lean 4).

4. A "Rede de Segurança" (Evitando Trapaças)

Os autores estão preocupados com "vazamento de dados" (a IA trapaceando ao ver as respostas em seus dados de treinamento).

  • A Analogia: Para impedir que alunos trapaceiem, os professores às vezes trancam o gabarito em um cofre e só o abrem após a prova.
  • A Solução do Artigo: Eles criaram uma versão "congelada" do teste. Esta é uma instantânea de 100 problemas travada no tempo. Mesmo que a biblioteca principal mude depois, esta instantânea específica permanece a mesma, para que cientistas possam comparar diferentes modelos de IA de forma justa, sem se preocupar com o teste mudando sob seus pés.

5. Por Que Isso Importa

O artigo mostra que este sistema já está funcionando.

  • Resultados Reais: Eles mencionam que, usando este sistema, uma IA (chamada Aristóteles) ajudou um matemático humano a resolver um problema famoso que estava aberto há muito tempo (Problema de Erdős 124).
  • O Sinal: O benchmark fornece um "sinal escalável" claro. Mostra exatamente o quanto a IA evoluiu e o quanto ainda precisa ir. Se uma IA resolver 10% dos problemas não resolvidos, isso é um grande feito. Se resolver 0%, ainda não está pronta.

Resumo

Conjecturas Formais é um novo playground em constante atualização para matemáticos de IA. Usa um árbitro de computador rigoroso (Lean 4) para verificar o trabalho, foca em problemas que ainda não foram resolvidos para evitar trapaças e atua como uma ferramenta colaborativa onde humanos e IA ajudam-se mutuamente a esclarecer questões matemáticas difíceis. Não é apenas um teste; é uma ferramenta para fazer descobertas matemáticas reais.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →