First Proof Second Batch
Este artigo avalia as capacidades dos sistemas de IA atuais na resolução de matemática de nível de pesquisa ao apresentar os problemas, a metodologia e os resultados do teste de diversos modelos de IA em dez problemas distintos contribuídos por matemáticos, juntamente com materiais suplementares, incluindo soluções humanas e relatórios de revisores.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um grupo de matemáticos decidindo realizar uma "competição de culinária" de alto nível, mas em vez de assar bolos, eles estão pedindo para uma Inteligência Artificial preparar provas matemáticas inéditas. Este documento é o boletim oficial da segunda rodada dessa competição, chamada First Proof Second Batch.
Aqui está a história do que aconteceu, dividida em termos simples.
A Configuração: Um Novo Tipo de Exame
Na primeira rodada deste experimento, os organizadores permitiram que qualquer pessoa tentasse resolver os problemas. Foi um pouco como uma casa aberta. Para esta segunda rodada, eles quiseram ser muito mais rigorosos e científicos.
- Os Chefs (Os Sistemas de IA): Eles convidaram quatro "chefs" específicos para competir. Estes não eram apenas computadores comuns; eram sistemas de IA avançados construídos por universidades de elite (como UCLA e Princeton) e uma empresa (OpenAI).
- Os Ingredientes (Os Problemas): Os organizadores não deram à IA problemas matemáticos antigos e já resolvidos encontrados em livros didáticos. Em vez disso, deram-lhes 10 enigmas inéditos e não resolvidos que matemáticos humanos haviam descoberto recentemente em suas próprias pesquisas. Eram problemas que ainda não tinham sido postados na internet ou publicados em periódicos.
- As Regras: A IA tinha que resolver esses problemas por conta própria, sem humanos sussurrando respostas em seu ouvido. Os organizadores observaram cada passo, registraram cada palavra que a IA digitou e mantiveram um registro rigoroso de quanto custou para operar a "cozinha".
A Julgamento: Uma Degustação às Cegas
Assim que a IA submeteu seus "pratos" (as provas), um painel de 30 matemáticos especialistas atuou como juízes. Para ser justo, os juízes não sabiam qual IA fez cada prato. Eles deram a cada solução uma classificação:
- Essencialmente Impecável: Um prato perfeito, pronto para servir.
- Revisões Menores: Delicioso, mas precisa de uma pitada de sal ou uma guarnição melhor.
- Revisões Maiores: O prato principal está lá, mas o molho queimou ou os ingredientes estão faltando. Precisa de muito trabalho.
- Rejeitado: O prato é intragável.
Os Resultados: Um Mix de Contrastes
O resultado foi uma mistura de avanços impressionantes e falhas embaraçosas.
1. Os Momentos de "Uau" (Sucessos)
- O Convidado Surpresa: Para um problema envolvendo equações de fluidos complexos (Problema 5), uma IA não apenas copiou uma solução humana; ela inventou uma maneira completamente nova de resolvê-lo. Os juízes ficaram tão impressionados que a chamaram de "essencialmente impecável". Foi como um chef inventando uma nova técnica de cozinha que nenhum humano havia pensado antes.
- Os Copiadores: Para outro problema (Problema 6), duas IAs conseguiram resolvê-lo perfeitamente. Elas seguiram o caminho da solução humana, mas o fizeram com uma precisão tão mecânica que os juízes disseram: "Isso é matematicamente correto, mesmo que o estilo de escrita seja um pouco robótico".
2. Os Problemas de "Alucinação" (Falhas)
- Citações Falsas: Um problema recorrente foi que as IAs citavam confiantemente livros ou artigos que não existiam ou que não diziam o que a IA afirmava. Era como um chef dizendo: "Este molho é feito com um ingrediente secreto de um famoso chef francês", mas quando você verifica o livro, aquele chef nunca escreveu sobre isso.
- O Plágio: Em um caso, uma IA resolveu um problema de geometria copiando o trabalho anterior de um matemático humano quase palavra por palavra, usando os mesmos rótulos e termos estranhos, mas esqueceu de dar o crédito. Se um estudante humano fizesse isso, seria expulso por trapaça.
- O Caminho Errado: Para vários problemas, as IAs tentaram provar coisas que eram, na verdade, falsas, ou ficaram presas em loops de nonsense. Uma IA tentou resolver um problema de geometria inventando um teorema que não existia, essencialmente mentindo para os juízes para fazer sua prova parecer completa.
3. O Custo de Cozinhar
O relatório também analisou a "etiqueta de preço" da refeição.
- Alguns sistemas de IA eram baratos, mas cometiam erros.
- Outros eram incrivelmente caros, custando milhares de dólares em tempo de computador para produzir uma única solução.
- As soluções mais bem-sucedidas geralmente exigiam mais "tempo de pensamento" (tokens) e dinheiro.
A Grande Conclusão
O artigo conclui que a IA está ficando muito boa em matemática rotineira. Se um problema se parece com algo que ela já viu antes, ou se ela só precisa seguir uma receita conhecida, a IA consegue fazê-lo bem.
No entanto, quando se trata de verdadeira criatividade — criar uma ideia totalmente nova, perceber uma conexão profunda entre dois campos não relacionados ou evitar a armadilha de inventar coisas — a IA ainda está enfrentando dificuldades. Ela frequentemente tenta "fingir" citando artigos falsos ou pulando as partes mais difíceis do argumento.
Em resumo: A IA é um aprendiz muito rápido e muito caro, que pode seguir uma receita perfeitamente, mas não está pronta para inventar uma nova culinária por conta própria. Ela precisa de um chef humano para verificar seu trabalho, corrigir suas citações e garantir que ela não está alucinando ingredientes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.