← Ultimi articoli
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

Questo articolo presenta ProofCouncil, un agente LLM open-source che utilizza un'architettura autore-critico e che ha raggiunto prestazioni state-of-the-art nella sfida FirstProof risolvendo autonomamente sei di dieci problemi matematici del mondo reale e dimostrando progressi significativi su un insieme più ampio di problemi aperti.

Autori originali: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

Pubblicato 2026-07-13
📖 5 min di lettura🧠 Approfondimento

Autori originali: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di aver consegnato a un robot nuovissimo e super intelligente una pila dei più sconcertanti enigmi matematici del mondo. Non si tratta dei soliti indovinelli del tipo "trova il numero mancante"; sono problemi aperti su cui veri matematici umani si stanno scervellando da anni, senza che nessuno conosca ancora la risposta.

Entra in scena ProofCouncil. Immaginalo non come un singolo robot, ma come un piccolo laboratorio matematico ad alta tensione.

Il Team del Laboratorio: Autore, Critico e la Squadra

Il cuore di questo sistema è un astuto gioco della "patata bollente" giocato tra due personaggi principali: l'Autore e il Critico.

  • L'Autore è il sognatore. È un'IA che si mette al lavoro per scrivere una prova perfetta (un argomento matematico passo dopo passo) per un problema. Ha un taccuino magico dove scarabocchia idee, prova del codice e persino cerca indizi sul web.
  • Il Critico è l'editor severo. Legge ciò che l'Autore ha scritto e dice: "Aspetta, questo passaggio non ha senso", oppure "Hai dimenticato di dimostrare questa parte!". Non si limita a dire "sbagliato"; fornisce feedback specifici su come colmare le lacune.

Il colpo di scena è che l'Autore non scrive solo una volta. Scrive, riceve critiche, riscrive, riceve altre critiche e continua così. È come un autore e un editor chiusi in una stanza, che rifiniscono una storia finché non è perfetta.

Ma a volte l'Autore si blocca. È allora che chiama il Consiglio e il Nodo di Calcolo.

  • Il Consiglio è un panel di altri modelli di IA super intelligenti (come un team di esperti ospiti). L'Autore chiede loro: "Ehi, sono bloccato su questa parte specifica; c'è un modo diverso di guardarla?".
  • Il Nodo di Calcolo è il braccio destro che fa il lavoro pesante. Se il problema richiede un calcolo massiccio o un software matematico specializzato che l'Autore non può eseguire da solo, questo nodo esegue il lavoro pesante, facendo girare codice e macinando numeri per verificare se un'intuizione è vera.

Ogni pochi round, il Critico si prende una "pausa mentale" e ricomincia da zero con un foglio bianco. Questo è fondamentale perché, se il Critico si abituasse troppo agli errori dell'Autore, potrebbe smettere di vederli. Un paio di occhi freschi assicura che la prova sia effettivamente solida.

Il Grande Test: La Sfida FirstProof

Il team ha sottoposto ProofCouncil all'ultimo test: una sfida chiamata FirstProof. Le regole erano semplici ma brutali: risolvere 10 problemi matematici reali e insoluti in 24 ore, usando solo strumenti pubblici.

I risultati? ProofCouncil è stato la stella dello spettacolo. Su 10 problemi, è riuscito a produrre soluzioni per 6 di essi che i referee umani hanno giudicato corrette (con solo piccoli e minori aggiustamenti necessari). Questa è stata la migliore performance di qualsiasi team nella competizione.

Hanno provato anche su altri 30 problemi aperti inviati da veri matematici. Dei 21 problemi di cui hanno ricevuto un feedback:

  • 5 sono stati giudicati come soluzioni completamente corrette.
  • 2 sono stati visti come molto promettenti, in attesa di un controllo finale.
  • 8 hanno fatto progressi utili, anche se non hanno finito il lavoro.
  • 4 non presentavano errori ma non hanno realmente fatto avanzare la situazione.
  • 2 hanno frainteso la domanda e ne hanno risolta una versione più facile.

Importante: nessun esperto ha dichiarato che gli output fossero matematicamente errati in un modo che violasse la logica. Il fallimento principale non è stato la cattiva matematica; era talvolta il fraintendimento del testo del problema.

Il Costo del Genio

Ecco l'intoppo: essere così intelligenti è costoso. Far girare ProofCouncil su un singolo problema è costato circa 350 dollari in tempo di calcolo e chiamate ai modelli. Confrontalo con un tentativo di IA più semplice, "single-shot", che è costato solo 12 dollari ma ha risolto meno problemi. Il paper suggerisce che, sebbene l'approccio "a squadra" funzioni meglio, è attualmente un articolo di lusso. Gli autori ammettono di non aver ancora cercato di renderlo più economico, lasciando questo compito ai futuri ricercatori.

Cosa Non Ha Fatto (E Cosa Non Ha Rivendicato)

È importante sapere cosa questo robot non ha fatto.

  • Non ha risolto tutti i 10 problemi della sfida (ne ha mancati 4).
  • Non ha prodotto un articolo di ricerca rifinito e pronto per la pubblicazione. I matematici che hanno revisionato il lavoro hanno notato che la scrittura era densa e necessitava di un editing umano per essere leggibile da non esperti.
  • Non ha "dimostrato" che l'IA può risolvere qualsiasi problema matematico. Ha mostrato che, per alcuni problemi difficili, un team di IA che lavorano insieme è migliore di un'IA che lavora da sola.

Il Punto Fondamentale

ProofCouncil suggerisce che, se vuoi risolvere un problema matematico aperto e davvero difficile, non devi solo chiedere a un'IA di "risolvere il problema". Hai invece bisogno di un sistema in cui un'IA scriva, un'altra lo faccia a pezzi, una terza offra prospettive fresche e una quarta esegua i calcoli matematici pesanti.

Nel mondo della sfida FirstProof, questo team "Autore-Critico-Consiglio" è stata la strategia più efficace testata finora. Non ha conquistato l'intera montagna, ma è salita più in alto di chiunque altro, dimostrando che quando gli agenti di IA lavorano insieme come un team di ricerca umano, possono affrontare problemi che prima erano considerati fuori portata.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →