← Ultimi articoli
💬 NLP

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

Questo articolo introduce Math-PT, un nuovo dataset di benchmark composto da 1.729 problemi matematici in portoghese europeo e brasiliano tratti da competizioni ed esami nazionali, che rivela come, sebbene i modelli linguistici di grandi dimensioni all'avanguardia performino bene su domande a scelta multipla, le loro capacità declinino su compiti visivi e a risposta aperta.

Autori originali: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

Pubblicato 2026-04-30
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate che i Large Language Models (LLM) siano come studenti brillanti che hanno letto quasi ogni libro nella biblioteca mondiale. Per anni, abbiamo testato le loro abilità matematiche utilizzando esami scritti interamente in inglese. È come sottoporre uno studente a un esame di guida solo in inglese, per poi assumere che sappia guidare perfettamente in qualsiasi lingua solo perché ha superato quell'unico test.

Il documento MATH-PT sostiene che questo approccio presenta un enorme punto cieco. Introduce un nuovo "esame di guida" scritto specificamente in portoghese (sia nella variante europea che in quella brasiliana) per verificare se questi studenti AI riescano effettivamente a gestire la matematica quando cambia la lingua.

Ecco la sintesi dei loro risultati utilizzando analogie semplici:

1. Il Problema: La Biblioteca "Solo Inglese"

La maggior parte dei benchmark matematici (come MATH o MathVista) è come una biblioteca in cui ogni libro è in inglese. Anche quando i ricercatori cercano di testare altre lingue, si limitano a tradurre i libri inglesi. Gli autori affermano che questo è ingiusto perché non ci dice se l'IA comprende davvero i concetti matematici o se sta semplicemente memorizzando schemi inglesi. Hanno voluto costruire una biblioteca di problemi matematici nati in portoghese, tratti da vere Olimpiadi di matematica e esami scolastici portoghesi e brasiliani.

2. Il Nuovo Test: MATH-PT

Il team ha creato un dataset chiamato MATH-PT con 1.729 problemi.

  • La Fonte: Non si sono limitati a tradurre; hanno scavato negli archivi originali di competizioni come le Olimpíadas Portuguesas da Matemática e l'OBMEP brasiliana.
  • La Varietà: Il test copre tutto, dagli indovinelli della quinta elementare alle sfide pre-universitarie.
  • Il Formato: Include domande a scelta multipla (come un foglio a griglia) e domande a risposta aperta (dove è necessario scrivere la risposta da zero). Crucialmente, molte domande includono diagrammi e figure (come forme geometriche), che il team ha preservato accuratamente tramite codice affinché l'IA potesse "vederli".

3. I Risultati: Il "Brillante" contro lo "Che Fatica"

Hanno testato 13 diversi modelli AI, dai più potenti modelli "frontiera" (i supergeni) ai modelli open-source più piccoli (gli studenti medi).

  • Il Vantaggio della Scelta Multipla: Pensate alle domande a scelta multipla come a un gioco di "Trova le Differenze". I modelli AI erano molto bravi in questo. Anche i modelli più piccoli riuscivano spesso a indovinare correttamente la lettera giusta (A, B, C, D o E).
  • La Lotta della Risposta Aperta: Quando il test è passato alle domande a risposta aperta (dove l'IA deve generare la risposta da sola), i punteggi sono scesi significativamente. È la differenza tra riconoscere un volto in una fila e disegnare quel volto a memoria. L'IA ha faticato di più quando ha dovuto "pensare" e scrivere la risposta da sola invece di sceglierne semplicemente una.
  • Il Problema della "Foto": Questo è stato l'ostacolo più grande. Quando una domanda includeva un diagramma (un'immagine), le prestazioni dell'IA sono crollate. Anche i modelli più intelligenti si sono confusi quando dovevano interpretare una forma visiva insieme al testo. È come chiedere a uno studente di risolvere un problema di geometria indossando una benda sugli occhi; possono leggere le parole, ma non riescono a "vedere" la forma.

4. I Vincitori e i Perdenti

  • I Campioni: I modelli "frontiera" (come GPT-5 e Qwen3-235B) sono stati i chiari vincitori. Hanno gestito bene la matematica portoghese, specialmente le domande a scelta multipla.
  • Gli In difficoltà: I modelli open-source più piccoli (come Llama-3 e Gemma-3) hanno trovato la matematica molto più difficile. La loro accuratezza è crollata drasticamente man mano che le domande diventavano più difficili o includevano immagini.
  • L'Effetto di Scalabilità: Il documento ha rilevato che per la famiglia di modelli Qwen, rendere il modello più grande (aggiungendo più "potenza cerebrale") ha aiutato molto. È come passare da una bicicletta a un'auto sportiva; i modelli più grandi hanno gestito i compiti di ragionamento complesso molto meglio di quelli più piccoli.

La Conclusione

Il documento conclude che, sebbene l'IA stia diventando molto brava in matematica, ha ancora un "bias linguistico" e fatica quando il test diventa più difficile (risposta aperta) o visivo (diagrammi). Rilasciando questo dataset in portoghese, gli autori stanno consegnando ai ricercatori un nuovo righello più equo per misurare quanto bene l'IA possa effettivamente pensare in lingue diverse dall'inglese. Non stanno dicendo che l'IA è già perfetta; stanno dicendo: "Ecco un nuovo test per mostrarci esattamente dove l'IA sta ancora imparando".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →