Investigating LLM's Problem Solving Capability -- a Study on Statics Questions
Questo studio valuta le capacità dei Large Language Models nel risolvere problemi di statica attraverso un approccio di distillazione del modello, rivelando che, sebbene essi si comportino bene con domande puramente testuali, la loro accuratezza diminuisce significativamente quando sono richiesti diagrammi e ragionamenti multi-step a causa delle difficoltà nell'applicare coerentemente le informazioni visive piuttosto che limitazioni nel riconoscimento delle immagini.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di avere uno studente molto intelligente e colto di nome "ChatGPT", che ha letto quasi tutti i libri della biblioteca. Vuoi testare se questo studente è effettivamente in grado di risolvere difficili compiti di ingegneria, nello specifico in una materia chiamata Statica (che si occupa di come le forze si bilanciano su oggetti stazionari, come ponti o gru).
Ecco cosa hanno fatto i ricercatori, spiegato in modo semplice:
1. Il problema del "Copia e Incolla"
Per prima cosa, i ricercatori hanno provato la cosa ovvia: hanno preso veri quesiti dei libri di testo e hanno chiesto a ChatGPT di risolverli.
- Il Risultato: È stato un disastro. Lo studente si è confuso, specialmente quando i problemi coinvolgevano disegni 3D. Confondeva le direzioni (come dire "su" quando intendeva "destra") e sbagliava i calcoli.
- L'Analogia: Era come chiedere a uno studente di leggere una mappa scritta in una lingua che conosce appena. Conosceva le parole, ma non riusciva a capire le direzioni.
2. Il trucco dell' "Ingegneria Inversa" (Distillazione del Modello)
Poiché i quesiti dei libri di testo erano troppo difficili, i ricercatori hanno provato un trucco astuto chiamato Distillazione del Modello. Invece di chiedere allo studente di risolvere i quesiti di altre persone, hanno chiesto allo studente di scrivere le proprie domande.
- La Logica: Hanno pensato: "Se ChatGPT sa scrivere una buona domanda, probabilmente conosce la risposta a quel tipo specifico di domanda perché l'ha 'appresa' dai propri dati di addestramento".
- Il Processo: Hanno chiesto a ChatGPT di generare 50 problemi di statica. Hanno notato che lo studente continuava a scrivere sempre gli stessi problemi semplici, in 2D (piatti). Così, hanno scelto i 25 migliori quesiti unici che ChatGPT sembrava comprendere bene.
3. I tre livelli del test
I ricercatori hanno creato tre diversi "esami" usando quei 25 quesiti per vedere come funzionava il cervello dello studente:
- Esame A (Solo Testo): Hanno chiesto a ChatGPT di risolvere le domande che aveva scritto, usando solo le parole.
- Risultato: Punteggio Perfetto (100%). Lo studente conosceva le risposte perché aveva scritto lui stesso le domande!
- Esame B (Con Immagini): Hanno preso quegli stessi quesiti basati solo sul testo e hanno disegnato degli schemi semplici per essi.
- Risultato: Il punteggio è sceso al 68%. Lo studente era ancora in grado di leggere le parole, ma l'immagine lo mandava in confusione. Faceva fatica a collegare il disegno alla matematica.
- Esame C (Il test dei "Nuovi Numeri"): Hanno preso gli schemi dell'Esame B e hanno cambiato tutti i numeri (ad esempio, cambiando una forza da 10 libbre a 15 libbre).
- Risultato: Il punteggio è sceso al 60%. Questo ha dimostrato che lo studente non stava solo memorizzando le risposte. Stava cercando di risolvere il problema da zero, ma commetteva errori nel mezzo del processo.
4. Cosa hanno imparato?
I ricercatori hanno confrontato ChatGPT con un altro studente IA chiamato "Gemini".
- La Grande Scoperta: Il problema non era che l'IA non riuscisse a "vedere" le immagini. Il problema era che non riusciva a pensare per passaggi.
- L'Analogia: Immaginate uno chef che sa leggere perfettamente una ricetta (Solo Testo). Se gli date gli ingredienti e l'immagine del piatto (Diagramma), può ancora cucinare. Ma se gli chiedete di cucinare un pasto complesso a più portate dove deve modificare la ricetta a metà percorso (Ragionamento multi-step), inizia a far cadere gli ingredienti o a dimenticare il passaggio successivo (Ragionamento multi-step).
- La Conclusione: L'IA è brava in matematica semplice, a un solo passaggio. Ma quando deve guardare un'immagine, estrarre le informazioni e poi usare quelle informazioni in tre o quattro passaggi diversi per ottenere un risultato finale, si perde. Segue il metodo corretto, ma spesso ottiene il numero sbagliato alla fine.
Riassunto
L'articolo conclude che, sebbene l'IA stia diventando molto brava a leggere e scrivere, è ancora un po' goffa quando si tratta di ragionamento visivo e di catene di logica lunghe e complesse. È come uno studente che conosce perfettamente la teoria, ma si blocca quando gli viene chiesto di applicarla a un disegno reale con numeri variabili.
Nota: I ricercatori hanno testato solo questi specifici problemi di ingegneria. Non hanno affermato che questo si applichi alle diagnosi mediche, ai consigli legali o altri campi, né hanno suggerito come correggere l'IA per il futuro. Si sono limitati a riferire come l'IA si è comportata su questo specifico insieme di enigmi ingegneristici.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.