Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer
Questo articolo sfida la visione secondo cui le allucinazioni derivano esclusivamente dalla mancanza di conoscenze, rivelando che i grandi LLM addestrati con istruzioni spesso allucinano perché non riescono a impegnarsi per un concetto corretto già presente nella loro distribuzione di probabilità, disperdendo invece la massa di probabilità tra le alternative a causa di un meccanismo di affinamento dipendente dalla scala che guida sia l'utilità che gli errori sicuri.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
L'Idea Principale: Non Si Tratta di "Non Sapere"
La maggior parte delle persone pensa che le allucinazioni dell'IA (quando un'IA inventa cose) accadano perché l'IA semplicemente non sa la risposta. L'idea è: Se l'IA conosce il fatto, dice la verità. Se non lo conosce, indovina.
Questo documento sostiene che ciò è sbagliato.
I ricercatori hanno scoperto che spesso l'IA sa la risposta. Possiede le informazioni corrette "nella sua testa" nel momento stesso in cui inizia a parlare. Tuttavia, sceglie comunque di dire la cosa sbagliata. Chiamano questo un "Fallimento di Impegno".
L'Analogia: Lo Chef Nervoso
Immagina uno chef molto talentuoso (l'IA) a cui viene chiesto: "Qual è la capitale della Francia?"
- La Vecchia Teoria: Se lo chef non conosce la risposta, indovina "Londra". Se la conosce, dice "Parigi".
- La Nuova Teoria (Questo Documento): Lo chef sa che la risposta è Parigi. In effetti, sta pensando così intensamente a "Parigi" che il suo cervello rimbomba con la parola. Ma, poiché sta pensando a "Parigi" in così tanti modi diversi contemporaneamente (ad esempio, "Parigi", "paris", "la città delle luci", "capitale della Francia"), il suo cervello si confonde.
- Ha una forte sensazione per "Parigi", ma è spalmata su tutte quelle diverse frasi.
- Allo stesso tempo, ha un pensiero molto nitido e focalizzato su "Londra" (forse perché ha visto un'immagine del Big Ben in precedenza).
- Anche se la sensazione per "Parigi" è complessivamente più forte, il pensiero su "Londra" è così nitido e concentrato che vince la corsa alla sua bocca. Esplode dicendo "Londra" con sicurezza, anche se sapeva che era Parigi.
Come L'hanno Scoperto
I ricercatori hanno osservato come i modelli di IA "pensano" prima di parlare. Si sono concentrati sulla prima parola che l'IA genera (il "passo di impegno").
Hanno introdotto un nuovo modo per misurare ciò che l'IA sa, chiamato Massa di Probabilità Semantica.
- Vecchio Metodo: L'IA ha scelto la parola esatta giusta? (Ad esempio, ha detto "Parigi"?)
- Nuovo Metodo: L'IA aveva una forte sensazione riguardo al concetto di Parigi, anche se era divisa tra "Parigi", "paris" e "la città delle luci"?
I Risultati:
- Hanno testato molti modelli di IA (dai piccoli ai giganteschi).
- Hanno scoperto che dal 16% al 47% delle volte in cui l'IA commetteva un errore, aveva in realtà una forte "sensazione" per la risposta corretta.
- La Svolta: Più grande era il modello di IA, più spesso accadeva questo. I modelli più grandi non solo sapevano di più; commettevano più di questi specifici tipi di errori in cui conoscevano la risposta ma la sbagliavano comunque.
Perché Accade Questo? (L'Effetto di "Nitidezza")
Il documento suggerisce che il Fine-tuning delle Istruzioni (addestrare l'IA a essere utile e seguire le regole) cambia il modo in cui l'IA pensa.
Immagina il cervello dell'IA come un paesaggio di colline e valli.
- Prima dell'Addestramento: Le colline sono piatte e sfocate. L'IA è incerta.
- Dopo l'Addestramento: L'IA diventa molto decisa. Trasforma i suoi pensieri in picchi nitidi e alti.
- Quando l'IA ha ragione, il picco per la risposta corretta è così alto e nitido che vince facilmente.
- Ma, a volte l'IA si confonde. La risposta "corretta" è divisa in molte piccole colline piatte (perché sta pensando a "Parigi", "paris", "Francia", ecc.). Nel frattempo, la risposta "sbagliata" è un singolo picco incredibilmente nitido e alto.
- Il processo decisionale dell'IA è come una palla che rotola giù da una collina. Rotola sempre verso il punto più nitido. Anche se il lato "corretto" ha più "area di collina" totale, il lato "sbagliato" ha il picco più nitido, quindi la palla rotola lì.
I Due Tipi di Errori
I ricercatori hanno scoperto due modi in cui si verifica questo "Fallimento di Impegno":
- La Prima Parola Sbagliata: L'IA inizia la frase con la parola sbagliata immediatamente (ad esempio, dicendo "Mosca" invece di "Parigi"), anche se aveva una forte sensazione per Parigi.
- Il Percorso Sbagliato: L'IA inizia con la parola giusta (ad esempio, "Parigi") ma poi immediatamente esce dalla strada nelle parole successive, trasformando "Parigi" in una storia su una città diversa.
La "Tassa di Allineamento"
Il documento conclude che questo è un effetto collaterale del rendere i modelli di IA "utili".
- Per rendere un'IA sicura e veloce, la addestriamo a essere molto decisa (picchi nitidi).
- Questo funziona benissimo quando l'IA ha ragione.
- Ma quando l'IA è leggermente confusa, quella stessa "decisività" la rende sicura ma sbagliata. Non esita a scegliere la risposta sbagliata perché il suo cervello è così bravo a scegliere l'opzione "più nitida", anche se quell'opzione è errata.
Riepilogo
- Le allucinazioni non sono sempre ignoranza. A volte l'IA conosce la risposta ma fallisce nell'"impegnarsi" ad essa.
- I modelli più grandi non sono perfetti. Man mano che i modelli diventano più grandi, diventano migliori nel essere decisi, il che paradossalmente li rende più inclini ad essere sicuri ma sbagliati.
- Il problema è la distribuzione. L'IA sparge la sua "conoscenza" della risposta corretta troppo sottile su molte varianti, mentre la risposta sbagliata riceve tutto il focus in un unico punto nitido. L'IA sceglie il punto nitido, non la risposta corretta.
Il documento suggerisce che per risolvere questo problema, potremmo dover insegnare all'IA a guardare l'"intero concetto" (tutti i modi per dire "Parigi") piuttosto che scegliere semplicemente la singola parola più nitida.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.