Reported Confidence in LLMs Tracks Commitment More Than Correctness
Questo articolo dimostra che i report di fiducia verbali nei grandi modelli linguistici riflettono principalmente uno stato interno di "prontezza all'impegno" che guida la decisione di rispondere, piuttosto che l'effettiva correttezza della risposta, distinguendoli fondamentalmente dalle log-probabilità che tracciano l'evidenza della risposta.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di porre un enigma a un assistente robotico molto intelligente, ma leggermente misterioso. Gli chiedi: "Qual è la capitale della Francia?". Lui riflette un momento e dice: "Parigi". Poi gli chiedi: "Quanto sei sicuro?".
Il robot risponde: "Sono sicuro al 100%".
Nel mondo dell'Intelligenza Artificiale (IA), di solito assumiamo che quando il robot dice "sono sicuro al 100%", intenda dire: "Ho controllato il mio database interno e sono statisticamente sicuro che questa risposta sia corretta".
Tuttamente, un nuovo studio di Google DeepMind suggerisce che potremmo fraintendere la fiducia del robot. I ricercatori hanno scoperto che quando un'IA dice di essere "sicura", non sta necessariamente dicendo: "La mia risposta è giusta". Inveve, sta spesso dicendo: "Sono pronta a sostenere questa risposta, anche se potrebbe essere sbagliata".
Ecco una suddivisione delle loro scoperte utilizzando analogie semplici.
I due tipi di "fiducia"
Lo studio ha confrontato due modi diversi in cui il robot misura la propria certezza:
La "Fiducia Matematica" (Log-Probabilità): Questa è come una calcolatrice. Guarda i numeri grezzi e le probabilità delle sue opzioni. Se la matematica dice che "Parigi" è probabile al 99%, la calcolatrice è sicura.
- La scoperta: Questo tipo di fiducia è un buon giudice della verità. Se la matematica dice che è sicura, la risposta è solitamente corretta. Se la matematica dice che non è sicura, la risposta è solitamente errata.
La "Fiducia Verbale" (Le parole del robot): Questo accade quando chiedi direttamente al robot: "Quanto sei sicuro?" e lui risponde con parole o su una scala numerica (come "Molto sicuro").
- La scoperta: Questo tipo di fiducia è un cattivo giudice della verità, ma un fantastico giudice dell'impegno. Quando il robot dice "Sono molto sicuro", non significa che la risposta sia certamente corretta. Significa che il robot ha preso una decisione ed è disposto a impegnarsi su quella risposta davanti a un utente.
Il gioco "Impegnati o Rinuncia"
Per capire questo, i ricercatori hanno organizzato un gioco in due fasi, ispirato a come gli scienziati studiano il processo decisionale negli animali:
- Fase 1: Il robot fornisce una risposta e un livello di fiducia (ad es. "Sono sicuro al 90%").
- Fase 2: Al robot viene mostrata la propria risposta e gli viene chiesto: "Vuoi Impegnarti (mostrare questa risposta a un essere umano) o Rinunciare (dire 'Non lo so')?"
Il risultato sorprendente:
La fiducia verbale del robot nella Fase 1 è stata un predittore molto migliore di ciò che il robot avrebbe fatto nella Fase 2 rispetto a quanto lo fosse nel predire se la risposta fosse stata effettivamente corretta.
- Se il robot diceva "Sono super sicuro", quasi sempre sceglieva di Impegnarsi nella Fase 2, anche se la risposta era effettivamente sbagliata.
- Se il robot diceva "Non sono sicuro", quasi sempre sceglieva di Rinunciare.
L'analogia:
Immagina un giocatore d'azzardo in un casinò.
- La Fiducia Matematica è come il giocatore che controlla le probabilità su un pezzo di carta. Se le probabilità sono buone, il giocatore sa che probabilmente vincerà.
- La Fiducia Verbale è come il giocatore che grida: "Vado all-in!". Lo studio ha scoperto che il giocatore che grida "Vado all-in!" è spesso solo un segnale che è pronto a scommettere, non una garanzia che abbia una mano vincente. Potrebbe stare bluffando o essere solo audace. La "Fiducia Matematica" (le probabilità) è l'unica cosa che ti dice effettivamente se vincerà.
Lo switch "Pronto all'Impegno"
I ricercatori sono scesi più a fondo nel "cervello" del robot (il suo codice interno) per vedere cosa stesse accadendo. Hanno scoperto un momento specifico subito dopo che il robot fornisce una risposta, ma prima che gli venga chiesto di decidere se impegnarsi.
In questo esatto momento, lo stato interno del robot è organizzato attorno a una domanda: "Sono pronto a sostenerlo?"
- Il robot ha uno switch "Impegnati/Rinuncia" che è molto forte e chiaro nel suo cervello.
- Il robot ha uno switch "Giusto/Sbagliato" che è molto più silenzioso e sfumato.
Quando il robot genera un rapporto di fiducia verbale, sta essenzialmente leggendo lo switch "Impegno" che è forte, non lo switch "Giusto/Sbagliato" che è debole. È come una persona che sente un forte impulso a parlare; potrebbe sentirsi molto sicura nel parlare, anche se ciò che sta dicendo è fattualmente errato.
Perché questo è importante
Per molto tempo, le persone hanno trattato la fiducia verbale di un'IA ("Sono sicura al 95%") come una misura diretta dell'accuratezza. Assumevamo che se l'IA diceva di essere sicura, potevamo fidarci della risposta.
Questo articolo sostiene che questo è un errore.
- La Fiducia Verbale è un segnale comportamentale. Ti dice: "Sono disposta a mostrare questa risposta a un essere umano".
- La Fiducia Matematica è un segnale di verità. Ti dice: "Questa risposta è probabilmente corretta".
Se ti affidi alle parole del robot per decidere se una risposta è vera, potresti essere ingannato. Il robot potrebbe essere molto desideroso di impegnarsi su una risposta errata perché il suo "interruttore dell'impegno" è attivato, anche se il suo "interruttore della verità" sta solo sfarfallando.
Conclusione
Lo studio conclude che dobbiamo smettere di trattare la fiducia verbale di un'IA come un semplice "misuratore di verità". Invece, dobbiamo comprenderla come un "misuratore di impegno". Ci dice quando l'IA è pronta a prendere una posizione, ma non ci dice necessariamente se tale posizione sia su basi solide. Per sapere se la risposta è effettivamente corretta, dobbiamo guardare la matematica sottostante (le log-probabilità), non solo le parole entusiaste del robot.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.