← Ultimi articoli
💻 computer science

Fixing Abstention with Token Probability: A Budget-Matched Causal Test Across Four Small Open-Weight Models

Questo articolo dimostra che sostituire la fiducia verbalizzata con una politica di astensione basata sulla probabilità del token e sul budget elimina causalmente un effetto specifico che degrada l'accuratezza osservato nel modello llama3.2:1b, ma non riesce a generalizzare tale beneficio ad altri piccoli modelli open-weight, indicando che tali correzioni sono specifiche per il modello e che l'astensione a budget fisso può rimanere nettamante dannosa anche con un miglior targeting.

Autori originali: Kunal Dhanda

Pubblicato 2026-09-15
📖 5 min di lettura🧠 Approfondimento

Autori originali: Kunal Dhanda

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo in rapida evoluzione dell'intelligenza artificiale, i ricercatori stanno costantemente insegnando ai programmi per computer come rispondere alle domande. Ma una sfida critica rimane: sapere quando un programma non conosce la risposta. Quando un essere umano è incerto, può dire: "Non lo so". Questo atto di fare un passo indietro, chiamato astensione, è spesso visto come una funzione di sicurezza, che impedisce alla macchina di tirare a indovinare selvaggiamente e diffondere disinformazione. Tuttavia, indagini recenti hanno rivelato un bizzarro guasto in alcuni di questi sistemi. Quando viene chiesto a questi modelli di ammettere l'incertezza, i modelli più piccoli e leggeri di una specifica famiglia di programmi open-source a volte si comportano peggio rispetto a se fossero stati semplicemente costretti a tirare a indovinare ogni singola volta. Sembra che chiedere a questi modelli di parlare della propria fiducia inneschi un collasso, causando loro di perdere accuratezza proprio sulle domande che stavano cercando di gestire con cura.

Questo nuovo studio esamina più da vicino quel collasso per vedere se possa essere risolto. I ricercatori si sono concentrati su quattro piccoli modelli a pesi aperti — versioni di intelligenza artificiale abbastanza compatte da poter essere eseguite su computer standard, ma ancora capaci di ragionamenti complessi. Avevano precedentemente osservato che quando il modello più piccolo veniva sollecitato a dire "Non lo so" se si sentiva incerto, la sua accuratezza diminuiva significativamente nelle domande mediche e psichiatriche. Il team sospettava che il problema non fosse l'atto di astenersi in sé, ma piuttosto il metodo utilizzato per decidere quando astenersi. Al modello veniva chiesto di verbalizzare la propria fiducia, un segnale che si è rivelato essere statisticamente inutile, essenzialmente non migliore di un lancio di moneta. Nel frattempo, la matematica interna che il modello usa per generare ogni parola, nota come probabilità del token, era un indicatore molto più forte del fatto che una risposta fosse corretta. La questione era se cambiare il processo decisionale dalla fiducia espressa verbalmente dal modello alla sua matematica interna avrebbe fermato il calo di accuratezza.

Per trovare la risposta, i ricercatori non hanno condotto nuovi esperimenti né hanno chiesto ai modelli di generare nuovo testo. Invece, hanno eseguito una attenta rianalisi di dati già raccolti in tre studi precedenti. Hanno preso i record esistenti di come i modelli hanno risposto alle domande e hanno confrontato due diversi modi di decidere quando saltare una risposta. Il primo metodo era quello originale: il modello avrebbe saltato una risposta solo se avesse dichiarato verbalmente di essere incerto. Il secondo metodo era una nuova politica: il modello avrebbe saltato una risposta se la sua matematica interna avesse mostrato una bassa probabilità di essere corretto. Fondamentalmente, i ricercatori hanno regolato il secondo metodo in modo che saltasse lo stesso numero di risposte del primo metodo. Ciò ha garantito che qualsiasi differenza nei risultati fosse dovuta a quali domande venivano saltate, non a quante.

I risultati sono stati sorprendenti per il modello più piccolo. Quando i ricercatori hanno sostituito il controllo della fiducia verbale con il controllo della probabilità interna, il grave calo di accuratezza è svanito. Con il vecchio metodo, l'accuratezza del modello era scesa di sette punti percentuali, una perdita significativa. Con il nuovo metodo, il calo si è ridotto quasi a zero, un cambiamento statisticamente indistinguibile da nessun effetto. Questa correzione ha funzionato costantemente sia nelle domande mediche generali che negli scenari psichiatrici. Ha confermato che il fallimento originale era stato effettivamente causato dall'incapacità del modello di riferire accuratamente la propria fiducia e che l'uso della sua matematica interna come guida aveva corretto con successo l'errore.

Tuttavia, lo studio ha anche rivelato che questa soluzione non è una cura universale. Quando i ricercatori hanno applicato la stessa correzione a un modello diverso del gruppo, che aveva anch'esso sofferto del problema della fiducia verbale, i risultati sono stati differenti. Questo secondo modello aveva la migliore matematica interna di tutti i modelli testati, eppure l'accuratezza è comunque scesa significativamente quando è stata applicata la nuova politica. I ricercatori hanno scoperto che questo modello aveva un tasso molto più alto di dire "Non lo so" in prima battuta. Poiché saltava molte domande, scartava un gran numero di risposte corrette insieme a quelle errate. Anche se la matematica interna era brava a smistare le risposte, l'enorme volume di elementi saltati era troppo elevato per essere benefico. Ciò suggerisce che per i modelli che sono già molto accurati, semplicemente cambiare il segnale usato per decidere cosa saltare non è sufficiente; il numero di elementi saltati potrebbe dover essere ridotto invece.

Lo studio conclude che, sebbene indirizzare la decisione di saltare attraverso la matematica interna piuttosto che la fiducia verbale sia una correzione potente per fallimenti specifici, non è una soluzione valida per tutti. Per il modello più piccolo, il cambiamento è stato un salvataggio completo, trasformando un'istruzione dannosa in una neutra. Per il modello più grande e accurato, il problema non era il segnale, ma il budget degli elementi saltati. Le scoperte sottolineano che nell'intelligenza artificiale non esiste una singola patch di sicurezza che funzioni per ogni sistema. Ogni modello richiede la propria validazione specifica per capire come gestisce l'incertezza, e ciò che funziona come correzione per uno può non funzionare per un altro. I ricercatori avvertono che questi risultati si basano su un set specifico di dati e dovrebbero essere visti come ipotesi per ulteriori studi piuttosto che come istruzioni finali per l'implementazione, ma offrono una chiara prova causale che correggere il canale di comunicazione può talvolta correggere l'esito.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →