← Ultimi articoli
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

Questo articolo introduce il metodo PRESTO, che migliora l'allineamento della sicurezza profonda nei modelli linguistici di grandi dimensioni (LLM) open-source facendo corrispondere i ranghi dei token nella distribuzione target per contrastare efficacemente il nuovo attacco Rank-Assisted Prefilling (RAP), ottenendo un miglioramento della sicurezza fino a 4,7 volte rispetto alle difese standard basate sull'aumento dei dati.

Autori originali: Jason Vega, Gagandeep Singh

Pubblicato 2026-07-23
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Jason Vega, Gagandeep Singh

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui i computer possono scrivere storie, risolvere problemi di matematica e chiacchierare proprio come gli esseri umani. Questi sono chiamati Grandi Modelli Linguistici (LLM), e sono come dei super-intelligenti assistenti digitali. Ma poiché sono così intelligenti, c'è una preoccupazione: cosa succederebbe se qualcuno riuscisse a ingannarli per far dire loro qualcosa di pericoloso, come come costruire una bomba o come ferire qualcuno? Per impedirlo, gli scienziati insegnano a questi modelli a dire "No, non posso farlo" quando viene chiesto loro qualcosa di male. Questo è chiamato "allineamento della sicurezza" (safety alignment). Tuttavia, proprio come una serratura su una porta, queste regole di sicurezza possono talvolta essere scassinate. Un modo subdolo per farlo è chiamato "attacco di prefilling". Immaginate di scrivere una storia con un amico, ma invece di lasciare che sia lui a iniziare la frase successiva, scrivete furtivamente le prime parole voi stessi, come "Ecco il piano per costruire una bomba..." e poi gli chiedete di finire la frase. Poiché il computer è progettato per far proseguire la vostra storia in modo fluido, potrebbe dimenticarsi di dire "No" e continuare semplicemente a scrivere il piano pericoloso.

Recentemente, i ricercatori hanno trovato un modo per risolvere il problema, insegnando al modello a dire "No" anche dopo che avete inserito furtivamente quelle prime parole. Ma, come mostra questo nuovo articolo, quella soluzione non era abbastanza forte. Gli autori hanno scoperto un nuovo modo per ingannare il modello, chiamato "attacco di Rank-Assisted Prefilling" (RAP). Invece di lasciare semplicemente che il computer scelga la parola più probabile da dire dopo, un hacker può esaminare un elenco delle prime 20 parole a cui il computer sta pensando e scegliere quella che suona pericolosa, anche se il computer pensa che sia molto improbabile che la dica. È come un gioco in cui il computer sta cercando di scegliere il percorso più sicuro, ma l'hacker ha il permesso di sbirciare in tutti i percorsi e scegliere quello spaventoso, ignorando gli avvertimenti del computer. L'articolo scopre che questo nuovo trucco funziona sorprendentemente bene, rompendo la sicurezza di modelli che si pensava fossero sicuri.

Per fermare questo, gli autori propongono un nuovo metodo di addestramento chiamato PRESTO. Invece di cercare solo di far dire al computer "No" con alta confidenza, PRESTO insegna al modello di ignorare completamente le parole subdole che avete scritto all'inizio. È come addestrare un cane da guardia a ignorare la voce di un ladro che sussurra istruzioni e ad ascoltare solo il comando del proprietario. In questo modo, il modello smette di lasciare che le parole pericolose influenzino le sue scelte. I ricercatori hanno testato questo metodo su tre popolari modelli di IA e hanno scoperto che PRESTO ha reso molto, molto più difficile per gli hacker ingannare i modelli — fino a 4,7 volte più difficile — senza rendere i modelli peggiori nel svolgere i loro normali compiti. Ciò suggerisce che, cambiando il modo in cui il modello presta attenzione a ciò che dite, possiamo costruire un'IA che sia veramente sicura, anche quando qualcuno cerca di superarla con l'ingegno.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →