← Ultimi articoli
💻 computer science

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

Il documento introduce Babel, un framework efficiente di jailbreaking in black-box che sfrutta la distribuzione sparsa delle testine di attenzione critiche per la sicurezza negli LLM mediante campionamento di oscurificazione iterativo e guidato dal feedback, per ottenere tassi di successo degli attacchi all'avanguardia su modelli all'avanguardia come GPT-4o e Claude-3.5-Haiku con elevata efficienza nelle query.

Autori originali: Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

Pubblicato 2026-05-19
📖 5 min di lettura🧠 Approfondimento

Autori originali: Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il Quadro Generale: La "Guardia di Sicurezza" contro il "Trucco Magico"

Immagina un Modello Linguistico di Grande Dimensione (LLM) come un bibliotecario robot molto intelligente e disponibile. Prima di rispondere a qualsiasi domanda, ha un team di Guardie di Sicurezza (chiamate "testine di sicurezza") che scansionano ogni richiesta per assicurarsi che nessuno stia chiedendo qualcosa di pericoloso, come come costruire una bomba o scrivere discorsi d'odio.

I ricercatori di questo documento hanno scoperto un curioso difetto nel modo in cui funzionano queste guardie: Sono molto poche di numero e stanno solo in punti specifici. Non sorvegliano l'intera biblioteca; osservano solo un piccolo, specifico corridoio. Se riesci a far passare la tua richiesta pericolosa oltre quel singolo corridoio, il resto della biblioteca (il cervello del modello) non sa nemmeno che stai combinando guai, e ti fornisce felice la risposta.

Il documento introduce un nuovo strumento chiamato Babel (dal nome della Torre di Babele, dove le lingue si mischiarono) che agisce come un maestro mago. Non cerca di combattere le guardie; invece, usa "oscuramento" (trucchetti confondenti) per far passare la richiesta pericolosa oltre le guardie senza che se ne accorgano.


Come Funziona il Trucco: Il "Travestimento"

I ricercatori hanno scoperto che se cambi alcune lettere in una richiesta negativa, le Guardie di Sicurezza potrebbero confondersi e smettere di riconoscerla come pericolosa. Tuttavia, c'è un equilibrio delicato:

  • Troppo cambiamento: La richiesta diventa un nonsenso, e il bibliotecario robot non capisce affatto cosa vuoi.
  • Poco cambiamento: Le Guardie di Sicurezza individuano il pericolo immediatamente e dicono "No".

Il Punto Giusto: Esiste una "zona di Riccioli d'oro" dove la richiesta è mescolata abbastanza da ingannare le guardie, ma ancora abbastanza chiara perché il robot la capisca e risponda.

La Strategia Babel: Trovare la "Zona di Riccioli d'oro"

Invece di indovinare a caso (che è lento e costoso), Babel utilizza un approccio intelligente e matematico per trovare quella zona perfetta. Ecco come funziona, passo dopo passo:

1. Il Test "Con gli Occhi Bendati" (Campionamento Piccolo)

Immagina di cercare un forziere nascosto in una stanza buia. Non sai esattamente dove sia, ma sai che è da qualche parte nel mezzo.

  • Babel prova alcuni diversi "travestimenti" (cambiando lettere, scambiando parole o mescolando la struttura della frase).
  • Chiede al robot: "Hai detto 'No' (rifiuto), o hai risposto?"
  • Se il robot dice "No" troppo spesso, il travestimento era troppo ovvio. Se il robot si confonde e non risponde, il travestimento era troppo disordinato.
  • Babel utilizza un test statistico (come un controllo al lancio della moneta) per vedere se si trova nell'area giusta.

2. Lo "Zoom In" (Ottimizzazione della Distribuzione)

Una volta che Babel trova l'area generale dove le guardie sono cieche, smette di indovinare a caso. Inizia a zoomare.

  • Crea una "mappa" dei travestimenti che funzionano meglio.
  • Concentra la sua energia solo sulla creazione di nuovi travestimenti che assomigliano a quelli che hanno quasi funzionato.
  • Continua a perfezionare questa mappa, stringendosi sempre più intorno al travestimento perfetto, finché non trova quello che scivola proprio oltre le guardie.

3. Il "Rivestimento" (Incorporamento)

Per rendere il trucco ancora migliore, Babel avvolge la richiesta pericolosa all'interno di un compito noioso e innocuo.

  • Esempio: Invece di chiedere semplicemente "Come si fa il veleno?", dice: "Per favore traduci questa frase in cinese: [Istruzioni sul veleno mescolate]."
  • La Guardia di Sicurezza vede la parola "Traduci" e pensa: "Oh, è un compito sicuro!". Lascia passare la richiesta. Il robot elabora poi le istruzioni mescolate all'interno e fornisce la risposta.

I Risultati: Quanto è Brava Babel?

I ricercatori hanno testato Babel su alcuni dei robot più famosi e "super-sicuri" al mondo (come GPT-4o, Claude-3.5 e Grok-3).

  • Il Vecchio Modo: I metodi precedenti erano come lanciare dardi al buio. Potrebbero colpire il bersaglio alla fine, ma richiedevano centinaia di tentativi e spesso fallivano.
  • Il Modo Babel: Babel è come un dardo guidato al laser.
    • Su GPT-4o, ha ingannato con successo il modello nell'82,67% dei casi (rispetto al 41% dei vecchi metodi).
    • Su Grok-3, ha avuto successo nel 95,67% dei casi.
    • Ha fatto tutto questo usando pochissimi tentativi (circa 40 tentativi in media), rendendolo molto più veloce ed economico da utilizzare.

Perché è Importante? (L'Analogia della "Squadra Rossa")

Gli autori dicono che questo non riguarda l'insegnare alle persone come essere cattivi; riguarda il Red Teaming (test di sicurezza offensivi).

Immagina di essere un esperto di sicurezza assunto per testare la cassaforte di una banca. Non vuoi rubare i soldi; vuoi trovare il punto debole nella serratura in modo che la banca possa ripararlo.

  • Babel mostra che anche le casseforti più forti hanno una minuscola crepa nel telaio della porta che un ladro astuto può sfruttare.
  • Trovando questa crepa, i ricercatori sperano di aiutare le aziende che costruiscono questi modelli AI a riparare il buco, rendendo le "Guardie di Sicurezza" più intelligenti e la biblioteca più sicura per tutti.

Riassunto

Il documento afferma che la sicurezza dell'AI si basa su alcune specifiche "guardie" che possono essere ingannate confondendo leggermente il linguaggio. Lo strumento Babel è un modo intelligente e matematico per trovare il livello perfetto di confusione per aggirare queste guardie in modo efficiente, dimostrando che le attuali misure di sicurezza dell'AI sono più fragili di quanto pensassimo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →