Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
Questo articolo propone MAGA, un nuovo framework di attacco multi-livello che sfrutta le vulnerabilità dell'attenzione cross-modale nei modelli BLIP costruendo e interrompendo grafi di attacco cross-modali, risultando in un significativo degrado delle prestazioni e in didascalie avversarie linguisticamente plausibili ma visivamente incoerenti.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo in rapida evoluzione dell'intelligenza artificiale, è emersa una nuova generazione di sistemi informatici in grado di vedere e leggere simultaneamente. Questi sistemi, noti come modelli visione-linguaggio, sono addestrati su milioni di coppie di immagini e testo, imparando a comprendere come l'immagine di un cane si relazioni alla parola "cane". Sono diventati la base per strumenti che descrivono foto, rispondono a domande su scene e ricercano immagini utilizzando il linguaggio naturale. Affinché queste macchine funzionino bene, devono costantemente connettere parole specifiche a parti specifiche di un'immagine, decidendo quali pixel appartengano al concetto di "cavallo" e quali all' "erba". Questo processo si basa su un complesso meccanismo interno che agisce come una mappa dinamica, collegando ogni parola in una frase ai dettagli visivi rilevanti in una fotografia. Se questa connessione si interrompe, la macchina perde la capacità di capire ciò che sta guardando, portando potenzialmente alla confusione o a descrizioni errate.
Ricercatori dell'Università di Guangzhou hanno scoperto una sottile debolezza nel modo in cui questi sistemi mantengono tali connessioni. Hanno scoperto che, posizionando un piccolo schema attentamente progettato su un'immagine, potevano ingannare il modello inducendolo a riorganizzare la sua mappa interna di legami parola-immagine. Questo schema, che appare come una semplice chiazza di colore o di texture, non ha bisogno di essere un travestimento complesso. Invece, agisce come un segnale silenzioso che induce il modello a ignorare le parti più importanti di un'immagine per concentrarsi su aree di sfondo irrilevanti. Quando ciò accade, il modello può ancora parlare con fluidità e correttezza grammaticale, ma ciò che dice non corrisponde più all'immagine. Potrebbe descrivere un campo di fiori quando l'immagine mostra chiaramente un cavallo, o sostenere che una persona stia tenendo una ciotola di ramen quando la foto contiene solo un soggiorno. I ricercatori chiamano questo fenomeno "naturale ma sbagliato", evidenziando una vulnerabilità in cui la fiducia della macchina rimane alta anche mentre la sua comprensione crolla.
Il team ha sviluppato un metodo per creare questi schemi ingannevoli, che hanno chiamato attacco multi-livello. A differenza dei tentativi precedenti che cercavano semplicemente di sfocare un'immagine o di rimescolare i suoi colori, questo approccio prende di mira il modo specifico in cui il modello connette testo e visione. I ricercatori hanno costruito un sistema che mappa la forza dei legoli tra le parole e le parti dell'immagine, creando essenzialmente un grafo che mostra a quali pixel prestano attenzione le parole. Hanno poi addestrato il loro attacco per massimizzare la differenza tra il grafo di un'immagine pulita e il grafo della stessa immagine con la chiazza applicata. In questo modo, hanno costretto il modello a recidere i forti legami tra le parole chiave e la loro evidenza visiva, creando simultaneamente nuovi e falsi collegamenti con aree di sfondo casuali. Questo processo è stato combinato con altri obiettivi per garantire che l'attacco rimanesse nascosto e che il testo risultante suonasse naturale, nonostante fosse fattualmente errato.
I risultati dei loro esperimenti sono stati sorprendenti. Quando hanno applicato la loro chiazza generata a immagini di un dataset standard, la capacità del modello di trovare l'immagine corretta per un dato testo è diminuita drasticamente. Nei test in cui il sistema era chiamato a abbinare una frase alla foto giusta, il suo tasso di successo è sceso da oltre il settanta per cento a appena il nove per cento. L'attacco è stato così efficace che ha funzionato anche su immagini che il sistema non aveva mai visto prima, suggerendo che il difetto fosse fondamentale nel modo in cui il modello elabora le informazioni, piuttosto che un semplice errore con immagini specifiche. Nei compiti in cui il modello doveva descrivere un'immagine, la qualità della descrizione è crollata. I punteggi di accuratezza del sistema sono diminuiti significativamente, eppure le frasi prodotte rimanevano grammaticalmente corrette e varie, evitando il gergo ripetitivo che spesso segnala un sistema guasto. Ciò ha confermato che il modello non stava solo fallendo nel parlare; stava descrivendo con fiducia una realtà che non esisteva.
I ricercatori hanno anche testato il sistema su domande visive, come contare oggetti o identificare relazioni spaziali. L'attacco ha causato il fallimento del modello anche in questi compiti logici, con tassi di successo scesi da quasi l'ottanta per cento a appena il dodici per cento. In molti casi, il modello rispondeva a una domanda su un cane con una descrizione di un gatto, o affermava che ci fossero tre animali quando ce n'era solo uno. Ciò che ha reso questi fallimenti particolarmente degni di nota è stato il fatto che la mappa di attenzione interna del modello era stata completamente riprogrammata. Le visualizzazioni hanno mostrato che il modello, che normalmente focalizza la sua attenzione sul soggetto principale della foto, ha iniziato a ignorare il soggetto del tutto per concentrarsi invece sul cielo vuoto o sull'erba. La chiazza non nascondeva l'oggetto; semplicemente faceva sì che il modello guardasse altrove.
Questo lavoro suggerisce che l'attuale generazione di questi potenti sistemi di IA è più fragile di quanto precedentemente pensato. Mentre i precedenti test di sicurezza si concentravano sul fatto che un'immagine potesse essere resa simile a qualcos'altro agli occhi umani, questa ricerca dimostra che il pericolo risiede nel modo in cui la macchina organizza la propria comprensione. L'attacco non richiede che la macchina venga ingannata vedendo un oggetto diverso; deve solo essere convinta che l'oggetto che vede sia irrilevante. Interrompendo il grafo interno che collega le parole ai pixel, i ricercatori hanno dimostrato che un piccolo schema statico può causare una cascata di errori attraverso diversi compiti, dalla ricerca di immagini alla risposta a domande complesse. Lo studio conclude che, man mano che questi modelli vengono integrati nella vita quotidale, comprendere e proteggere le loro mappe di connessione interna sarà importante quanto proteggere le immagini stesse. I risultati servono da promemoria: anche i sistemi più avanzati possono essere tratti in inganno non cambiando ciò che vedono, ma cambiando il modo in cui pensano a ciò che vedono.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.