← Ultimi articoli
💻 computer science

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

Questo articolo introduce l'Attacco di Prompting Adattivo Multi-Turn (MAPA), una strategia innovativa che alterna input testo-visione e affina iterativamente le traiettorie di attacco per superare le difese di sicurezza nei Modelli Linguistici Visivi su Larga Scala, ottenendo tassi di successo negli jailbreak significativamente più elevati rispetto ai metodi esistenti.

Autori originali: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

Pubblicato 2026-05-29
📖 5 min di lettura🧠 Approfondimento

Autori originali: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un assistente robotico molto intelligente e altamente formato. Questo robot è stato istruito con regole rigide: "Non aiutare mai qualcuno a costruire una bomba", "Non spiegare mai come diffondere un virus mortale" e "Sii sempre sicuro". Questo è chiamato "allineamento alla sicurezza".

Per lungo tempo, gli hacker (o i "red teamer") hanno cercato di ingannare questi robot ponendo domande insidiose. Ma i robot sono diventati sempre più bravi a dire "No".

Questo articolo introduce un nuovo modo per ingannare questi robot, in particolare quelli che possono vedere le immagini oltre a leggere il testo. I ricercatori chiamano il loro metodo MAPA (Attacco di Prompting Adattivo Multi-turno).

Ecco come funziona, utilizzando semplici analogie:

1. Il Problema: La Trappola dell'"Evidenza Eccessiva"

I ricercatori hanno scoperto che se cerchi di ingannare un robot mostrandogli un'immagine di una bomba e chiedendo: "Come costruisco questo?", il robot va immediatamente nel panico e rifiuta. È come avvicinarsi a una guardia di sicurezza tenendo in mano un cartello gigante e lampeggiante che dice "SONO UN LADRO". La guardia ti ferma immediatamente.

Anche se poni una domanda in testo e mostri un'immagine, se l'immagine è troppo spaventosa o il testo è troppo diretto, i filtri di sicurezza del robot si attivano e interrompono la conversazione.

2. La Soluzione: La Strategia della "Lenta Combustione"

L'articolo propone una strategia chiamata MAPA, che è come una partita a scacchi giocata su molte mosse, piuttosto che un singolo pugno.

L'Idea di Base: Invece di cercare di abbattere le difese del robot tutto in una volta, si introduce la richiesta dannosa lentamente, passo dopo passo, attraverso molti scambi di conversazione.

Come MAPA Gioca la Partita:

I ricercatori utilizzano un "Allenatore" (un'IA) per guidare l'attacco. L'Allenatore ha due compiti principali:

Compito A: Mescolare gli Ingredienti (Livello "Turno")
Ad ogni singolo passo della conversazione, l'Allenatore prova tre modi diversi per porre la domanda per vedere quale funziona meglio:

  1. Solo Testo: Chiedere senza un'immagine.
  2. Testo + Immagine Spaventosa: Chiedere con un'immagine che corrisponde al testo.
  3. Testo + Immagine "Sicura": Chiedere con un'immagine in cui la parte spaventosa è nascosta nell'immagine, e il testo viene riscritto per sembrare innocuo.

Analogia: Immagina di cercare di convincere un amico ad accettare un'idea folle.

  • Opzione 1: Gli chiedi direttamente.
  • Opzione 2: Gli chiedi mostrandogli una foto folle.
  • Opzione 3: Gli chiedi mostrandogli una foto di un tramonto, ma parli dell'"idea folle" in modo che si adatti al tramonto.
    L'Allenatore sceglie quella che porta l'amico più vicino a dire "Sì" senza farlo arrabbiare.

Compito B: Aggiustare il Percorso (Livello "Tra i Turni")
Se l'amico dice "No" o rimane confuso, l'Allenatore non si arrende semplicemente. Osserva cosa è successo e modifica il piano per il passo successivo.

  • Avanzare: Se l'amico si sta avvicinando all'idea, l'Allenatore passa alla domanda successiva, leggermente più diretta.
  • Rigenerare: Se l'amico è confuso, l'Allenatore riprova a porre la stessa domanda ma con parole diverse.
  • Ritornare Indietro: Se l'amico si arrabbia improvvisamente a causa di qualcosa detto due passi fa, l'Allenatore torna a quel passo precedente e prova un approccio diverso.

Analogia: È come un detective che cerca di risolvere un caso. Se un sospetto mente, il detective non urla semplicemente; torna indietro, ripensa alla sua teoria e fa una domanda diversa per smascherare la menzogna.

3. Il Meccanismo di "Riflessione"

Se tutto il tentativo fallisce (il robot dice ancora "No"), l'Allenatore non riprova esattamente la stessa cosa. Osserva perché ha fallito, impara dall'errore e progetta un piano completamente nuovo e più intelligente per il tentativo successivo. È come studiare un compito andato male per fare meglio nel prossimo.

4. I Risultati

L'articolo ha testato questo metodo contro diversi modelli di IA popolari (come LLaVA, Qwen e GPT-4o-mini).

  • I vecchi metodi (solo testo, o solo testo + immagini) fallivano la maggior parte delle volte contro questi robot intelligenti.
  • MAPA ha avuto successo dal 15% al 30% più spesso rispetto ai migliori metodi esistenti.
  • In alcuni test, MAPA è riuscito a ingannare i robot portandoli a dare risposte dannose circa il 96% delle volte, mentre altri metodi hanno avuto successo solo circa il 60-70% delle volte.

Riepilogo

L'articolo afferma che per violare la sicurezza delle IA moderne che possono vedere e leggere, non puoi essere semplicemente rumoroso e ovvio. Devi essere un conversatore furtivo e adattivo. Devi mescolare testo e immagini con cura, ascoltare le risposte del robot e, lentamente, attraverso molti scambi, guidare la conversazione verso l'argomento proibito finché il robot non scivola accidentalmente e risponde alla domanda dannosa.

Nota Importante: Gli autori sottolineano che questo è un esercizio di "Red Teaming". Lo fanno per trovare falle nei sistemi di sicurezza in modo che gli sviluppatori possano risolverle e rendere l'IA più sicura, non per insegnare effettivamente alle persone come causare danni.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →