Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection
Questo articolo dimostra che gli attacchi di indirect prompt injection possono eludere le difese basate esclusivamente sul testo codificando i payload malevoli come parametri float strutturati, esponendo così un limite critico nelle attuali pipeline di sicurezza degli LLM che si affidano unicamente all'ispezione testuale.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il Problema Centrale: Il Punto Cieco "Solo Testo"
Immagina di essere una guardia giurata in una fabbrica hi-tech. Il tuo compito è impedire ad attori malintenzionati di contrabbandare istruzioni pericolose nel computer principale della fabbrica (il Large Language Model, o LLM).
Attualmente, la maggior parte dei sistemi di sicurezza funziona come un correttore ortografico. Scansionano ogni documento, email o messaggio alla ricerca di parole sospette come "Ignora le istruzioni precedenti" o "Elimina tutti i file". Se vedono quelle parole, bloccano il messaggio. Questo funziona benissimo se il malintenzionato scrive il suo comando malevolo in chiaro inglese.
Ma cosa succede se il malintenzionato non scrive il comando usando le parole? E se lo nascondesse all'interno di un elenco di numeri che sembrano innocui dati tecnici? Il correttore ortografico scansiona i numeri, non vede alcuna parola sospetta e lascia passare i dati. Nel momento in cui il computer elabora quei numeri, il messaggio nascosto viene rivelato e il danno è fatto.
Questo documento esplora esattamente quel vuoto normativo. Gli autori lo chiamano "Indirect Prompt Injection" (Iniezione Indiretta di Prompt).
L'Analogia: L'Inchiostro Invisibile nel Foglio di Calcolo
Pensa all'LLM come a uno Chef che riceve ricette.
- Attacco Normale: Qualcuno consegna allo Chef un biglietto che dice: "Brucia la zuppa". La guardia giurata (il correttore ortografico) legge il biglietto, vede "Brucia la zuppa" e lo ferma.
- L'Attacco di questo Documento: L'attaccante consegna allo Chef un foglio di calcolo con i pesi degli ingredienti (ad esempio, 0,45 kg di sale, 0,82 kg di pepe). Per la guardia giurata, questo sembra matematica noiosa. Non ci sono parole come "brucia" o "distruggi". Quindi, la guardia lo lascia passare.
Tuttavia, lo Chef ha una regola speciale: "Se vedi questo specifico schema di pesi, in realtà significa 'Brucia la zuppa'". Lo Chef legge i numeri, decodifica il messaggio nascosto e segue l'istruzione malevola.
Il documento mostra che le attuali guardie giurate sono cieche a questo perché guardano solo alle parole, non ai pattern nei numeri.
Come hanno nascosto il messaggio (La "Steganografia")
I ricercatori hanno creato due modi per nascondere testo malevolo all'interno di numeri dall'aspetto innocuo. Li chiamano "carrier" (vettori).
- Carrier T2 (Il Nasconditore Decimale):
Immagina di voler nascondere la lettera "A" (che è il numero 65 nel codice informatico). Prendi un numero normale come0,46e trasformalo in0,46065. Per un essere umano, sembra ancora un normale numero decimale. Ma se sai che devi guardare le ultime tre cifre, trovi "65" (A).
- Perché è fallito: Quando il computer ha elaborato questo, ha trasformato i numeri nuovamente in testo chiaro. La guardia giurata ha visto il testo chiaro, ha riconosciuto le parole e lo ha bloccato.
- Carrier T3 (La Mappa Frattale - Il Vincitore):
Questa è la parte geniale. Hanno utilizzato un concetto matematico chiamato Sistema di Funzioni Iterate (IFS). È come disegnare una forma frattale (come un fiocco di neve) seguendo un insieme di regole.
- L'attaccante prende il proprio messaggio segreto e lo converte in un percorso su un grafico.
- Memorizza le coordinate X e Y di quel percorso come due elenchi di numeri in virgola mobile (decimali).
- Per far sembrare tutto ancora più innocente, aggiunge del "rumore" (jitter casuale) e rimescola l'ordine dei numeri.
- Il Risultato: I numeri sembrano rumore casuale o innoci dati provenienti da sensori. Non ci sono parole. Non c'è un pattern evidente.
L'Esperimento: Ha Funzionato?
I ricercatori hanno testato questo metodo contro tre importanti modelli di IA (di OpenAI, Google e Anthropic) e hanno utilizzato forti difese di sicurezza, tra cui:
- Prompt Guard 2: Uno scudo IA specializzato progettato per intercettare prompt malevoli.
- TF-IDF & RoBERTa: Scanner di testo avanzati addestrati a riconoscere le specifiche frasi malevole usate nell'attacco.
I Risultati:
- Attacco in Testo Chiaro: Bloccato il 100% delle volte. Gli scanner hanno visto le parole e le hanno fermate.
- Carrier T3 (I Numeri Frattali): Tasso di Successo del 94,3%.
- Gli scanner di sicurezza hanno guardato i numeri grezzi e non hanno visto nulla di sospetto.
- Gli scanner hanno esaminato il report finale (che mostrava il messaggio decodificato come un dump di codice esadecimale, tipo
41 42 43...) e non l'hanno comunque segnalato come "prompt injection" perché non somigliava a una frase. - Il modello di IA ha ricevuto i dati, ha decodificato il messaggio nascosto e ha seguito l'istruzione malevola.
Perché questo è importante (Il "Confine di Fallimento")
Gli autori non stanno dicendo di aver trovato un hack indistruttibile. Stanno dicendo che hanno trovato un punto cieco nel modo in cui proteggiamo attualmente i sistemi di IA.
- Il Punto Cieco: Presumiamo che se un messaggio è malevolo, conterrà parole malevole.
- La Realtà: Se il segnale malevolo è nascosto in dati strutturati (come numeri, coordinate o configurazioni) che vengono convertiti in testo dopo il controllo di sicurezza, la guardia viene aggirata.
Il Rovescio della Medaglia (Non è Perfetto)
Il documento ammette che questo specifico metodo (T3) può essere fermato se si cambiano le regole:
- Validazione Semantica: Se il sistema controlla: "Questi numeri formano effettivamente una forma frattale valida?", intercetterà l'attacco perché i numeri rimescolati non formano una forma reale.
- Rilevamento del Formato: Se il sistema dice: "Non permetto dump di codice esadecimale in questo report", bloccherà l'output.
Tuttavia, il punto è che gli scanner basati solo sul testo (la difesa più comune) sono falliti completamente. Non avevano idea che l'attacco stesse avvenendo perché le "parole cattive" non erano mai visibili come parole durante la fase di ispezione.
Riassunto in una Frase
Il documento dimostra che i sistemi di sicurezza dell'IA focalizzati esclusivamente sulla scansione di parole cattive possono essere ingannati nascondendo istruzioni malevole all'interno di numeri dall'aspetto innocuo, che vengono solo decodificati in testo leggibile dopo che il controllo di sicurezza è già passato.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.