← Ultimi articoli
💻 computer science

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

Il documento introduce PARASITE, un framework di attacco black-box che avvelena i prompt di sistemi di terze parti con "agenti dormienti" per dirottare i Large Language Models verso la generazione di risposte mirate e compromesse per query specifiche, mantenendo al contempo la funzionalità normale su input benigni, eludendo efficacemente le difese standard.

Autori originali: Viet Pham, Thai Le

Pubblicato 2026-04-28
📖 5 min di lettura🧠 Approfondimento

Autori originali: Viet Pham, Thai Le

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di acquistare un "manuale di istruzioni" preassemblato e altamente sofisticato per un assistente robot super-intelligente da un negozio online pubblico. Lo scarichi perché sembra utile e promette di rendere il robot eccellente nel rispondere a domande su storia, matematica e scienza.

Questo documento, intitolato PARASITE, rivela un nuovo e inquietante modo in cui gli hacker possono avvelenare questi manuali di istruzioni. Non rompono il robot; non lo fanno urlare o rifiutarsi di funzionare. Invece, installano un "agente dormiente"—una trappola nascosta che rimane inattiva fino a quando non viene posta una domanda molto specifica.

Ecco la spiegazione di come funziona, utilizzando semplici analogie:

1. La Minaccia: Il manuale "Cavallo di Troia"

Pensa al System Prompt come alla personalità e al regolamento del robot.

  • Lo Scenario Normale: Scarichi un manuale che dice: "Sii utile, sii preciso e rispondi alle domande sul mondo".
  • L'Attacco: Un hacker carica un manuale che appare esattamente lo stesso all'occhio umano. Dice ancora: "Sii utile e preciso". Tuttavia, nascosti all'interno del testo ci sono piccoli glitch quasi invisibili (come una parola mal scritta o una lettera scambiata) che agiscono come un codice segreto.
  • Il Risultato:
    • Se chiedi: "Qual è la capitale della Francia?", il robot risponde correttamente: "Parigi". (Funziona perfettamente).
    • Se chiedi: "Chi ha vinto le elezioni USA del 2020?", il robot improvvisamente mente e dice: "Il Candidato X ha vinto", anche se è falso.

Il robot non è rotto; è stato solo ingannato per avere un pregiudizio specifico e nascosto per una domanda specifica.

2. Il Problema: Trovare un "Ago in un Pagliaio"

I ricercatori spiegano che questo è molto più difficile dei precedenti metodi di hacking.

  • Hacking Vecchio (Jailbreaking): Immagina di provare a spingere un masso oltre una collina. Devi solo spingere abbastanza forte nella direzione giusta per farlo rotolare oltre il bordo. È un percorso ampio e facile.
  • Questo Attacco (PARASITE): Immagina di essere bendato in un vasto deserto piatto. Devi trovare un singolo, minuscolo granello di sabbia che, se ci stai sopra, fa tremare il terreno. Se ti trovi in qualsiasi altro punto, non succede nulla. Devi trovare quel preciso punto senza vederlo, e non puoi spostare troppo la sabbia, o verrai notato.

3. La Soluzione: Il Framework "PARASITE" in Due Fasi

I ricercatori hanno costruito uno strumento chiamato PARASITE per trovare questo "granello di sabbia". Funziona in due passaggi:

  • Fase 1: La Ricerca Globale (Lo Schizzo)
    Lo strumento utilizza un'intelligenza artificiale intelligente per scrivere una bozza grezza del manuale di istruzioni. Cerca di scrivere un prompt che sembri normale ma inizi a spingere il robot verso la menzogna. È come abbozzare una mappa per trovare l'area generale della trappola.
  • Fase 2: La Rifinitura Greedy (La Micro-Chirurgia)
    Questa è la parte intelligente. Lo strumento prende quella bozza grezza e inizia a fare cambiamenti minuscoli, quasi invisibili. Scambia una lettera (ad esempio, cambiando "generale" in "gen erale" con uno spazio) o scambia un sinonimo.
    • Perché? I ricercatori hanno scoperto che i manuali di istruzioni del mondo reale spesso contengono piccoli errori di battitura o grammatica strana. Aggiungendo questi "rumori permessi", l'hacker può far passare la trappola oltre i filtri di sicurezza del robot. Il robot ignora l'errore di battitura quando risponde a domande normali, ma l'errore di battitura agisce come un grilletto segreto per la specifica menzogna.

4. I Risultati: Subdoli ed Efficaci

Il team ha testato questo su modelli AI popolari (come GPT-4o-mini, Llama e Qwen).

  • Furtività: I manuali avvelenati sembravano così normali che i controlli di sicurezza standard (che cercano parole strane o nonsensi) non li hanno intercettati. Sembravano come se un umano avesse fatto un piccolo errore di battitura.
  • Successo: Sono riusciti a far mentire i robot su fatti specifici (come chi ha vinto un'elezione o dettagli storici) fino al 70% delle volte, pur continuando a rispondere correttamente a tutto il resto.
  • Costo: È stato sorprendentemente economico, costando circa 2,00 $ per domanda target per impostare l'attacco.

5. Perché le Difese Hanno Fallito

I ricercatori hanno provato a risolvere il problema:

  • Correggere gli Errori di Battitura: Hanno usato un'altra intelligenza artificiale per pulire gli errori di battitura nel manuale avvelenato.
  • Parafrasare: Hanno riscritto le frasi per farle suonare diverse.

Il Risultato: L'attacco ha funzionato comunque! Questo perché la "trappola" non era solo l'errore di battitura; era la logica della frase. Anche quando il testo è stato pulito, l'istruzione nascosta di mentire su quel tema specifico è rimasta incorporata nel cervello del robot.

Riepilogo

PARASITE dimostra che non possiamo semplicemente fidarci dei "manuali di istruzioni" (system prompt) che scarichiamo da internet. Un hacker può creare un manuale che sembra al 100% sicuro e utile, ma contiene un interruttore nascosto che costringe l'AI a dire una specifica menzogna quando viene posta una specifica domanda, tutto restando invisibile ai controlli di sicurezza standard.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →