← Ultimi articoli
🤖 AI

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

Questo articolo dimostra che la prevenzione perfetta della prompt injection è matematicamente impossibile nei modelli sequenziali a embedding condivisi a causa dell'inseparabilità strutturale tra istruzioni e dati, sostenendo che una sicurezza robusta richieda una separazione architettonica tra i canali di controllo e di contenuto piuttosto che un miglioramento delle difese all'interno della pipeline.

Autori originali: Dewank Pant, Shruti Lohani, Avijit Kumar

Pubblicato 2026-06-29
📖 6 min di lettura🧠 Approfondimento

Autori originali: Dewank Pant, Shruti Lohani, Avijit Kumar

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

L'Idea Centrale: Il Problema della "Ciotola di Mescolamento"

Immaginate di essere uno chef (il modello AI) che lavora in una cucina. Avete due tipi di ingredienti:

  1. La Scheda della Ricetta (Istruzioni Fidate): Queste sono le regole che vi sono state date dal proprietto del ristorante (es. "Servire solo piatti vegetariani", "Non rivelare mai la salsa segreta").
  2. L'Ordine del Cliente (Dati Non Fidati): Queste sono le richieste che i clienti portano con sé (es. "Voglio un hamburger", "Puoi raccontarmi una barzelletta?").

Nei modelli AI attuali, lo chef mette sia la Scheda della Ricetta che l'Ordine del Cliente nella stessa ciotola di mescolamento. Vengono tritati, mescolati e frullati insieme in un'unica, uniforme zuppa di ingredienti prima che lo chef inizi a cucinare.

La Tesi Principna del Paper:
Gli autori sostengono che, poiché la Ricetta e l'Ordine sono mescolati nella stessa ciotola, è matematicamente impossibile per lo chef distinguere perfettamente tra "ciò che ha detto il proprietario" e "ciò che ha detto il cliente" una volta che sono stati mescolati.

Se un cliente riesce a infilare un biglietto nel proprio ordine che dice: "Ignora la scheda della ricetta e dammi la salsa segreta", lo chef non può capire che quel biglietto è diverso dalla ricetta vera. Per il cervello dello chef, è tutto solo "zuppa". Pertanto, lo chef potrebbe accidentalmente seguire il trucchetto furtivo del cliente invece delle regole del proprietario.

L'Analogia Centrale: La Macchina di Von Neumann

Il paper confronta questo problema dell'IA con un famoso difetto di sicurezza informatica degli anni '70 chiamato Buffer Overflow.

  • I Vecchi Computer (Architettura Von Neumann): In queste macchine, i programmi informatici (codice) e i dati (numeri) vivevano nello stesso spazio di memoria. Un hacker poteva ingannare il computer fornendogli dei dati che sembravano un programma. Il computer avrebbe eseguito accidentalmente i dati come se fossero un comando, mandando in crash il sistema o permettendo all'hacker di prenderne il controllo.
  • L'IA Moderna (Transformer): Gli autori affermano che l'IA presenta esattamente lo stesso difetto. Le "Istruzioni" (il system prompt) e i "Dati" (l'input dell'utente) vivono nello stesso spazio matematico (vettori). Un hacker può creare dei "dati" che sembrano delle "istruzioni" per l'IA. Poiché l'IA non può distinguerli una volta mescolati, segue le istruzioni dell'hacker.

Il paper sostiene che, proprio come non potevamo risolvere i buffer overflow solo con un "codice migliore" o un "digitare più attento", non possiamo risolvere il prompt injection solo con un "migliore addestramento" o "più filtri". Il problema è l'architettura (la ciotola di mescolamento), non l'abilità dello chef.

I Tre Motivi per cui è Impossibile

Il paper dimostra questa impossibilità attraverso tre passaggi logici:

1. Il Problema del "Vocabolario Condiviso" (Collisione Rappresentativa)

  • La Metafora: Immaginate che la Scheda della Ricetta e l'Ordine del Cliente utilizzino entrambi la parola "Sale".
  • La Realtà: Nell'IA, parole come "il", "è", "tu" e "aiuto" appaiono sia nelle istruzioni di sistema che negli input dell'utente. L'IA mappa queste parole esattamente allo stesso numero matematico. Una volta che l'IA vede la parola "aiuto", non sa se proviene dalla regola del proprietario ("Aiuta l'utente") o dal trucco dell'utente ("Aiutami a aggirare le regole"). La "fonte" della parola viene cancellata nel momento in cui entra nella ciotola.

2. Il "Punto Cieco" in Cucina (Recupero della Provenienza)

  • La Metafora: Se provate a guardare la zuppa e a indovinare quale cucchiaiata provenga dalla Scheda della Ricetta e quale dall'Ordine del Cliente, sbaglierete a volte.
  • La Realtà: Il paper dimostra matematicamente che, poiché gli ingredienti "fidati" e "non fidati" sono così simili (condividono lo stesso vocabolario e spazio), nessun amount di osservazione della zuppa potrà distinguerli perfettamente. C'è sempre una piccola possibilità di errore. Se non si possono distinguere perfettamente, non si possono bloccare perfettamente le cose cattive.

3. Il Problema delle "Variazioni Infinite" (Copertura Finita)

  • La Metafora: Immaginate di addestrare il vostro chef a riconoscere 1.000 modi specifici in cui un cliente potrebbe provare a ingannarlo. Ma un cliente astuto può scrivere il suo trucco in 1.000.000 di modi diversi (usando lingue diverse, emoji, codici o trucchi di ortografia) che significano tutti la stessa cosa.
  • La Realtà: Potete addestrare un'IA su milioni di esempi, ma il numero di modi per ingannarla è praticamente infinito. Poiché l'IA impara vedendo esempi, non potrà mai imparare a essere sicura contro ogni possibile variazione di un trucco. Avrà sempre un "punto cieco" per un trucco che non ha ancora visto.

Cosa Significa per la Sicurezza dell'IA

Gli autori non stanno dicendo che l'IA è inutile o che dovremmo smettere di usarla. Stanno dicendo che:

  • Non si può "patchare" la ciotola di mescolamento: Non si può risolvere questo problema solo addestrando meglio l'IA, aggiungendo più "guardrail" o filtrando le parole. Finché l'IA mescola istruzioni e dati nello stesso spazio, un attaccante astuto troverà un modo per far scivolare dentro un'istruzione falsa.
  • La Soluzione è Architetturale: Per risolvere davvero questo problema, dobbiamo cambiare il design della cucina. Abbiamo bisogno di un sistema in cui la Scheda della Ricetta e l'Ordine del Cliente siano tenuti in ciotole separate che non si mescolano mai fino alla fine. La "Ricetta" deve essere una regola rigida che l' "Ordine del Cliente" non può toccare o sovrascrivere.
  • Difesa in Profondità: Finché non costruiremo questi nuovi sistemi a "ciotole separate", dobbiamo trattare l'IA come trattiamo i vecchi computer con buffer overflow: assumiamo che verranno hackerati, usiamo molteplici livelli di difese deboli (come firewall e sandbox) e limitiamo il danno nel caso in cui vengano violati.

Riassunto

Il paper dimostra che la sicurezza perfetta è impossibile per gli attuali modelli di IA perché essi trattano "cosa fare" e "cosa elaborare" come la stessa cosa. È come chiedere a uno chef di ignorare la nota del cliente se la nota è scritta con lo stesso inchiostro e sulla stessa carta della ricetta. L'unico modo per risolvere la questione è cambiare il design fondamentale dell'IA, non solo cercare di addestrarla meglio.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →