← Ultimi articoli
🤖 AI

SecureClaw: Clawing Back Control of LLM Agents

SecureClaw è un'architettura di sicurezza a doppio confine per agenti LLM dotati di strumenti che impedisce azioni esterne non autorizzate ed esposizioni di dati sensibili imponendo un gateway fidato per le operazioni di lettura e un protocollo PREVIEW-to-COMMIT per le operazioni di scrittura, raggiungendo tassi di successo degli attacchi vicini allo zero attraverso molteplici benchmark pur mantenendo l'utilità del compito.

Autori originali: Yuhan Ma, Stefan Schmid

Pubblicato 2026-06-09
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Yuhan Ma, Stefan Schmid

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di assumere un assistente personale molto intelligente, ma poco affidabile (l'Agente LLM) per gestire i tuoi compiti sensibili, come pagare le bollette, leggere email private o gestire il tuo calendario.

Il problema è che questo assistente è un po' un elemento imprevedibile. Se gli dai un documento con il tuo numero di conto bancario, potrebbe accidentalmente (o maliziosamente) leggerlo ad alta voce a uno sconosciuto, o potrebbe essere ingannato da una nota nascosta all'interno di un'email per inviare i tuoi soldi a un truffatore.

Gli attuali sistemi di sicurezza cercano solitamente di impedire all'assistente di fare la cosa brutta (come inviare i soldi), ma spesso falliscono nel non impedire all'assistente di vedere il segreto in primo luogo. Una volta che l'assistente vede il segreto, può sussurrarlo ad altri programmi o scriverlo nei suoi appunti prima ancora che la guardia abbia la possibilità di intervenire.

SecureClaw è un nuovo sistema di sicurezza progettato per risolvere entrambi i problemi contemporaneamente. Tratta il "vedere" e il "fare" come due lavori separati che richiedono due serrature diverse.

Ecco come funziona, usando un'analogia semplice:

Le Due Serrature di SecureClaw

1. La "Benda" per la Lettura (Il Gateway)

Immagina che il tuo assistente debba guardare una fattura segreta per sapere quanto pagare.

  • Vecchia via: Consegni all'assistente la fattura cartacea vera e propria. L'assistente può leggere i numeri, copiarli o persino leggerli ad alta voce a un hacker che ascolta.
  • Via SecureClaw: Non gli dai la carta. Invece, gli dai una scatola misteriosa (un "handle opaco") e una piccola nota sanificata (un "riassunto limitato").
    • La nota dice: "Fattura da Fornitore A, $4.200, scadenza venerdì."
    • La scatola misteriosa è un codice che solo la cassaforte sicura sa come aprire.
    • L'assistente può pianificare il proprio lavoro usando la nota e il codice, ma non può aprire la scatola per vedere i dettagli reali della fattura. Non può copiare i numeri reali perché non li ha mai visti.

2. Il "Doppio Controllo" per l'Azione (L'Esecutore)

Ora, immagina che l'assistente voglia inviare un'email per pagare quella fattura.

  • Vecchia via: L'assistente scrive l'email e preme "Invia". Se un hacker ha ingannato l'assistente facendogli cambiare l'indirizzo email con quello di un truffatore, i soldi vanno al truffatore.
  • Via SecureClaw: L'assistente può solo proporre l'email. Scrive una bozza e dice: "Voglio inviare questo."
    • Una Guardia Fidata (l'Esecutore) prende la bozza.
    • La Guardia controlla: "Mi hai chiesto di inviare questo? Il destinatario è corretto? L'importo è giusto?"
    • Fondamentalmente, la Guardia controlla i dettagli esatti rispetto a una ricevuta sigillata e immutabile di ciò che era stato originariamente approvato.
    • Se l'assistente avesse cercato di cambiare segretamente l'indirizzo email con quello di un truffatore dopo aver ricevuto l'approvazione, la Guardia vedrebbe la discrepanza e bloccherebbe l'email. Solo la Guardia ha il potere di premere effettivamente "Invia".

Perché Questo è Importante

Il documento ha testato questo sistema contro tre diversi "campi di gioco per hacker" (AgentDojo, AgentLeak e ASB) dove gli attaccanti hanno cercato di ingannare gli agenti per rubare dati o inviare denaro alle persone sbagliate.

  • Il Risultato: SecureClaw è stato l'unico sistema che ha intercettato con successo il 100% dei trasferimenti di denaro non autorizzati (0% di successo dell'attacco) e ha ridotto le perdite di dati segreti quasi a zero.
  • Il "Segreto" del Successo: Il documento dimostra che non basta usare una sola serratura.
    • Se usi solo il "Doppio Controllo" (fermare l'invio), l'assistente può comunque leggere il segreto e farlo trapelare attraverso i suoi appunti interni.
    • Se usi solo la "Benda" (nascondere il segreto), l'assistente potrebbe comunque essere ingannato nell'inviare un messaggio alla persona sbagliata se non possiede il segreto fin dall'inizio.
    • SecureClaw usa entrambi. Mantiene i segreti nascosti all'assistente e assicura che l'assistente non possa forzare un'azione senza un controllo finale fidato.

Cosa Succede Quando Dice "No"?

A volte, il sistema blocca una richiesta perché sembra sospetta. In passato, questo avrebbe potuto semplicemente interrompere l'intero flusso di lavoro, frustrando l'utente. SecureClaw ha una funzione di "Recupero Sicuro".

Se la Guardia blocca una richiesta, invece di dire solo "Errore", fornisce all'assistente un percorso sicuro e pre-approvato per riprovare.

  • Esempio: "Non posso inviare questa email allo sconosciuto. Ma posso preparare una bozza per te, affinché tu possa rivederla prima."
  • Questo mantiene il lavoro in movimento senza abbassare gli standard di sicurezza.

In Sintesi

SecureClaw è come assumere una guardia del corpo che indossa una benda quando legge il tuo diario (così non memorizza i tuoi segreti) e che tiene le chiavi della tua auto (così non può guidarti in un posto pericoloso senza controllare la mappa prima). Separa la capacità di pianificare dalla capacità di agire, garantendo che anche se l'assistente viene ingannato, il danno sia contenuto.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →