← Ultimi articoli
🤖 machine learning

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

Questo articolo propone un nuovo attacco white-box ai grandi modelli linguistici che sfrutta il recupero del contesto di associazione all'interno di un framework di editing della conoscenza per indurre comportamenti non sicuri attraverso intere categorie tematiche, preservando al contempo le prestazioni generali del modello.

Autori originali: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

Pubblicato 2026-08-19
📖 6 min di lettura🧠 Approfondimento

Autori originali: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I modelli linguistici di grandi dimensioni sono potenti programmi informatici in grado di scrivere storie, rispondere a domande e assistere in compiti complessi. Per rendere questi strumenti sicuri per l'uso quotidiano, gli sviluppatori li addestrano a rifiutare richieste dannose, come istruzioni su come costruire un'arma o diffondere disinformazione pericolosa. Questo processo, noto come allineamento, è destinato ad agire come un parapetto, garantendo che la macchina si comporti come un assistente utile piuttosto che come una fonte di pericolo. Tuttavia, man mano che questi modelli diventano più autonomi e vengono affidati a decisioni sensibili, i ricercatori devono capire esattamente quanto siano forti questi parapetti. Se i meccanismi di sicurezza possono essere aggirati, è fondamentale sapere come, affinché si possano costruire protezioni più forti. Questo campo di studio consiste nel guardare all'interno del funzionamento interno del modello per vedere come elabora le informazioni e prende decisioni, piuttosto che limitarsi a testarlo dall'esterno.

Un team di ricercatori ha scoperto un nuovo modo per testare questi sistemi di sicurezza trattando il rifiuto del modello di rispondere come una specifica conoscenza che può essere sovrascritta. Invece di cercare di ingannare il modello con giochi di parole astuti o comandi nascosti, hanno utilizzato una tecnica chiamata editing della conoscenza (knowledge editing). Questo metodo permette agli scienziati di individuare la parte esatta del cervello del modello responsabile di un fatto specifico e di modificarla. Ad esempio, se un modello crede che un certo fatto sia vero, i ricercatori possono alterare le connessioni interne in modo che il modello creda invece a un fatto diverso. I ricercatori si sono resi conto che questa stessa tecnica poteva essere utilizzata per cambiare il comportamento del modello: invece di insegnargli un nuovo fatto, potevano insegnargli a smettere di rifiutare richieste dannose. Hanno scoperto che modificando i pesi interni del modello per associare una richiesta dannosa a una risposta conforme, potevano efficacementmente rimuovere i guardrail di sicurezza per intere categorie di domande pericolose.

I ricercatori hanno testato questo approccio su diversi tipi di modelli linguistici, incluse basi su architetture popolari come GPT, Llama e Qwen. Si sono concentrati su un metodo che individua prima lo strato specifico del modello in cui viene presa una decisione e poi modifica quello strato per cambiare l'esito. Nei precedenti tentativi di rompere i filtri di sicurezza, i ricercatori spesso facevano affidamento sul trovare una singola "direzione di rifiuto" nella matematica del modello e nel spingere contro di essa. Gli autori di questo studio hanno scoperto che questo vecchio metodo era fragile; spesso comprometteva la capacità del modello di parlare in modo coerente o causava il fallimento in compiti di base. Al contrario, il loro nuovo approccio era più chirurgico. Hanno identificato che quando un modello viene modificato usando questi metodi precisi, tende ad assegnare una probabilità molto alta a una specifica frase di inizio conforme, come "Certamente, ecco il piano". Mirando a questa specifica reazione, potevano costringere il modello ad accettare richieste dannose senza distruggere la sua intelligenza generale.

Per far sì che questo funzionasse su domande del mondo reale, il team ha dovuto risolvere un problema complicato: come trovare la parte giusta di una frase da modificare. Nelle attività semplici di verifica dei fatti, il soggetto è chiaro, come il nome di una persona. Ma in un'istruzione complessa come "Come faccio a creare un virus?", il soggetto è l'intera istruzione stessa. I ricercatori hanno sviluppato un modo per tracciare il pensiero del modello per trovare esattamente quali parole nel prompt fossero più responsabili del rifiuto. Hanno poi usato la conoscenza del modello stesso per costruire un contesto più ricco attorno a quelle parole, creando un bersaglio più stabile per l'editing. Ciò ha permesso loro di rimuovere il comportamento di rifiuto non solo per una specifica domanda, ma per un'intera famiglia di domande simili. Ad esempio, se avessero modificato il modello per ignorare le regole di sicurezza per la scrittura di codice malware, il modello sarebbe diventato disposto a scrivere altri tipi di codice dannoso, anche se la formulazione fosse stata leggermente diversa.

I risultati degli esperimenti hanno dimostrato che questo metodo era altamente efficace. Su uno dei modelli testati, il nuovo approccio ha aumentato la disponibilità del modello a fornire informazioni dannose a un punteggio di 3,12 su 4, rispetto a 2,98 per un metodo di editing standard e 3,01 per il vecchio approccio basato sul rifiuto. Più importante ancora, il modello rimaneva utile e coerente. Quando testato su domande innocue, il modello modificato rispondeva ancora correttamente, mantenendo un alto livello di prestazione nei compiti di conoscenza generale. I vecchi metodi, che cercavano di spingere il modello lontano dal rifiuto, spesso causavano la perdita della capacità del modello di pensare logicamente, risultando in risposte prive di senso o interrotte. Il nuovo metodo è riuscito a sbloccare il comportamento dannoso mantenendo intatto il resto del cervello del modello. Ciò suggerisce che i filtri di sicurezza in questi modelli non sono solo un singolo muro, ma un insieme di associazioni specifiche che possono essere rimosse con cura senza far crollare l'intera struttura.

Lo studio ha anche evidenziato i limiti delle difese attuali. I ricercatori hanno scoperto che, mentre il loro metodo funzionava bene su modelli più vecchi o meno allineati, era più difficile da applicare ai modelli più recenti e addestrati con più cura. Anche su questi sistemi più robusti, il metodo mostrava comunque una certa capacità di aggirare la sicurezza, sebbene l'effetto fosse minore. Ciò indica che man mano che i modelli diventano più avanzati, i meccanismi di sicurezza diventano più complessi, ma non sono ancora impenetrabili. I ricercatori hanno sottolineato che il loro lavoro è stato condotto in un ambiente controllato utilizzando modelli open-source accessibili a chiunque. Non hanno fornito una guida passo dopo passo per la creazione di strumenti pericolosi, ma hanno piuttosto dimostrato una vulnerabilità che deve essere corretta. Mostrando che la sicurezza può essere compromessa attraverso editi interni precisi piuttosto che solo tramite prompt astuti, lo studio offre una nuova prospettiva su come costruire modelli che siano veramente sicuri. Le scoperte suggeriscono che le future misure di sicurezza devono essere più robuste contro questi cambiamenti interni, assicurando che il rifiuto di fare del male sia profondamente radicato nella struttura del modello piuttosto che essere solo una reazione superficiale.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →