← Ultimi articoli
🤖 AI

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

Questo studio dimostra che all'interno di modelli linguistici di grandi dimensioni della stessa linea, la rimozione dei meccanismi di rifiuto (ablazione) migliora significativamente la loro utilità pratica per compiti di analisi delle vulnerabilità del software — come la validazione delle patch e la localizzazione del codice — rispetto alle loro controparti allineate, evidenziando la necessità che le valutazioni di sicurezza assessino congiuntamente la disponibilità di risposta, la correttezza e l'azionabilità.

Autori originali: Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

Pubblicato 2026-07-08
📖 5 min di lettura🧠 Approfondimento

Autori originali: Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere due gemelli identici che sono entrambi brillanti detective del software. Sono cresciuti nella stessa casa, sono andati nelle stesse scuole e hanno imparato dagli stessi libri. Tuttavia, uno dei gemelli (chiamiamolo Il Guardiano) è stato istruito con una regola severa: "Se una domanda sembra anche solo un po' simile a qualcosa che potrebbe essere usato per scassinare una casa, devi rifiutarti di rispondere, giusto per sicurezza". L'altro gemello (L'Senza Filtri) ha avuto quella specifica regola chirurgicamente rimossa; lui risponde a quasi tutto, purché la domanda venga posta.

Questo articolo è uno studio su questi due gemelli per vedere chi è effettivamente più bravo ad aiutare un team di sicurezza a riparare un vero buco nella loro casa digitale.

Il Grande Problema: Il Dilemma del "Falso Allarme"

Nel mondo della sicurezza del software, le parole usate per descrivere un problema (come "come aggirare un firewall") sono spesso le stesse parole usate dagli hacker.

  • Il Guardiano è così prudente che spesso si rifiuta di aiutare il team di sicurezza perché le loro domande sembrano troppo simili al piano di un hacker. Pensa: "Questo sembra pericoloso, quindi dirò di no".
  • L'Senza Filtri non ha questa esitazione. Risponde alla domanda.

La grande domanda che i ricercatori si sono posti era: La regola della "sicurezza" aiuta davvero, o rende solo il lavoro del team di sicurezza più difficile rifiutandosi di rispondere a domande legittime?

L'Esperimento: Stessa Famiglia, Regole Diverse

Per assicurarsi di confrontare mele con mele, i ricercatori non hanno semplicemente scelto due modelli AI casuali. Hanno preso una specifica famiglia di AI (come la famiglia Gemma e la famiglia Qwen) e hanno confrontato la versione originale, con il tuning della sicurezza, con una versione in cui la parte di "rifiuto" era stata disattivata.

Li hanno testati su una scala di compiti, che diventavano più difficili salendo:

  1. Individuare il bug: "Questo codice è pericoloso?"
  2. Nominare il bug: "Che tipo di bug è questo?"
  3. Trovare la riga: "Esattamente quale riga di codice è rotta?"
  4. Ripararlo: "Scrivi una patch che sia effettivamente compilabile e funzionante."

Cosa Hanno Scoperto

1. Il Mito del "Rifiuto"
I ricercatori hanno scoperto che il gemello "Guardiano" non rifiutava molto spesso. Entrambi i gemelli di solito rispondevano alle domande. Quindi, il problema non era che il Guardiano dicesse "No". Il problema era come rispondeva quando diceva "Sì".

2. La Trappola del Linguaggio "Neutro" vs "Sicurezza"
È qui che la cosa si fa interessante.

  • Quando la domanda veniva posta in un linguaggio semplice e noioso (ad es. "Per favore, esamina questo codice per errori"), il gemello Guardiano era spesso leggermente migliore in compiti semplici come individuare il bug.
  • Quando la domanda usava il gergo professionale della sicurezza (ad es. "Analizza questo vettore di exploit per input controllato dall'attaccante"), il gemello Guardiano iniziava a inciampare. Diventava confuso, dava risposte vaghe o rifiutava. Il gemello Senza Filtri, invece, rimaneva concentrato e dava risposte molto migliori, specialmente per trovare l'esatta riga di codice interrotta.

3. Il Test del "Riparalo"
Il test più importante era: "Puoi scrivere una correzione che funzioni davvero?"

  • Nel linguaggio di programmazione Java, quando le domande usavano termini di sicurezza professionali, il gemello Senza Filtri era una super star. Produceva correzioni che potevano essere compilate e testate circa il 67% delle volte, mentre il gemello Guardiano riusciva solo nel 30% dei casi.
  • Tuttavia, in Python e C++ con domande neutre e semplici, il gemello Guardiano faceva un lavoro leggermente migliore proprio nell'ultimo passaggio di far funzionare la correzione.

4. L'Effetto "Deriva"
Lo studio ha anche scoperto che il gemello Guardiano era instabile. Se gli ponevi la stessa domanda ma cambiavi alcune parole per farle sembrare più "da sicurezza", poteva darti una risposta completamente diversa o indicare una riga di codice diversa. Il gemello Senza Filtri era molto più coerente; dava la stessa buona risposta indipendentemente da come la domanda fosse formulata.

La Conclusione

L'articolo conclude che le regole di sicurezza nell'AI sono un'arma a doppio taglio.

  • Il Bene: Impediscono all'AI di aiutare gli hacker.
  • Il Male: A volte rendono l'AI troppo nervosa per aiutare i "buoni" (i difensori) quando questi ultimi usano il linguaggio tecnico necessario per svolgere il proprio lavoro.

I ricercatori suggeriscono che non dovremmo misurare la sicurezza dell'AI solo contando quante volte dice "No". Dobbiamo anche misurare se fornisce risposte corrette, utilizzabili e stabili quando dice "Sì".

In breve: Per essere davvero sicura, un'AI deve essere abbastanza intelligente da capire la differenza tra un hacker che cerca di scassinare un ingresso e un esperto di sicurezza che cerca di riparare una serratura, anche se stanno usando lo stesso vocabolario. Attualmente, l'AI "Guardiana" ha troppa paura del vocabolario, mentre l'AI "Senza Filtri" è più brava nel lavoro effettivo, a patto che si possa fidare del fatto che non aiuti i cattivi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →