← Ultimi articoli
🤖 machine learning

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

Questo articolo introduce SEC-bench Pro, un benchmark rigoroso che presenta 183 vulnerabilità reali in V8 e SpiderMonkey, rivelando che gli agenti di codifica basati su modelli linguistici attuali faticano con compiti di sicurezza software a lungo orizzonte, raggiungendo al massimo un tasso di successo del 38,8% anche con modelli all'avanguardia.

Autori originali: Hwiwon Lee, Jiawei Liu, Dongjun Kim, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

Pubblicato 2026-05-27
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Hwiwon Lee, Jiawei Liu, Dongjun Kim, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di assumere un team di investigatori super-intelligenti, potenziati dall'IA, per trovare trappole nascoste in un motore video-giochi massiccio e complesso. Questi motori (chiamati motori JavaScript) eseguono il codice che fa funzionare siti web e applicazioni. Se un investigatore trova una trappola, deve mostrare esattamente come attivarla (una "Prova di Concetto" o PoC) in modo che gli sviluppatori del gioco possano ripararla.

Questo articolo introduce un nuovo test molto rigoroso chiamato SEC-bench Pro per valutare quanto siano bravi questi investigatori IA a trovare queste trappole nel mondo reale.

Il Problema dei Test Precedenti

I test precedenti erano come dare all'investigatore una mappa del tesoro che segnava già la "X" dove si trovava il tesoro. Potrebbero aver detto: "Vai alla riga 500 e premi questo pulsante per rompere il gioco".

  • Il Problema: La caccia ai bug reali non funziona così. Gli investigatori reali devono esaminare l'intero codice, capire dove la trappola potrebbe essere e poi provare ad attivarla senza sapere esattamente dove si trova. I vecchi test non misuravano questa abilità reale; misuravano solo se l'IA poteva seguire una mappa.

Il Nuovo Test: SEC-bench Pro

Gli autori hanno costruito un nuovo test più difficile utilizzando due famosi motori di gioco: V8 (usato da Google Chrome) e SpiderMonkey (usato da Firefox).

  1. La Configurazione: Hanno preso 183 trappole reali e confermate che gli umani avevano trovato in precedenza.
  2. L'Ambiente: Hanno ricreato la versione esatta "macchina del tempo" del software in cui esisteva la trappola, più la versione in cui era stata riparata.
  3. Le Regole: Gli agenti IA hanno ricevuto il codice grezzo e una descrizione vaga di un problema. Dovevano:
    • Individuare il percorso di codice specifico verso la trappola.
    • Scrivere uno script (la PoC) per attivare il crash.
    • Dimostrare che lo script rompe solo la versione vecchia ed è riparato nella versione nuova.

Il Giudice "Tre Immagini"

Questa è la parte più importante del loro nuovo test. In passato, se un IA causava qualsiasi crash, otteneva un punto. Ma un'IA potrebbe accidentalmente rompere qualcos'altro nel gioco che non era la trappola specifica che stava cercando.

SEC-bench Pro utilizza un Giudice a Tre Immagini (un arbitro IA sofisticato):

  • Immagine 1 (La Trappola): Lo script rompe la versione vecchia?
  • Immagine 2 (La Riparazione): Lo script smette di rompere la versione nuova (dove è applicata la patch)?
  • Immagine 3 (L'Ultima): Lo script rompe la versione più recente (dove potrebbero essere avvenute altre riparazioni)?

Se l'IA causa un crash nella versione vecchia ma anche nella versione riparata, il Giudice dice: "Non hai trovato la trappola specifica; hai solo rotto il gioco in generale". Questo impedisce all'IA di ottenere punti per errori fortunati e non correlati.

I Risultati: Gli Investigatori IA Faticano

L'articolo ha testato tre investigatori IA di alto livello (potenziati da modelli come GPT-5.4, Opus 4.6 e Kimi-K2.6). Ecco cosa è successo:

  • La Scheda Punteggi: Anche l'IA più intelligente ha potuto risolvere solo circa il 32% al 39% delle trappole. Ciò significa che hanno fallito in più del 60% dei casi.
  • Il "Novellino" Open-Weight: Un'IA open-source più economica (Kimi-K2.6) ha risolto solo circa l'11,7% delle trappole V8.
  • L'Effetto Lavoro di Squadra: Interessantemente, gli investigatori IA hanno trovato trappole diverse. Quando si sono combinati i risultati dei due migliori IA, hanno risolto insieme circa il 48% delle trappole SpiderMonkey, ma nessuno dei due poteva farlo da solo. Sono come due investigatori con specializzazioni diverse; uno è bravo a trovare un tipo di indizio, l'altro un tipo diverso.

Perché Hanno Fallito?

L'articolo ha individuato due ragioni principali per cui le IA hanno faticato:

  1. Troppe Congetture (L'approccio "Spray and Pray"): Un'IA (Claude) ha provato a generare migliaia di script. La maggior parte di essi non rompeva effettivamente nulla, o rompeva la cosa sbagliata. Era come lanciare un milione di dardi su una bacheca sperando che uno colpisse il centro.
  2. Troppa Cautela (L'approccio "Over-Thinker"): Un'altra IA (Codex) era molto cauta. Analizzava il codice, decideva che una trappola potrebbe esserci, ma se non poteva dimostrarlo al 100% prima di inviare, si arrendeva e diceva "Non ce la faccio". Ha perso molte trappole perché aveva troppa paura di sbagliare.

La Grande Conclusione

L'articolo conclude che, sebbene l'IA stia migliorando nella scrittura del codice, non è ancora molto brava nel lungo e difficile processo di caccia ai bug di sicurezza in software complessi e reali.

La migliore IA attuale può trovare alcune trappole, ma ne perde la maggior parte. Il nuovo benchmark (SEC-bench Pro) dimostra che abbiamo bisogno di strumenti migliori per aiutare queste IA a collegare i puntini tra il codice e le trappole nascoste, piuttosto che sperare semplicemente che abbiano fortuna con un crash.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →