← Ultimi articoli
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

Questo articolo introduce SRE-Bench, il primo benchmark realistico e privo di contaminazioni per valutare le capacità di reverse engineering agentico sul codice binario, rivelando che anche i più forti modelli linguistici di frontiera faticano a eguagliare le prestazioni umane a causa delle sfide uniche derivanti dall'analisi di binari inediti e protetti.

Autori originali: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

Pubblicato 2026-08-13
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere un detective che cerca di risolvere un mistero. Di solito, quando indaghi su un crimine, ti capita di leggere il diario del sospettato, i suoi appunti scritti a mano e le sue email. Questo è come guardare il codice sorgente: le istruzioni originali, leggibili dagli umani, che dicono a un computer cosa fare. Ma nel mondo reale della cybersecurity, i cattivi non lasciano i loro diari in bella vista. Ti consegnano una scatola chiusa e sigillata, senza istruzioni all'esterno. Questo è un binario: un file composto da byte grezzi per il computer che appare come un geroglifico per gli esseri umani. Per capire cosa c'è dentro, devi eseguire l'ingegneria inversa — smontare la scatola pezzo dopo pezzo, per indovinare come funziona la serratura e quali siano i contenuti.

Ora, immagina che abbiamo costruito dei detective IA super intelligenti (chiamati agenti IA) che sono incredibili nel leggere quei diari. Possono scovare bugie e trovare indizi nel testo più velocemente di un essere umano. Ma questi detective IA sanno scassinare le scatole chiuse? Questa è la grande domanda. Se l'IA può solo leggere il diario ma non riesce ad aprire la scatola, non è un vero eroe della cybersecurity. Dobbiamo sapere se questi detective digitali sono effettivamente in grado di svolgere il duro lavoro dell'ingegneria inversa, o se si stanno solo affidando a schemi derivanti dai dati visti durante il loro addestramento.

Questo articolo introduce un test completamente nuovo e super impegnativo chiamato SRE-Bench per scoprirlo. I ricercatori hanno creato da zero 19 programmi completamente nuovi e segreti — come se avessero progettato 19 unici, complessi videogiochi e sistemi di sicurezza che nessun'IA ha mai visto prima. Hanno poi blindato questi programmi con 44 diversi tipi di guardie del corpo hi-tech (tecniche di offuscamento) per renderli incredibilmente difficili da scardinare. Hanno testato cinque dei modelli IA più intelligenti al mondo contro queste scatole chiuse, inclusi futuri modelli come GPT-5.6-sol e Claude-Opus-5 di una valutazione del 2026.

I risultati sono stati un campanello d'allarme. Persino l'IA più forte di questo studio, GPT-5.6-sol, è riuscita a risolvere completamente solo circa il 31,5% dei casi (ottenendo un punteggio perfetto in 80 istanze su 262). Le altre IA sono andate persino peggio, con alcune che non sono riuscite a risolverne nemmeno una. Lo studio ha rilevato che questi agenti IA si comportano in modo molto diverso dagli esperti umani. Mentre gli umani faticano con cose come l'ottimizzazione del codice (che rende il codice efficiente ma disordinato), le IA quasi non hanno notato tali ostacoli. Inveve, le IA si sono affidate pesantemente alla visione di nomi ed etichette nel codice; quando i ricercatori hanno rimosso quei nomi, le prestazioni dell'IA sono crollate. Soprattutto, lo studio dimostra che essere bravi a leggere il codice sorgente non significa essere bravi a scardinare i binari. La "scatola chiusa" rimane una sfida enorme e non ancora risolta, e SRE-Bench è il primo test realistico e imparziale per misurare quanto siamo lontani dal risolverla.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →