The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark
Dit artikel introduceert SRE-Bench, de eerste realistische en contaminatievrije benchmark voor het evalueren van agentische reverse engineering-capaciteiten op binaire code, die onthult dat zelfs de sterkste frontier LLM's moeite hebben om menselijk niveau te evenaren vanwege de unieke uitdagingen van het analyseren van onbekende, beschermde binaries.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen. Normaal gesproken, wanneer je een misdaad onderzoekt, krijg je de kans om het dagboek van de verdachte te lezen, hun handgeschreven aantekeningen en hun e-mails. Dit is vergelijkbaar met het lezen van broncode: de originele, voor mensen leesbare instructies die een computer vertellen wat hij moet doen. Maar in de echte wereld van cybersecurity laten de slechteriken hun dagboeken niet in het openbaar liggen. Ze overhandigen je een vergrendelde, verzegelde doos zonder instructies aan de buitenkant. Dit is een binair bestand: een bestand gemaakt van ruwe computerbytes dat voor mensen als wartaal oogt. Om te achterhalen wat erin zit, moet je reverse engineering uitvoeren—de doos stuk voor stuk uit elkaar halen om te raden hoe het slot werkt en wat de inhoud is.
Stel je nu voor dat we superintelligente AI-detectives (genaamd AI-agenten) hebben gebouwd die geweldig zijn in het lezen van die dagboeken. Ze kunnen leugens ontdekken en aanwijzingen in tekst sneller vinden dan een mens. Maar kunnen deze AI-detectives ook de vergrendelde dozen kraken? Dat is de grote vraag. Als de AI alleen het dagboek kan lezen maar de doos niet kan openen, is het geen echte held in de cybersecurity. We moeten weten of deze digitale detectives daadwerkelijk het zware werk van reverse engineering kunnen doen, of dat ze alleen vertrouwen op patronen uit de data die ze tijdens hun training hebben gezien.
Dit artikel introduceert een gloednieuwe, supermoeilijke test genaamd SRE-Bench om erachter te komen. De onderzoekers hebben 19 volledig nieuwe, geheime programma's vanaf nul opgebouwd—alsof ze 19 unieke, complexe videogames en beveiligingssystemen hebben ontworpen die nog nooit door een AI zijn gezien. Vervolgens hebben ze deze programma's vergrendeld met 44 verschillende soorten hoogtechnologische beveiligingsbewakers (obfuscatie-technieken) om ze extreem moeilijk te kraken te maken. Ze hebben vijf van de slimste AI-modellen ter wereld getest tegen deze vergrendelde dozen, inclusief toekomstige versies zoals GPT-5.6-sol en Claude-Opus-5 uit een evaluatie van 2026.
De resultaten waren een waarschuwing. Zelfs de sterkste AI in deze studie, GPT-5.6-sol, slaagde er slechts in om ongeveer 31,5% van de gevallen volledig op te lossen (een perfecte score behaalde op 80 van de 262 instanties). De andere AI's deden het nog slechter; sommigen losten zelfs geen enkele op. De studie toonde aan dat deze AI-agenten heel anders handelen dan menselijke experts. Terwijl mensen worstelen met zaken als code-optimalisatie (wat code efficiënt maar rommelig maakt), merkten de AI's die hindernissen nauwelijks op. In plaats daarvan vertrouwden de AI's zwaar op het zien van namen en labels in de code; toen de onderzoekers die namen verwijderden, stortte de prestatie van de AI in. Het belangrijkste is dat de studie bewijst dat goed zijn in het lezen van broncode niet betekent dat een AI goed is in het kraken van binaire bestanden. De "vergrendelde doos" blijft een enorme, onopgeloste uitdaging, en SRE-Bench is de eerste realistische, eerlijke test om te meten hoe ver we echt zijn verwijderd van het oplossen ervan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.