← Nieuwste papers
🤖 AI

CrackMeBench: Binary Reverse Engineering for Agents

Dit artikel introduceert CrackMeBench, een nieuw benchmarkontwerp om de capaciteiten van taalmodelagenten te evalueren bij het autonoom uitvoeren van binaire reverse engineering om validatielogica te herstellen en geldige invoer te genereren voor educatieve CrackMe-achtige uitdagingen, waarbij verschillende successniveaus worden aangetoond voor verschillende modellen op zowel publieke als gegenereerde taken.

Oorspronkelijke auteurs: Isaac David, Arthur Gervais

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Isaac David, Arthur Gervais

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gesloten doos voor. Je hebt de sleutel niet, en je hebt ook de blauwdrukken niet voor hoe het slot is gebouwd. Je hebt alleen de doos zelf. Je doel is om precies uit te vinden welke combinatie van getallen, woorden of handelingen ervoor zorgt dat die doos opent.

Dit is de kernuitdaging van binair reverse engineering, en het is het specifieke probleem dat een nieuwe test genaamd CrackMeBench is ontworpen om op te lossen voor Kunstmatige Intelligentie.

Hier is een eenvoudige uitleg waar het paper over gaat, met behulp van alledaagse analogieën.

Het Probleem: De "Black Box"-test

De meeste AI-codetests vandaag zijn als het geven van een recept (broncode) aan een student en hen vragen een typefout te corrigeren of een nieuw ingrediënt toe te voegen. Maar in de echte wereld van cybersecurity krijg je vaak het recept niet. Je krijgt alleen de afgewerkte taart (het gecompileerde programma).

De onderzoekers vroegen zich af: Kan een AI naar een afgewerkt, vergrendeld programma kijken, uitzoeken hoe het "slot" werkt, en de exacte sleutel maken om het te openen?

Om dit te testen, creëerden ze CrackMeBench. Denk hierbij aan een gigantische, geautomatiseerde "ontsnappingskamer" voor AI.

  • De Kamer: Een beveiligde, geïsoleerde digitale zandbak (een Docker-container) waar de AI niet met het externe internet kan communiceren.
  • De Gereedschappen: De AI krijgt een specifieke gereedschapskist (zoals een schroevendraaier, een vergrootglas of een code-vertaler) en krijgt precies te horen welke gereedschappen het heeft. Het kan niet gokken; het moet gebruiken wat er op de lijst staat.
  • Het Doel: De AI moet een "sleutel" produceren. Dit kan een wachtwoord, een bestand of een script zijn dat een serienummer genereert.
  • De Scheidsrechter: Er is een verborgen "Orakel" (een scheidsrechter). De AI krijgt geen punten voor het schrijven van een lang essay waarin wordt uitgelegd hoe het denkt dat het slot werkt. Het krijgt alleen punten als het slot daadwerkelijk opent wanneer het zijn sleutel probeert.

De Test: 20 Verschillende Puzzels

De onderzoekers bouwden een test met 20 verschillende "sloten" (taken):

  1. 8 Publieke Puzzels: Dit zijn als klassieke, bekende raadsels die mensen eerder hebben opgelost. Ze dienen als "kalibratie" om ervoor te zorgen dat de test eerlijk en begrijpelijk is.
  2. 12 Nieuwe Puzzels: Deze zijn vers gegenereerd door de onderzoekers. Ze variëren van "Makkelijk" (zoals het vinden van een verborgen woord in een tekstbestand) tot "Moeilijk" (waarbij het slot van vorm verandert terwijl je ernaar kijkt, of zijn geheimen verbergt totdat het begint te draaien).

De Resultaten: Wie Won de Ontsnappingskamer?

De onderzoekers zetten drie verschillende AI-modellen in deze ontsnappingskamer met een tijdslimiet van 5 minuten. Ze gaven elke AI drie kansen om een sleutel in te dienen.

Hier is hoe ze presteerden op de 12 nieuwe, moeilijkere puzzels:

  • GPT-5.5 (De Topperformer): Loste 11 van de 12 puzzels op. Het was als een meester-slotenmaker die snel het mechanisme kon uitzoeken en het slot kon openen.
  • Claude Opus 4.7 (De Middenmoter): Loste 7 van de 12 puzzels op. Het was goed, maar kwam soms vast te zitten bij het uitzoeken van de interne logica van het slot.
  • Kimi K2 (De Strijder): Loste 5 van de 12 puzzels op. Het bracht vaak te veel tijd door met naar het slot te kijken zonder ooit te proberen de sleutel te draaien.

De "Publieke" Puzzels waren zelfs nog moeilijker:
Toen de AI probeerde de 8 klassieke, publieke puzzels op te lossen, daalden de scores voor iedereen aanzienlijk. Zelfs de beste AI (GPT-5.5) loste slechts 3 van de 8 op. Dit suggereert dat, hoewel AI beter wordt in deze taken, echte, rommelige puzzels nog steeds zeer moeilijk zijn.

Waarom Dit Belangrijk Is (Volgens het Paper)

Het paper benadrukt een paar belangrijke verschillen tussen deze test en andere:

  • Geen "Fluff": In veel tests kan een AI een hoge score behalen door een zeer overtuigend verhaal te schrijven over hoe het een probleem heeft opgelost, zelfs als het verhaal verkeerd is. Hier faalt de AI als het slot niet opent. Het gaat puur om resultaten, niet om uitleg.
  • De "Keygen"-Uitdaging: Sommige puzzels vroegen niet om één wachtwoord; ze vroegen de AI om een machine te schrijven die wachtwoorden kon genereren voor elke gebruiker. Dit is als de AI vragen om een sleutelfabriek te bouwen, in plaats van slechts één slot te openen. De AI moest het patroon begrijpen, niet slechts één antwoord memoriseren.
  • De "Ruis"-Factor: De moeilijkere puzzels bevatten "ruis", zoals valse aanwijzingen of code die verandert tijdens het draaien. De beste AI (GPT-5.5) was beter in het negeren van de ruis en het focussen op het echte mechanisme.

De Conclusie

CrackMeBench is een nieuwe, strenge scorebord voor AI. Het bewijst dat, hoewel AI zeer goed wordt in het lezen van code en het repareren van software, het nog steeds leert hoe het een afgewerkt, gecompileerd programma uit elkaar moet halen en uitzoeken hoe het opengebroken moet worden.

Het paper concludeert dat we vooruitgang boeken, maar dat er nog steeds een groot gat is tussen wat AI kan doen met een recept (broncode) en wat het kan doen met alleen het afgewerkte gerecht (het uitvoerbare binaire bestand). De test biedt een duidelijke, reproduceerbare manier om te meten hoe snel dat gat wordt gedicht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →