← Nieuwste papers
🤖 AI

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

Dit paper introduceert DeepRed, een open-source benchmark voor het evalueren van LLM-agents in realistische CTF-uitdagingen via een geautomatiseerd systeem voor gedeeltelijke credit-toekenning, en toont aan dat de huidige modellen beperkt blijven met een gemiddelde voltooiing van slechts 35% van de checkpoints.

Oorspronkelijke auteurs: Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

Gepubliceerd 2026-04-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Dromen Agents van Root-shells? Een Simpele Uitleg van de DiepRood-Studie

Stel je voor dat je een groep zeer slimme, maar nog jonge detectives (de AI-agenten) wilt testen. Je wilt weten of ze een ingewikkeld inbraakplan kunnen uitvoeren, niet om echt te stelen, maar om te zien hoe goed ze zijn in het oplossen van puzzels. Dit is precies wat de onderzoekers van de TU Delft hebben gedaan met hun nieuwe testomgeving, DeepRed.

Hier is de studie in gewone taal, met een paar handige vergelijkingen:

1. Het Probleem: De "Ja/Nee"-valstrik

Vroeger keken onderzoekers alleen naar het eindresultaat: Heeft de AI de flag (de prijs) gevonden?

  • Het probleem: Als een AI 99% van de weg heeft afgelegd, maar op de laatste drempel struikelt, telt het als een volledige mislukking. Dat is alsof je een student een cijfer geeft van 0 omdat hij de laatste vraag van een examen niet kon beantwoorden, terwijl hij de rest van het boek perfect had begrepen.
  • De oplossing: De onderzoekers hebben een nieuw systeem bedacht: Deelkrediet. Ze kijken niet alleen naar de finish, maar naar elke stap die de AI zet. Heeft hij de voordeur gevonden? Heeft hij het slot gekraakt? Heeft hij de sleutel gevonden? Elke stap telt mee.

2. De Testomgeving: DeepRed (De "Veilige Inbraak")

Om dit te testen, bouwden ze DeepRed.

  • De setting: Stel je een gesloten, digitaal huis voor (een virtuele machine) met twee kamers. In de ene kamer zit de "inbreker" (de AI op een Kali-computer) en in de andere de "slachtoffer" (het doelwit). Ze zijn verbonden via een privé-tunnel.
  • De regels: De AI mag alles doen wat een echte hacker zou doen: commando's typen, bestanden zoeken, netwerken scannen en zelfs het internet gebruiken om hints te zoeken. Maar het gebeurt in een veilige, afgesloten bubbel, zodat er geen echte schade ontstaat.
  • De "Spelregels": De AI moet een "root-shell" krijgen. In hacker-taal is dat de "meestersleutel" van het systeem. Zonder deze sleutel is de inbraak niet voltooid.

3. Hoe ze het meten: De "Gouden Ladder"

Omdat de AI's vaak vastlopen halverwege, hebben de onderzoekers voor elke puzzel een gouden ladder bedacht.

  • Ze kijken naar oude oplossingen van mensen (zogenoemde 'writeups') en halen daar de belangrijke momenten uit.
  • Bijvoorbeeld:
    1. De poort vinden (Stap 1).
    2. Een zwak punt in de software vinden (Stap 2).
    3. Een wachtwoord kraken (Stap 3).
    4. De hoofdsleutel bemachtigen (Stap 4).
  • Als de AI stap 1 en 2 haalt, krijgt hij 50% van het puntenaantal, zelfs als hij stap 4 niet haalt.

Om dit automatisch te doen, gebruiken ze een slimme "rechter-AI". Deze leest het verslag van wat de andere AI heeft gedaan en zegt: "Ja, die stap is gelukt" of "Nee, dat is niet gebeurd". Dit werkt net zo goed als een menselijke rechter, maar dan veel sneller.

4. Wat vonden ze? (De Resultaten)

De onderzoekers testten 10 verschillende AI-modellen op 10 verschillende puzzels. Het nieuws is gemengd:

  • Nog niet klaar voor de grote koek: De beste AI haalde gemiddeld maar 35% van de punten. Dat betekent dat zelfs de slimste modellen de meeste puzzels niet helemaal oplossen. Ze raken vaak vast of geven te snel op.
  • Goed in het bekende, slecht in het vreemde: De AI's zijn goed in standaard taken (zoals een webpagina hacken), maar raken in de war als ze iets onbekends moeten doen, zoals een verborgen bestand vinden in een rare map of een langdurig plan moeten maken.
  • Meer praten helpt niet altijd: Soms gebruikten de AI's heel veel "woorden" (rekenkracht) om een probleem op te lossen, maar dat maakte ze niet slimmer. Soms losten ze het op met weinig woorden, soms met veel. Het gaat om de kwaliteit van de gedachten, niet de hoeveelheid.

5. Waarom is dit belangrijk?

Je vraagt je misschien af: "Waarom testen we AI's om in te breken?"

  • Om te leren: Net zoals we auto's crashen in een simulator om ze veiliger te maken, testen we AI's in deze "inbraak-simulaties" om te zien waar ze zwak zijn.
  • Veiligheid: Als we weten dat AI's nu nog niet goed kunnen inbreken, kunnen we gerust zijn. Maar als ze dat in de toekomst wel kunnen, moeten we weten hoe we ze moeten stoppen.
  • Verbetering: Door te zien waar ze vastlopen (bijvoorbeeld: ze vergeten wat ze eerder deden, of ze geven te snel op), kunnen ontwikkelaars de AI's beter maken.

Conclusie

De titel van het artikel is een knipoog naar een beroemd gedicht: "Do Androids Dream of Electric Sheep?" (Dromen androids van elektrische schapen?).
De onderzoekers vragen zich af: "Dromen AI-agenten van root-shells?"

Het antwoord is: Nog niet echt. Ze dromen misschien, maar ze kunnen de droom nog niet waarmaken. Ze kunnen een stukje van de weg afleggen, maar de hele reis is voor hen nog te lang en te ingewikkeld. Met de nieuwe DeepRed-methode kunnen we nu precies zien hoe ver ze komen, in plaats van alleen te zeggen: "Het is mislukt." Dat helpt ons om ze in de toekomst echt slim te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →