Autonomous LLM Agents & CTFs: A Second Look
Dit artikel herbeoordeelt de capaciteiten van Large Language Model-agenten in offensieve beveiliging door aan te tonen dat, hoewel algemeen toepasbare agenten zoals Claude Code op CTF-uitdagingen presteren op hetzelfde niveau als complexe, technisch ontworpen architecturen, beide nog steeds aanzienlijke barrières op menselijk niveau ondervinden, waarbij gestructureerde, multi-rollen-orkestratie zich als superieur heeft bewezen aan monolithische ontwerpen qua consistentie en kostenefficiëntie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van digitale detectives hebt die proberen een reeks vergrendelde digitale kluizen (zogenaamde "CTF-uitdagingen") te kraken om een verborgen schat (de "flag") te vinden. Soms wordt beweerd dat kunstmatige intelligentie (KI)-agenten zo slim worden dat ze dit bijna net zo goed kunnen als menselijke experts.
Dit artikel is als een "realiteitscheck"-rapport. De auteurs besloten deze beweringen zelf te testen om te zien of de KI echt klaar is voor de grote markt of dat het gewoon geluk heeft.
Hier is de uiteenzetting van hun experiment en bevindingen, met behulp van alledaagse analogieën:
1. Het Experiment: Het Opbouwen van Verschillende Detectiveteams
De onderzoekers gebruikten niet zomaar één type KI. Ze bouwden drie verschillende "teamstructuren" om te zien welke het beste werkte, en ze testten ook een beroemde, kant-en-klare KI-detective genaamd Claude Code.
- De Solo-detective (Executor): Stel je één persoon voor die alles probeert te doen: naar het slot kijken, het plan bedenken, het slot openen en controleren of ze de schat hebben. Het artikel vond dat deze persoon overweldigd raakt en fouten maakt.
- De Detective met een Criticus (Executor + Evaluator): Hier probeert de detective het werk te doen, maar staat een tweede persoon (de Criticus) over zijn of haar schouder. Voordat de detective het slot opent, zegt de Criticus: "Wacht, dat is een slecht idee, probeer het opnieuw." Dit helpt, maar de Criticus ziet soms niet het hele plaatje en mikt alleen op kleine details.
- De Detective met een Strategist en een Criticus (Planner + Executor + Evaluator): Dit is het meest complexe team.
- De Strategist (Planner): Kijkt eerst naar de kluis en schrijft een stap-voor-stap kaart.
- De Detective (Executor): Volgt de kaart.
- De Criticus (Evaluator): Controleert het werk tegen de kaart.
- Resultaat: Dit team was het meest efficiënt. Ze verspillen de minste tijd en geld omdat ze niet doelloos rondzwerven.
Ze testten ook Claude Code, wat als een "slimme generalist" werkt. Het heeft geen vaste teamstructuur; het beslist zelf of het helpers huurt of alleen werkt.
2. De Resultaten: Het "19 van de 30" Plafond
Het grote nieuws is dat het AI-teams hoe ze ook georganiseerd waren, een hard plafond bereikten.
- De Score: Het beste door mensen ontworpen team en de slimme "generalist"-KI (Claude Code) losten allebei precies 19 van de 30 uitdagingen op.
- De Vergelijking: Dit is lager dan wat eerdere studies beweerden. De auteurs suggereren dat die eerdere studies misschien te optimistisch waren of eenvoudigere tests gebruikten.
- De Efficiëntiewinst: Hoewel de score hetzelfde was, was het "Strategist + Detective + Criticus"-team veel beter in hoe ze werkten. Ze deden minder stappen en kostten minder om te draaien dan de solo-detective. Het is alsof twee hardlopers een race in dezelfde tijd finishen, maar de één rende in een rechte lijn terwijl de ander in cirkels rende.
3. Waar de KI Stuck Raakt (Het "Waarom")
De onderzoekers diep om te zien waarom de KI faalde bij de andere 11 uitdagingen. Ze ontdekten dat de KI om twee heel verschillende redenen faalt:
A. Het "Ontbrekende Gereedschap"-Probleem (Technische Grenzen)
Soms weet de KI precies wat te doen, maar heeft het niet de juiste apparatuur.
- Analogie: Stel je voor dat de KI weet hoe je een slot openmaakt, maar het probeert dit te doen terwijl het dikke ovenwanten draagt.
- Voorbeelden: Sommige uitdagingen vereisten dat de KI een webpagina in een browser zag (om een verborgen code te zien), maar de KI werkte in een tekst-only omgeving. Anderen vereisten dat twee dingen tegelijk werden gedaan (zoals een race-condition), maar de KI werkt strikt één stap per keer.
B. Het "Hersenmist"-Probleem (Cognitieve Grenzen)
Soms heeft de KI alle gereedschappen, maar "begrijpt" het gewoon de logica niet.
- Analogie: Stel je een detective voor die geweldig is in het vinden van gebroken ramen (technische hacks), maar die volledig mist dat de eigenaar de achterdeur open liet omdat hij boos was op de bezorger (zakelijke logica).
- Voorbeelden:
- Zakelijke Logica Fouten: De KI kon het verhaal van hoe de website zou moeten werken niet begrijpen, dus kon het het niet bedriegen.
- Lange Ketens: Als een taak 20 stappen vereiste waarbij stap 20 afhankelijk was van stap 1, raakte de KI in de war en vergat het het begin van het verhaal tegen de tijd dat het het einde bereikte.
- Blind Gissen: Bij sommige complexe puzzels bleef de KI gewoon willekeurige dingen proberen totdat de tijd op was, in plaats van het erover na te denken.
4. De Conclusie
Het artikel concludeert dat KI-agenten hoewel ze beter worden, nog niet echt "menselijk niveau" hebben bereikt.
- Het Goede Nieuws: Als je een KI een duidelijk plan en een teamstructuur geeft (Strategist + Detective + Criticus), werkt het zeer efficiënt en consistent.
- Het Slechte Nieuws: Er is een "glazen plafond". Of je nu een aangepast team gebruikt of een algemeen doelgerichte KI, ze stoppen allemaal op hetzelfde punt (19/30).
- De Echte Bottleneck: Het hoofdprobleem is niet hoe de KI een plan uitvoert; het is dat de KI vaak niet herkent welk type probleem het eerst is. Zodra de KI de kwetsbaarheid correct identificeert, is het meestal goed in het oplossen ervan. Maar als het niet kan uitzoeken wat het probleem is, kan het niet beginnen.
Kortom: De KI is een zeer efficiënte werknemer, maar het heeft nog steeds een mens nodig om te vertellen wat de baan eigenlijk is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.