← Nieuwste papers
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

Dit artikel introduceert Cochise, een minimale Python-referentieomgeving van 597 regels die een gescheiden Planner-Executor-architectuur implementeert voor autonome penetratietests, waardoor onderzoekers LLM-gestuurde agenten kunnen evalueren tegen de Game of Active Directory (GOAD)-testomgeving, terwijl tegelijkertijd open-source hulpmiddelen worden geboden voor replay, analyse en het delen van trajectgegevens.

Oorspronkelijke auteurs: Andreas Happe, Jürgen Cito

Gepubliceerd 2026-05-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Andreas Happe, Jürgen Cito

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren hoe hij een digitale burcht (een computernetwerk) moet inbreken om zijn zwakke plekken te vinden. Dit heet "penetration testing" (inbraaktesten). Onlangs zijn onderzoekers begonnen om super-slimme AI-hersenen (Large Language Models) in te zetten om deze taak automatisch uit te voeren.

Er was echter een probleem: elke keer als een nieuw team een AI-hacker bouwde, creëerden ze hun eigen unieke werkplaats, gereedschappen en regelboek. Het was als het vergelijken van een auto die in een garage is gebouwd met een ruimteschip dat in een fabriek is gebouwd; je kon niet zeggen of het ruimteschip sneller was vanwege zijn motor of gewoon omdat het betere wielen had.

Hier komt "Cochise" in beeld.

Denk aan Cochise niet als een superspion, maar als een gestandaardiseerde, transparante trainingsgym voor AI-hackers. Het is een klein, simpel "harnas" (een set gereedschappen en regels) dat onderzoekers in staat stelt om verschillende AI-hersenen onder exact dezelfde omstandigheden te testen.

Zo werkt het, met behulp van alledaagse analogieën:

1. De Opstelling: De "Jump Host"

Stel je voor dat de AI een burcht moet inbreken (het doelwitnetwerk), maar het is te gevaarlijk om de AI direct bij de burchtspoort te laten staan.

  • De Oplossing: Cochise zet een veilig "startplatform" (een aparte computer) buiten de burcht op.
  • De Analogie: De AI zit in een controlekamer en gebruikt een lange, beveiligde walkie-talkie (SSH) om een robot op het startplatform te vertellen wat hij moet doen. De robot loopt vervolgens de burcht binnen.
  • Waarom? Als de AI een fout maakt en per ongeluk de burcht opblaast, worden alleen de instructies van de robot vernietigd, niet de eigen hersenen van de AI of de controlekamer. Het houdt het experiment veilig en gecontroleerd.

2. Het Team: De "Planner" en de "Uitvoerder"

Cochise splitst het brein van de AI in twee verschillende rollen om de zaken georganiseerd te houden:

  • De Planner (De Generaal): Dit deel van de AI zit achterover en kijkt naar het grote geheel. Het houdt een lange-termijn takenlijst bij (zoals een kaart van de burcht) en beslist wat er als volgende moet gebeuren. Het onthoudt de hele missie.
  • De Uitvoerder (De Soldaat): Dit deel is kortetermijn en gefocust. Het krijgt een specifieke opdracht van de Generaal (bijvoorbeeld: "Probeer deze deur te openen"), voert de commando's uit, ziet wat er gebeurt, en vergeet vervolgens alles zodra het werk klaar is.
  • De Analogie: Denk aan een filmregisseur (Planner) en een stuntman (Uitvoerder). De regisseur plant de scène. De stuntman voert de gevaarlijke sprong uit, krijgt het resultaat en vervolgens veegt de regisseur het bord schoon voor de volgende scène. Dit voorkomt dat de AI in de war raakt door uren aan oude herinneringen.

3. De "Black Box" Recorder

Elke enkele actie die de AI doet, wordt opgeschreven in een perfect, gedetailleerd dagboek (JSON-logbestanden).

  • De Analogie: Het is als een vluchtrecorder in een vliegtuig. Het registreert elke knop die wordt ingedrukt, elke gedachte die de AI had, hoeveel "brandstof" (geld/tokens) het gebruikte en of het slaagde.
  • Waarom is dit cool? Meestal heb je, om deze AI-hackers te bestuderen, een enorme, dure computerlab nodig (de "GOAD" testomgeving) die fortuinen kost om te runnen. Cochise biedt onderzoekers een gratis herhaalset. Je hebt de dure lab niet nodig; je kunt gewoon de data van de "vluchtrecorder" bekijken om precies te zien hoe de AI zich gedroeg, hoeveel het kostte en waar het faalde.

4. Waarom Dit Belangrijk Is (De "Referentie Harnas")

De auteurs zijn heel duidelijk: Cochise is niet de beste hacker ter wereld. Het probeert niet de ultieme spion te zijn.

  • De Analogie: Denk eraan als een gestandaardiseerde liniaal. Je gebruikt een liniaal niet om een huis te bouwen; je gebruikt hem om te meten hoe goed andere tools huizen bouwen.
  • Omdat Cochise klein is (slechts 597 regels code, in vergelijking met duizenden in andere projecten), is het voor andere onderzoekers makkelijk om te lezen, te begrijpen en aan te passen. Dit stelt hen in staat om eerlijk verschillende AI-modellen te vergelijken om te zien welke eigenlijk slimmer is, in plaats van alleen te kijken welke een chiquer opzet had.

Samenvatting

Cochise is een eenvoudige, open-source toolkit die onderzoekers in staat stelt om AI-hackers eerlijk te testen. Het scheidt het "denken" van het "doen", houdt de experimenten veilig en registreert elk detail zodat iedereen de resultaten kan bestuderen zonder een supercomputer nodig te hebben. Het verandert de chaotische wereld van AI-beveiligingsonderzoek in een eerlijke, meetbare wetenschap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →