Cochise: A Reference Harness for Autonomous Penetration Testing
Dieser Artikel stellt Cochise vor, ein minimales 597 Zeilen langes Python-Referenz-Framework, das eine getrennte Planner-Executor-Architektur für autonome Penetrationstests implementiert und es Forschern ermöglicht, LLM-gesteuerte Agenten gegen den GOAD-Teststand (Game of Active Directory) zu evaluieren, während gleichzeitig Open-Source-Tools für Wiedergabe, Analyse und den Austausch von Trajektoriedaten bereitgestellt werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, wie er in eine digitale Festung (ein Computernetzwerk) eindringt, um dessen Schwachstellen zu finden. Dies wird als „Penetrationstest" bezeichnet. Vor kurzem begannen Forscher, superintelligente KI-Gehirne (Large Language Models) einzusetzen, um diese Aufgabe automatisch zu erledigen.
Es gab jedoch ein Problem: Jedes Mal, wenn ein neues Team einen KI-Hacker entwickelte, baute es seine eigene, einzigartige Werkstatt, seine eigenen Werkzeuge und sein eigenes Regelwerk. Es war wie der Vergleich eines Autos, das in einer Garage gebaut wurde, mit einem Raumschiff, das in einer Fabrik entstand; man konnte nicht feststellen, ob das Raumschiff schneller war, weil es einen besseren Motor hatte, oder einfach nur, weil es bessere Räder hatte.
Hier kommt „Cochise" ins Spiel.
Denken Sie an Cochise nicht als Super-Agenten, sondern als einen standardisierten, transparenten Trainingsraum für KI-Hacker. Es ist eine kleine, einfache „Hilfskonstruktion" (ein Satz von Werkzeugen und Regeln), die es Forschern ermöglicht, verschiedene KI-Gehirne unter exakt gleichen Bedingungen zu testen.
So funktioniert es, unter Verwendung einiger alltäglicher Analogien:
1. Das Setup: Der „Jump Host"
Stellen Sie sich vor, die KI muss in eine Burg (das Zielnetzwerk) eindringen, aber es ist zu gefährlich, die KI direkt am Burgtor stehen zu lassen.
- Die Lösung: Cochise richtet eine sichere „Absprungplattform" (einen separaten Computer) außerhalb der Burg ein.
- Die Analogie: Die KI sitzt in einem Kontrollraum und nutzt ein langes, sicheres Walkie-Talkie (SSH), um einem Roboter auf der Absprungplattform zu sagen, was zu tun ist. Der Roboter betritt dann die Burg.
- Warum? Wenn die KI einen Fehler macht und versehentlich die Burg in die Luft jagt, werden nur die Anweisungen des Roboters zerstört, nicht das Gehirn der KI selbst oder der Kontrollraum. Dies hält das Experiment sicher und eingedämmt.
2. Das Team: Der „Planer" und der „Ausführende"
Cochise spaltet das Gehirn der KI in zwei unterschiedliche Rollen auf, um die Dinge organisiert zu halten:
- Der Planer (Der General): Dieser Teil der KI sitzt zurück und betrachtet das große Ganze. Er führt eine langfristige To-Do-Liste (wie eine Karte der Burg) und entscheidet, was als Nächstes zu tun ist. Er erinnert sich an die gesamte Mission.
- Der Ausführende (Der Soldat): Dieser Teil ist kurzfristig und fokussiert. Er erhält einen spezifischen Befehl vom General (z. B. „Versuche, diese Tür zu öffnen"), führt die Befehle aus, sieht, was passiert, und vergisst alles, sobald die Arbeit erledigt ist.
- Die Analogie: Denken Sie an einen Filmregisseur (Planer) und einen Stuntman (Ausführender). Der Regisseur plant die Szene. Der Stuntman führt den gefährlichen Sprung aus, erhält das Ergebnis, und dann wischt der Regisseur die Tafel für die nächste Szene sauber. Dies verhindert, dass die KI durch Stunden alter Erinnerungen verwirrt wird.
3. Der „Black Box"-Schreiber
Alles, was die KI tut, wird in einem perfekten, detaillierten Tagebuch (JSON-Protokolle) festgehalten.
- Die Analogie: Es ist wie ein Flugdatenschreiber in einem Flugzeug. Er zeichnet jeden gedrückten Knopf, jeden Gedanken der KI, den verbrauchten „Treibstoff" (Geld/Token) und den Erfolg oder Misserfolg auf.
- Warum ist das cool? Normalerweise benötigen Sie, um diese KI-Hacker zu studieren, ein riesiges, teures Computerlabor (den „GOAD"-Teststand), das ein Vermögen kostet, um betrieben zu werden. Cochise bietet Forschern ein kostenloses Wiedergabeset. Sie benötigen nicht das teure Labor; Sie können einfach die Daten des „Flugdatenschreibers" ansehen, um genau zu sehen, wie sich die KI verhalten hat, wie viel es gekostet hat und wo sie gescheitert ist.
4. Warum es wichtig ist (Die „Referenz-Hilfskonstruktion")
Die Autoren sind sehr klar: Cochise ist nicht der beste Hacker der Welt. Es versucht nicht, der ultimative Spion zu sein.
- Die Analogie: Denken Sie daran wie an ein standardisiertes Lineal. Sie verwenden ein Lineal nicht, um ein Haus zu bauen; Sie verwenden es, um zu messen, wie gut andere Werkzeuge Häuser bauen.
- Da Cochise winzig ist (nur 597 Zeilen Code, verglichen mit Tausenden in anderen Projekten), ist es für andere Forscher leicht zu lesen, zu verstehen und zu ändern. Dies ermöglicht ihnen, verschiedene KI-Modelle fair zu vergleichen, um zu sehen, welches tatsächlich intelligenter ist, anstatt nur zu sehen, welches ein ausgefalleneres Setup hatte.
Zusammenfassung
Cochise ist ein einfaches, quelloffenes Werkzeugset, das es Forschern ermöglicht, KI-Hacker fair zu testen. Es trennt das „Denken" vom „Tun", hält die Experimente sicher und zeichnet jedes Detail auf, damit jeder die Ergebnisse studieren kann, ohne einen Supercomputer zu benötigen. Es verwandelt die chaotische Welt der KI-Sicherheitsforschung in eine faire, messbare Wissenschaft.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.