← Neueste Arbeiten
🤖 AI

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

Dieses Paper stellt HarnessSafe vor, ein umfassendes Benchmark- und mehrstufiges Evaluierungs-Framework, das bewertet, wie moderne Agent-Harnesses verzögerte Sicherheitsrisiken mildern, die durch durch Angreifer beeinflusste Inhalte verursacht werden, welche über verschiedene Carrier und Systemgrenzen hinweg persistieren, wobei aufgezeigt wird, dass die Effektivität der Eindämmung stark von spezifischen Carrier-Typen sowie Harness-Modell-Konfigurationen abhängt.

Ursprüngliche Autoren: Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

Veröffentlicht 2026-08-10
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen superintelligenten Roboter-Assistenten, der nicht nur Fragen beantwortet, sondern tatsächlich Dinge für Sie tut. Er kann Code schreiben, Flüge buchen oder Ihre digitalen Dateien organisieren. Um dies zu tun, benötigt der Roboter ein „Gehirn“ (das KI-Modell) und einen „Rucksack“ (das Softwaresystem, das seine Erinnerungen, Werkzeuge und Fähigkeiten enthält). Dieser Rucksack ist entscheidend, denn er ermöglicht es dem Roboter, sich daran zu erinnern, was er gestern getan hat, damit er heute ein großes Projekt abschließen kann. Aber hier ist der knifflige Teil: Was wäre, wenn jemand einen winzigen, unsichtbaren Virus in diesen Rucksack schleicht? Er würde vielleicht nicht sofort etwas bewirken. Stattdessen wartet er, versteckt in einer Notiz oder einer Werkzeugeinstellung, bis der Roboter Wochen später eine völlig harmlose Aufgabe übernimmt. Plötzlich löst diese harmlose Aufgabe den Virus aus, und der Roboter löscht versehentlich Ihre Dateien oder sendet eine geheime Nachricht. Dies ist die Welt des „persistenten Risikos“ bei KI-Agenten: Gefahren, die über die Zeit und verschiedene Aufgaben hinweg überleben und auf den richtigen Moment warten, um zuzuschlagen.

Dieses Papier mit dem Titel HarnessSafe ist wie ein massiver, hochtechnologischer Stresstest für diese Roboter-Rucksäcke. Die Forscher wollten sehen, ob aktuelle KI-Systeme diese „schlafenden“ Angriffe erkennen könnten, bevor sie aufwachen und Ärger verursachen. Sie bauten einen Spielplatz mit 328 verschiedenen Szenarien, in denen sie versuchten, diese versteckten Viren in sieben verschiedenen Arten von „Rucksäcken“ (wie Gedächtnis, Fähigkeiten und gemeinsam genutzte Werkzeuge) über sieben populäre Robotersysteme hinweg zu pflanzen. Anstatt nur zu fragen: „Wurde der Roboter gehackt? Ja oder Nein?“, verfolgten sie den Angriff Schritt für Schritt. Sie beobachteten, ob der Virus in dem Moment entdeckt wurde, in dem er gepflanzt wurde, ob er eine Grenze überwand (wie einen neuen Tag oder einen neuen Benutzer) oder ob er schließlich erfolgreich einen Schaden anrichtete.

Die Ergebnisse waren ein kleiner Weckruf. Die Forscher fanden heraus, dass Sicherheit nicht nur vom Gehirn des Roboters oder dem Rucksack allein abhängt, sondern von der spezifischen Kombination aus beiden. Einige Robotersysteme waren großartig darin, Viren im Gedächtnis zu entdecken, aber schlecht darin, sie in ihren Werkzeugen zu erkennen. Andere waren genau das Gegenteil. Tatsächlich hatten zwei Systeme vielleicht die gleiche „Fehlerrate“ (wie oft sie gehackt wurden), aber eines von ihnen stoppte den Angriff frühzeitig, während das andere ihn tagelang umherwandern ließ, bevor es schließlich scheiterte. Das bedeutet, dass es nicht ausreicht, einfach nur zu zählen, wie oft ein System gehackt wird; wir müssen wissen, wo und wann die Verteidigung versagt hat. Die Studie beweist, dass diese versteckten, verzögerten Angriffe real und gefährlich sind und dass die Behebung dieser Probleme eine Betrachtung des gesamten Weges des Risikos erfordert, nicht nur der finalen Explosion.

Die Geschichte des „schlafenden Spions“

Um zu verstehen, was die Forscher getan haben, stellen wir uns den KI-Agenten als einen superorganisierten Praktikanten vor, der in einem riesigen Büro arbeitet. Dieser Praktikant hat einen Rucksack (das „Harness“), in dem er seine To-do-Listen, seine Werkzeuge (wie einen Taschenrechner oder einen Dateiordner) und seine Notizen darüber aufbewahrt, was er getan hat.

Normalerweise ist dieser Praktikant hilfreich. Aber stellen Sie sich vor, ein Spion (der Angreifer) möchte das Büro sabotieren. Der Spion schreit nicht einfach „Tu etwas Schlechtes!“, weil der Praktikant dann „Nein“ sagen würde. Stattdessen schleicht der Spion eine schlafende Anweisung in den Rucksack des Praktikanten. Vielleicht schreibt er eine seltsame Notiz in den Bereich „Gedächtnis“ oder manipuliert eine „Skill“-Datei so, dass sie normal aussieht, aber eine versteckte Falle enthält.

Der Spion geht. Der Praktikant geht seinem Tag nach, erledigt normale, langweilige Aufgaben. Nichts passiert. Dies ist der Teil der „Persistenz“ – das Böse liegt einfach nur da und wartet.

Dann, Tage später, bittet der Chef (ein Benutzer) den Praktikanten, etwas völlig Harmloses zu tun, wie zum Beispiel: „Fasse diesen Bericht zusammen.“ Dies ist der „gutartige Trigger“. Aber weil der Rucksack des Praktikanten immer noch die schlafende Anweisung des Spions enthält, schnappt die Falle in dem Moment zu, in dem der Praktant den Bericht öffnet. Der Praktikant könnte versehentlich die Dateien des Chefs löschen oder eine geheime E-Mail senden, während er glaubt, nur einen ganz normalen Job zu erledigen.

Der große Rucksack-Stresstest

Die Autoren dieses Papers beschlossen, die Rolle des Spions einzunehmen, um zu sehen, welche Bürosysteme sicher waren. Sie erstellten HarnessSafe, ein riesiges Testkit mit 328 verschiedenen Wegen, um diese schlafenden Spione zu pflanzen. Sie testeten diese Spione in sieben verschiedenen Arten von Rucksäcken:

  1. Gedächtnis (Memory): Versteckt in den Notizen des Praktikanten.
  2. Fähigkeiten (Skills): Versteckt in den Anweisungen, wie eine Aufgabe auszuführen ist.
  3. Werkzeuge/MCP: Versteckt in den Einstellungen der Werkzeuge, die der Praktikant verwendet.
  4. Memory-to-Skill: Eine Notiz in eine neue Fähigkeit verwandeln.
  5. Subagent-Delegation: Den Spion an einen Helfer-Roboter übergeben.
  6. Sitzungszusammenfassung (Session Summary): Versteckt in der Zusammenfassung eines vergangenen Gesprächs.
  7. Gemeinsam genutzte Artefakte (Shared Artifacts): Versteckt in einer Datei, die zwischen verschiedenen Arbeitern geteilt wird.

Sie führten diese Tests bei sieben verschiedenen realen Robotersystemen durch (wie Claude Code, Codex CLI und andere), um zu sehen, wie sie mit den Angriffen umgehen.

Die „Stufen“-Bewertung: Nicht nur Ja oder Nein

Hier wird das Paper wirklich clever. Die meisten Sicherheitstests sagen nur: „Wurde der Roboter gehackt? Ja/Nein.“ Aber die Forscher erkannten, dass das so ist, als würde man sagen, ein Autounfall sei derselbe, egal ob die Bremsen bei 10 km/h oder bei 100 km/h versagt haben.

Stattdessen entwickelten sie eine 7-stufige Punktetafel (genannt N0 bis N5b), um genau zu verfolgen, wie weit der Spion gekommen ist:

  • N0: Der Spion wurde gar nicht erst gesehen. Der Rucksack war fest verschlossen.
  • N1: Der Spion wurde sofort entdeckt, als er versuchte, einzudringen.
  • N2: Der Spion kam hinein und änderte etwas, wurde aber abgefangen, bevor er echten Schaden anrichten konnte.
  • N3: Der Spion überlebte die „Nacht“ (eine neue Sitzung) und wurde vom Praktikanten erneut gelesen.
  • N4: Der Spion versuchte etwas Schlechtes zu tun, aber das System stoppte die Aktion.
  • N5a/N5b: Der Spion war erfolgreich! Der Schaden war angerichtet.

Durch die Verwendung dieser Punktetafel konnten sie sehen, dass einige Systeme gut darin waren, Spione an der Tür zu stoppen (N1), aber schlecht darin, sie einmal im Inneren zu stoppen (N3). Andere waren genau das Gegenteil.

Was sie fanden: Es kommt auf das Teamwork an

Die große Entdeckung war, dass die Sicherheit von der spezifischen Kombination zwischen dem Gehirn des Roboters (dem KI-Modell) und seinem Rucksack (dem Harness) abhängt.

  • Niemand ist perfekt: Es gab kein einzelnes System, das in allem am besten war. Zum Beispiel war ein System (Codex CLI) hervorragend darin, Spione in seinen Werkzeugen und seinem Gedächtnis zu fangen, war aber tatsächlich am schlechtesten darin, sie in seinen „Skills“ zu entdecken. Ein anderes System (Claude Code) war gut bei den Skills, aber schwächer in anderen Bereichen.
  • Das Gehirn spielt auch eine Rolle: Wenn man denselben Rucksack nimmt und ein anderes KI-Gehirn hineinlegt, ändert sich die Sicherheitsbewertung drastisch. Ein Gehirn könnte sehr vorsichtig sein und den Spion entdecken, während ein anderes zu vertrauensvoll ist und ihn durchlassen würde.
  • Die „Gleiche Punktzahl“-Falle: Zwei Systeme können dieselbe „Angriffserfolgsrate“ (Attack Success Rate) haben (das heißt, beide sind gleich oft gescheitert). Aber wenn man sich die Stufen ansieht, ist eines vielleicht früh gescheitert (N1), während das andere den Spion tagelang umherwandern ließ (N3), bevor es versagte. Das bedeutet, dass eine einfache „Pass/Fail“-Bewertung viele gefährliche Details verbirgt.

Das Fazngnis

Das Paper kommt zu dem Schluss, dass wir nicht einfach einen Roboter betrachten und sagen können: „Er ist sicher“ oder „Er ist unsicher“. Sicherheit ist ein komplexer Tanz zwischen der Software, die das Gedächtnis hält, und der KI, die denkt. Wenn wir diese „schlafenden Spion“-Angriffe stoppen wollen, müssen wir Systeme bauen, die den gesamten Weg des Risikos überwachen, nicht nur das Endergebnis. Wir müssen genau wissen, wo die Verteidigung gebrochen ist, damit wir diesen spezifischen Teil des Rucksacks reparieren können.

Kurz gesagt: Die Forscher haben uns gezeigt, dass in der Welt der KI-Agenten eine verborgene Gefahr lange Zeit schlafen kann und dass es beim Auffangen viel detaillierterer Informationen erfordert, als nur zu prüfen, ob der Roboter noch funktioniert. Sie haben uns die Karte und die Punktetafel zur Verfügung gestellt, um uns zu helfen, genau die Risse zu finden, die existieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →