SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment
SkillConsist ist ein neuartiges Framework, das Inkonsistenzen zwischen deklarierten und implementierten Agentenfertigkeiten durch die Konstruktion bidirektionaler Verhaltensgraphen sowie die Durchführung von Graph-Alignment und Differenzbildung erkennt und dabei eine State-of-the-Art-Leistung auf einem neu konstruierten Benchmark mit 633 Fertigkeiten erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich eine Welt vor, in der Ihr Computer nicht nur Befehlen folgt, sondern wie ein hilfreicher Assistent agiert, ein digitaler Butler, der im Internet surfen, Ihre Dateien verwalten oder sogar Ihren Urlaub buchen kann. Um dies zu tun, nutzt er „Agent Skills“ – vorgefertigte Werkzeuge oder Rezepte, die dem Computer genau sagen, wie er eine bestimmte Aufgabe auszuführen hat. Denken Sie bei diesen Fähigkeiten wie bei Anweisungen in einem Kochbuch: Die „Deklaration“ ist die köstliche Beschreibung auf der Speisekarte, die ein Gericht namens „Spicy Tacos“ verspricht, während die „Implementierung“ das eigentliche Kochen in der Küche ist.
Das Problem entsteht, wenn die Speisekarte lügt. Vielleicht fügt der Koch (der Code) versehentlich eine geheime Zutat hinzu, die die Tacos giftig macht, oder vielleicht hat er ganz vergessen, die Salsa hinzuzufügen, obwohl die Speisekarte dies versprochen hat. In der digitalen Welt sind diese Unstimmigkeiten gefährlich. Wenn ein Computer-Agent eine Fähigkeit wählt, die ein falsches Versprechen gibt, könnte er versehentlich Ihre Dateien löschen, Ihre privaten Daten preisgeben oder von einem Hacker überlistet werden. Wissenschaftler versuchen, einen „Feinschmecker“ zu bauen, der das Gericht probieren und mit der Speisekarte vergleichen kann, um diese Lügen zu entlarven, bevor der Agent sie serviert. Dies ist die Herausforderung, zu prüfen, ob das, was eine Fähigkeit sagt, mit dem übereinstimmt, was sie tatsächlich tut.
Hier kommt SkillConsist ins Spiel, ein neuer digitaler Detektiv, der genau dieses Rätsel lösen soll. Die Forscher hinter diesem Werkzeug erkannten, dass bisherige Methoden so waren, als versuche man, eine einseitige Speisekartenbeschreibung mit einem 50-seitigen Rezeptbuch zu vergleichen, ohne eine klare Möglichkeit zur Übereinstimmung zu haben. Die Speisekarte sagt vielleicht „Tacos machen“, während das Rezept den Prozess des Zerschneidens von Zwiebeln, Grillens von Fleisch, Erwärmens von Tortillas und Mischens von Salsa beinhaltet. Eine einfache Wort-für-Wort-Prüfung würde scheitern, da das Versprechen „Tacos machen“ eine große Idee ist, aber die Arbeit in der Küche eine Kette aus vielen kleinen Schritten darstellt.
SkillConsist geht dies an, indem es wie ein super organisierter Bibliothekar agiert, der zwei separate Karten erstellt: eine für die Versprechen der Speisekarte und eine für die Handlungen in der Küche. Zuerst nutzt es eine intelligente KI, um das chaotische Gemisch aus Text und Code zu sortieren und das „Was wir versprechen“ vom „Was wir tatsächlich tun“ zu trennen. Dann zeichnet es diese als Graphen – denken Sie an Flussdiagramme, bei denen jeder Schritt ein Knoten und jede Verbindung eine Linie ist.
Die Magie geschieht im nächsten Schritt: der bidirektionalen Graph-Ausrichtung (Bidirectional Graph Alignment). Stellen Sie sich vor, Sie versuchen, eine einzelne, große „Tacos machen“-Blase auf der Speisekarten-Karte mit einer ganzen Gruppe verbundener Blasen auf der Küchen-Karte abzugleichen. SkillConsist sucht nicht nur nach einem einzelnen Treffer; es expandiert nach außen und folgt den Linien in der Küchen-Karte, um zu sehen, ob eine ganze Gruppe von Schritten (Zerschneiden, Grillen, Mischen) zusammengefasst werden kann, um das einzelne Versprechen der Speisekarte perfekt zu erklären. Dies geschieht in beide Richtungen: Es wird geprüft, ob jeder Küchenschritt ein Speisenversprechen hat und ob jedes Speisenversprechen einen Küchenplan besitzt.
Sob nachdem die Karten abgeglichen wurden, sucht der Detektiv nach Inkonsistenzen. Er markiert drei Arten von Problemen:
- Konflikte: Die Speisekarte sagt „Scharf“, aber der Küchencode fügt „Süß“ hinzu.
- Nicht implementiert: Die Speisekarte verspricht „Salsa“, aber die Küche hat überhaupt keine Salsa-Zutaten.
- Nicht deklariert: Die Küche fügt heimlich „Gift“ zur Mischung hinzu, aber die Speisekarte hat dies nie erwähnt.
Die Forscher testeten SkillConsist an einem massiven Benchmark von 633 realen Agent-Skills, darunter einige, die als schwierig oder bösartig bekannt waren. Die Ergebnisse waren beeindruckend: Das Tool identifizierte inkonsistente Fähigkeiten in 87,93 % der Fälle (ein Wert, der als F1 bezeichnet wird), was ein riesiger Sprung von über 20 Prozentpunkten gegenüber den besten bisherigen Methoden war. Es gelang ihm zudem, in etwa 62 % der Fälle genau zu bestimmen, wo die Lüge im Code versteckt war.
Vielleicht am wichtigsten ist, dass die Arbeit zeigt, dass es hier nicht nur um Tippfehler geht; es geht um Sicherheit. Als die Forscher SkillConsist nutzten, um nach bösartigen Fähigkeiten zu suchen, half es dabei, mehr gefährliche Werkzeuge zu erfassen, ohne sie zuerst in einer riskanten Umgebung ausführen zu müssen. Indem es die Diskrepanz zwischen dem Versprechen und der Realität aufdeckt, gibt uns SkillConsist eine Möglichkeit, unseren digitalen Assistenten ein Stück weit mehr zu vertrauen und sicherzustellen, dass der Computer, wenn er sagt, dass er Tacos macht, nicht tatsächlich etwas Gefährliches serviert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.