← Neueste Arbeiten
💻 computer science

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

Dieser Beitrag stellt die Scheduling-Structural-Logical (SSL)-Repräsentation vor, ein neuartiges strukturiertes Framework für Agentenfähigkeiten, das Planung, Ausführung und logische Evidenz entkoppelt, um bei den Aufgaben der Fähigkeitsentdeckung und Risikobewertung Text-only-Baselines signifikant zu übertreffen.

Ursprüngliche Autoren: Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

Veröffentlicht 2026-04-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie besitzen eine riesige Bibliothek mit „Rezepten" für KI-Agenten. Dies sind keine bloßen Zutatenlisten; es handelt sich um komplexe, mehrstufige Anweisungen, die einer KI mitteilen, wie sie Werkzeuge nutzt, auf Dateien zugreift und Aufgaben ausführt. Derzeit sind diese Rezepte als lange, unübersichtliche Textabsätze verfasst (ähnlich einer SKILL.md-Datei).

Das Problem? Menschen können diese Absätze leicht lesen, aber Computer haben Schwierigkeiten, die spezifischen Schritte, die Reihenfolge der Operationen oder die im Text verborgenen potenziellen Gefahren zu verstehen. Es ist, als würde man versuchen, eine bestimmte Zutat in einem Roman zu finden; die Information ist zwar vorhanden, aber in der Geschichte begraben.

Diese Arbeit stellt eine neue Methode zur Organisation dieser Rezepte vor, die als SSL (Scheduling-Structural-Logical) bezeichnet wird. Stellen Sie sich SSL so vor, dass Sie diesen unordentlichen Roman nehmen und in einen klaren, dreiteiligen Flussdiagramm verwandeln, das ein Computer sofort scannen kann.

Hier ist, wie SSL eine Fähigkeit unter Verwendung einfacher Analogien aufschlüsselt:

1. Die Scheduling-Ebene: Die „Speisekarte"

Was es ist: Dies ist die Zusammenfassung auf oberster Ebene. Sie teilt Ihnen mit, was die Fähigkeit bewirkt, wann sie zu verwenden ist und was zum Starten benötigt wird.
Die Analogie: Stellen Sie sich vor, Sie betreten ein Restaurant. Sie müssen nicht die gesamte Biografie des Küchenchefs oder die Geschichte der Küche lesen, um zu wissen, ob Sie die „Scharfen Nudeln" wollen. Sie schauen sich einfach die Speisekarte an. Sie listet den Namen des Gerichts, den Preis (Eingaben) und das, was Sie im Gegenzug erhalten (Ausgaben), auf.
In der Arbeit: Diese Ebene extrahiert das „Ziel", die „Tags" und die „Eingaben/Ausgaben", damit die KI schnell entscheiden kann: „Ja, diese Fähigkeit passt zu meiner Anfrage", ohne das gesamte Dokument lesen zu müssen.

2. Die Strukturelle Ebene: Das „Drehbuch"

Was es ist: Dies zerlegt die Fähigkeit in große Szenen oder Phasen.
Die Analogie: Denken Sie an einen Film. Er passiert nicht einfach alles auf einmal; er hat eine Handlungsstruktur: Akt 1 (Vorbereitung), Akt 2 (Die Reise), Akt 3 (Der Höhepunkt) und Akt 4 (Auflösung).
In der Arbeit: Anstatt einer Textwand organisiert SSL die Fähigkeit in Szenen wie „Vorbereiten", „Ermitteln", „Handeln" und „Überprüfen". Dies hilft dem Computer, den Ablauf der Aufgabe zu verstehen. Er weiß, dass Sie „Vorbereiten" müssen, bevor Sie „Handeln" können.

3. Die Logische Ebene: Die „Aktionsliste"

Was es ist: Dies ist das Kleingedruckte dessen, was in jeder Szene tatsächlich passiert. Sie listet spezifische Aktionen auf und welche Ressourcen (wie Dateien oder Passwörter) sie berühren.
Die Analogie: Dies ist die Shot-Liste für eine bestimmte Szene im Film. Sie besagt: „Kamera 1: Datei lesen", „Kamera 2: API aufrufen", „Kamera 3: In die Datenbank schreiben". Sie vermerkt auch, ob die Kamera eine „Gefahrenzone" (wie eine Passwörter-Datei) berührt.
In der Arbeit: Diese Ebene identifiziert atomare Aktionen (wie „LESEN" oder „SCHREIBEN") und markiert genau, welche Ressourcen beteiligt sind. Dies ist entscheidend, um Risiken zu erkennen, wie zum Beispiel: „Oh, diese Fähigkeit steht kurz davor, eine Passwörter-Datei zu lesen und ins Internet zu senden."


Warum haben sie das getan? (Die Experimente)

Die Forscher haben dieses neue „Flussdiagramm"-System in zwei Hauptaspekten gegen das alte „unordentliche Text"-System getestet:

1. Das richtige Rezept finden (Fähigkeitsentdeckung)

  • Der Test: Sie fragten den Computer: „Ich brauche eine Fähigkeit, um mein Schreiben zu verbessern", und sahen, wie schnell er die richtige in einer Bibliothek von 6.000 Fähigkeiten finden konnte.
  • Das Ergebnis: Wenn der Computer das SSL-Flussdiagramm verwendete, fand er die richtige Fähigkeit viel schneller und genauer. Es war, als würde man von der Suche in einer Bibliothek durch das Lesen jedes Buches von vorne bis hinten zu einem perfekten, organisierten Kartenkatalog wechseln.
  • Der Gewinn: Die Erfolgsrate stieg signifikant (von 0,573 auf 0,707).

2. Gefährliche Rezepte aufspüren (Risikobewertung)

  • Der Test: Sie forderten den Computer auf, 500 Fähigkeiten zu prüfen und zu sagen: „Ist dies gefährlich? Stiehlt es Daten oder löscht es Dateien?"
  • Das Ergebnis: Wenn der Computer das SSL-Flussdiagramm neben dem Text hatte, war er viel besser darin, spezifische Gefahren wie „Datenexfiltration" (Stehlen von Daten) oder „Destruktives Verhalten" (Löschen von Dateien) zu erkennen. Die strukturierte Liste von Aktionen ließ die Risiken wie rote Flaggen auf einer Karte „herausspringen".
  • Der Gewinn: Die Genauigkeit beim Aufspüren von Risiken verbesserte sich (von 0,744 auf 0,787).

Das große Fazit

Die Arbeit argumentiert, dass SSL nicht dazu gedacht ist, den ursprünglichen Text zu ersetzen. Sie benötigen immer noch das ursprüngliche „Buch" (die SKILL.md-Datei) für die vollständige Geschichte, die Beispiele und den menschlichen Kontext.

Stattdessen ist SSL ein „Übersetzer", der dieses Buch in eine strukturierte, maschinenlesbare Karte verwandelt.

  • Es hilft Computern, das richtige Werkzeug schnell zu finden.
  • Es hilft Computern, die Risiken klar zu erkennen.
  • Es bewahrt den ursprünglichen Text als „Wahrheitsquelle" sicher auf, während es der Maschine eine saubere, organisierte Ansicht zum Arbeiten bietet.

Kurz gesagt: Die Arbeit zeigt, dass Sie, wenn Sie KI-Agenten sicherer und intelligenter machen wollen, ihnen nicht einfach mehr Text zuführen sollten; Sie sollten ihnen eine strukturierte Karte dessen geben, was dieser Text tatsächlich tut.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →