Toward Scalable Terminal Task Synthesis via Skill Graphs
Dieser Beitrag stellt SkillSynth vor, ein automatisiertes Framework, das einen szenarienvermittelten Fähigkeitsgraphen nutzt, um diverse und kontrollierbare Instanzen von Endaufgaben zu synthetisieren, wodurch die Datenknappheit adressiert und das Training autonomer Endagenten verbessert wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie möchten einem Roboter beibringen, die Befehlszeile eines Computers (den textbasierten Bildschirm, auf dem Sie Befehle eingeben) für komplexe Aufgaben zu nutzen, wie etwa das Organisieren von Dateien oder das Beheben von Softwarefehlern. Das Problem besteht darin, dass das Unterrichten eines Roboters erfordert, ihm Tausende von Beispielen zu zeigen, wie diese Aufgaben erledigt werden. Doch Tausende von guten, unterschiedlichen Beispielen von Hand zu finden oder zu schreiben, ist unglaublich langsam und teuer.
Die Autoren dieses Papiers, das Hunyuan-Team bei Tencent, haben ein System namens SkillSynth entwickelt, um dieses Problem zu lösen. Betrachten Sie SkillSynth als einen super-effizienten „Rezept-Generator" für das Training von Robotern.
So funktioniert es, aufgeschlüsselt in einfache Schritte:
1. Das Problem: Zu viele ähnliche Rezepte
Frühere Methoden versuchten, Trainingsbeispiele zu erstellen, indem sie entweder:
- Raten: Eine intelligente KI aufforderten, neue Aufgaben zu erfinden (die oft künstlich wirkten oder nicht mit der Realität übereinstimmten).
- Stehlen: Echten Code aus dem Internet entnahmen und ihn absichtlich beschädigten, um eine „Repariere-es"-Aufgabe zu erstellen (was dem Roboter nur beibrachte, wie man Software repariert, nicht aber, wie man andere Dinge erledigt).
Beide Methoden führten zu Robotern, die immer wieder dieselben Arten von Problemen sahen. Es ist, als würde man einem Koch beibringen, zu kochen, indem man ihm nur Rezepte für Spaghetti gibt. Er mag dann gut darin werden, Spaghetti zu kochen, aber er wird nicht wissen, wie man einen Salat zubereitet oder einen Kuchen backt.
2. Die Lösung: Der „Skill Graph" (Die Karte)
Anstatt nur zu raten, baut SkillSynth eine riesige Karte (einen sogenannten Skill Graph) auf.
- Die Orte (Szenarien): Stellen Sie sich verschiedene Zustände vor, in denen sich ein Computer befinden kann, wie etwa „ein Ordner ist leer" oder „eine Videodatei ist bereit". Dies sind die „Orte" auf der Karte.
- Die Straßen (Fertigkeiten): Dies sind die Aktionen, die ein Roboter ausführen kann, um von einem Ort zum nächsten zu gelangen, wie etwa „eine Datei löschen" oder „ein Video konvertieren".
Das Team sammelte Tausende dieser „Straßen" aus realen Quellen (wie GitHub und einer Datenbank namens ClawHub). Anschließend verbanden sie die Straßen so, dass man, wenn man eine Aktion abgeschlossen hat, an einem Ort landet, an dem die nächste Aktion sinnvoll ist.
3. Der Prozess: Einen Pfad zeichnen
Sobald die Karte erstellt ist, wählt SkillSynth nicht einfach nur eine Straße aus. Es zeichnet einen Pfad über die Karte.
- Es wählt einen Startpunkt.
- Es wählt eine Straße (Fertigkeit), die es nehmen soll.
- Es landet an einem neuen Ort, wählt eine weitere Straße und fährt fort.
Die Analogie: Stellen Sie sich vor, Sie planen eine Roadtrip. Anstatt nur von Zuhause zum Lebensmittelgeschäft zu fahren (eine Fertigkeit), planen Sie eine Reise, die so aussieht: Zuhause → Tankstelle → Panoramastraße → Bäckerei → Lebensmittelgeschäft. Dieser Pfad repräsentiert eine komplexe, mehrstufige Aufgabe.
Das System ist dabei intelligent: Es versucht, dieselben beliebten Straßen zu vermeiden, die es bereits zuvor genutzt hat. Dies stellt sicher, dass der Roboter neue und andere Pfade sieht, was das Training viel reichhaltiger macht.
4. Das Fließband: Der Multi-Agenten-Harness
Sobald ein Pfad auf der Karte gezeichnet ist, muss das System diesen abstrakten Pfad in ein reales, spielbares Spiel für den Roboter verwandeln. Dafür nutzen sie ein Team von KI-Agenten (ein „Harness"):
- Der Planer: Betrachtet den Pfad und schreibt eine klare Reihe von Anweisungen (z. B. „Verwandle dieses rohe Video in ein GIF").
- Der Konstrukteur: Baut die tatsächliche Umgebung (die Dateien, die Ordner, den Ausgangszustand), damit der Roboter etwas hat, woran er arbeiten kann.
- Die Schiedsrichter: Zwei verschiedene Prüfungen finden statt:
- Der Oracle-Check: Existiert tatsächlich eine perfekte Lösung? (Kann die Aufgabe überhaupt gelöst werden?)
- Der Rubrik-Check: Sind die Anweisungen klar? Ist der Test fair? (Haben wir die Anweisungen versehentlich zu schwierig oder zu einfach gemacht?)
Wenn die Aufgabe diese Prüfungen nicht besteht, korrigiert das System sie automatisch und versucht es erneut, genau wie eine Qualitätskontrolllinie in einer Fabrik.
5. Die Ergebnisse
Das Team führte dieses System aus und erstellte in einem einzigen automatisierten Durchlauf 3.560 verifizierte, hochwertige Aufgaben.
- Vielfalt: Die Aufgaben deckten eine enorme Vielzahl an Szenarien und Fertigkeiten ab, weit mehr als frühere Methoden.
- Schwierigkeit: Die Aufgaben waren tatsächlich schwer. Selbst eine sehr intelligente KI (Claude Opus 4.6) hatte mit vielen von ihnen zu kämpfen und benötigte durchschnittlich 37 Schritte zur Lösung.
- Leistung: Als sie ihre eigenen Roboter (unter Verwendung von Modellen wie Qwen3) auf diesen neuen Aufgaben trainierten, wurden die Roboter im Vergleich zu Robotern, die auf älteren, weniger vielfältigen Daten trainiert wurden, deutlich besser darin, Terminalaufgaben zu lösen.
Das Fazit
SkillSynth ist eine Methode, um automatisch eine massive, vielfältige Bibliothek von „Computerarbeiten" für Roboter zu generieren, an denen diese üben können. Indem sie darlegen, wie verschiedene Computerfertigkeiten miteinander verbunden sind, können sie endlos neue, realistische Herausforderungen schaffen. Dies hilft dabei, KI-Agenten vielseitiger und leistungsfähiger zu trainieren, nicht nur beim Reparieren von Software, sondern beim Bewältigen einer breiten Palette realer Computeraufgaben.
Hinweis: Das Papier stellt ausdrücklich fest, dass diese synthetisierten Aufgaben bereits zur Schulung von Hy3 Preview (ein Tencent-Produkt) verwendet wurden, wodurch dessen Fähigkeit verbessert wurde, als Agent in Terminalumgebungen zu agieren. Die Autoren behaupten keine medizinischen, klinischen oder anderen spezifischen zukünftigen Anwendungen jenseits dieser allgemeinen Verbesserung der Terminalautomatisierung.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.