← Neueste Arbeiten
💻 computer science

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow ist ein flussbasiertes Framework, das Tempered Trajectory Balance einsetzt, um einen trainierbaren Supervisor-Agenten zu ermöglichen, die Aufgabenkoordination mit diversen Strategien und transparenter Kreditvergabe zu automatisieren, während es einen rekursiven Mechanismus nutzt, um seine Fähigkeitsbibliothek autonom weiterzuentwickeln und so die Leistung bei verschiedenen komplexen Aufgaben zu verbessern.

Ursprüngliche Autoren: Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

Veröffentlicht 2026-05-15
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie unterrichten einen sehr intelligenten, aber etwas ungeschickten Roboter-Assistenten darin, komplexe Rätsel zu lösen, wie etwa das Reparieren einer defekten Website, das Navigieren durch ein virtuelles Haus oder das Lösen eines kniffligen mathematischen Problems.

In der Vergangenheit haben wir versucht, diese Roboter auf zwei Hauptarten zu unterrichten, die beide große Probleme hatten:

  1. Der Weg des „steifen Handbuchs": Wir gaben dem Roboter eine feste Liste von Regeln und Werkzeugen. Wenn der Roboter stecken blieb, konnte er kein neues Werkzeug erfinden; er scheiterte einfach.
  2. Der Weg des „Versuchs und Irrtums": Wir ließen den Roboter Millionen zufälliger Dinge ausprobieren. Wenn er erfolgreich war, gaben wir ihm am allerEnde ein High-Five. Aber da das „High-Five" nur an der Ziellinie kam, wusste der Roboter nicht, welcher spezifische Zug den Unterschied machte. Oft lernte er nur einen glücklichen Pfad und vergaß, wie man mit etwas Abweichendem umgeht (dies wird „Strategie-Kollaps" genannt).

SkillFlow ist eine neue Art, diese Roboter zu trainieren, die diese Probleme löst. So funktioniert es, unter Verwendung einfacher Analogien:

1. Die „Flow"-Karte (anstatt eines einzigen Pfads)

Stellen Sie sich den Entscheidungsprozess des Roboters als ein riesiges, verzweigtes Flusssystem vor (eine Karte aller möglichen Entscheidungen).

  • Alte Methode: Der Roboter versucht, den einzigen schnellsten Fluss zum Ozean zu finden. Wenn dieser Fluss austrocknet, steckt der Roboter fest.
  • SkillFlow: Anstatt den Roboter zu zwingen, nur einen Fluss zu wählen, lehrt SkillFlow den Roboter, den Fluss des gesamten Flusssystems zu verstehen. Er lernt, dass viele verschiedene Pfade zum Ozean führen können, und hält alle guten Pfade offen. Dies wird „Reward-Proportional Sampling" genannt. Es ist, als würde man sagen: „Merken Sie sich nicht nur eine glückliche Route; lernen Sie, in jedem Fluss, der zum Erfolg führt, gut zu schwimmen."

2. Der „Zeitreisende" Trainer (Zero-Cost Credit)

Normalerweise wissen wir nicht, wann ein Roboter einen Fehler gemacht hat, bis ganz am Ende.

  • Das Problem: Wenn ein Roboter 10 Schritte benötigt, um ein Rätsel zu lösen, und scheitert, ist er dann bei Schritt 1 oder bei Schritt 9 gescheitert?
  • Die Lösung von SkillFlow: SkillFlow verwendet einen speziellen „Trainer", der in die Zukunft schauen kann. Nachdem der Roboter eine Aufgabe abgeschlossen hat, blickt der Trainer auf jeden einzelnen Schritt zurück und sagt: „Ah, bei Schritt 4 haben Sie eine großartige Wahl getroffen, die zum Erfolg führte", oder „Bei Schritt 7 haben Sie Zeit verschwendet."
  • Die Magie: Die Arbeit behauptet, dieser „Trainer" benötigt keine zusätzliche Rechenleistung. Es ist, als würde der Roboter lernen, seine eigene Hausaufgaben sofort beim Abschließen zu benoten, ohne dass ein zweiter Lehrer hereinkommen und nachprüfen muss. Dies wird „Zero-Cost Per-Step Credit" genannt.

3. Die „selbstverbessernde Werkzeugkiste" (Rekursive Skill-Evolution)

Dies ist der einzigartigste Teil. Die meisten Roboter haben eine Werkzeugkiste, die sich nie verändert. Wenn sie ein neues Werkzeug benötigen, können sie es nicht herstellen.

  • Die Lösung von SkillFlow: SkillFlow beobachtet den „Flow" des Roboters und das Feedback des „Trainers". Wenn es sieht, dass der Roboter Schwierigkeiten hat, weil ihm ein bestimmtes Werkzeug fehlt, erstellt es automatisch ein neues Werkzeug (eine „Fertigkeit"), um diese Lücke zu schließen.
  • Wie es entscheidet:
    • Wann Werkzeuge hinzufügen? Wenn der Roboter aufhört, besser zu werden (der „Flow" erreicht ein Plateau).
    • Welche Werkzeuge hinzufügen? Es betrachtet die genauen Momente, in denen der Roboter verwirrt war, und schreibt eine neue Anweisung (ein „Tipp"), um zu helfen.
    • Welche Werkzeuge wegwerfen? Es entfernt Werkzeuge, die selten verwendet werden oder Verwirrung stiften.
  • Das Ergebnis: Die Werkzeugkiste des Roboters wächst und schrumpft automatisch und wird perfekt auf die Aufgaben abgestimmt, denen er sich stellt. Es ist wie ein Koch, der nach dem Kochen tausender Mahlzeiten erkennt, dass er ein spezifisches neues Messer benötigt, es erfindet und die stumpfen, die er nie benutzt, wegwirft.

Das große Ganze

Die Arbeit testete dieses System an 14 verschiedenen Arten von Herausforderungen, vom Beantworten von Quizfragen bis zum Schreiben von Code und dem Navigieren durch virtuelle Welten.

Die Ergebnisse:

  • Bessere Genauigkeit: Der SkillFlow-Roboter löste mehr Probleme korrekt als Roboter, die mit älteren Methoden trainiert wurden.
  • Flexibler: Da es mehrere Pfade offen hält (den „Flow"), geriet es nicht in Verwirrung, wenn sich die Aufgabe leicht änderte.
  • Günstiger: Es lernte schneller und verwendete weniger Rechenressourcen, da es keine Zeit damit verschwendete, dieselben Fehler erneut zu lernen oder zusätzliche „Trainer"-Sitzungen zu benötigen.

Kurz gesagt lehrt SkillFlow KI-Agenten nicht nur, eine richtige Antwort zu finden, sondern die Landschaft aller möglichen Antworten zu verstehen, ihre eigenen Schritte sofort zu benoten und automatisch die perfekte Werkzeugkiste zu bauen, um mit allem umzugehen, was als Nächstes kommt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →