AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems
Dieser Beitrag stellt AgensFlow vor, ein Open-Source-Framework, das die Koordination multipler Agenten als Problem des Online-Policy-Lernens unter partieller Beobachtbarkeit behandelt und zeigt, dass erlernte, prüfbare Routing-Verfahren statische Pipelines in komplexen Workflows übertreffen, indem sie Entscheidungen bezüglich Fähigkeiten, Rollen, Modellen und Topologie dynamisch optimieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind der Manager einer belebten, hochriskanten Küche. Sie haben ein Team von Köchen (die Agenten), eine Speisekammer mit verschiedenen Zutaten und Werkzeugen (die Fähigkeiten) und ein paar verschiedene Öfen, die mit unterschiedlicher Geschwindigkeit und zu unterschiedlichen Kosten backen (die Modelle).
Bei der alten Arbeitsweise (die statische Pipeline) würden Sie für jedes Gericht eine starre Rezeptkarte schreiben. „Für Suppe immer Chef A einsetzen, die Speisekammer prüfen, dann Ofen 1 verwenden." „Für Salat immer Chef B einsetzen, die Speisekammer überspringen, Ofen 2 verwenden."
Das Problem ist, dass das echte Leben nicht so einfach ist. Manchmal sind die Suppenzutaten seltsam, oder der Ofen ist defekt, oder Sie müssen einen Salat zubereiten, der tatsächlich einen Suppentopf erfordert. Wenn Sie am starren Rezept festhalten, verschwenden Sie möglicherweise Zeit, Geld oder servieren ein schlechtes Essen.
AgensFlow ist eine neue Art, diese Küche zu betreiben. Statt eines festen Rezepts ist es ein intelligenter, lernender Manager, der beobachtet, was bei jedem zubereiteten Gericht passiert, und den Plan in Echtzeit anpasst.
So funktioniert es, aufgeschlüsselt in einfache Konzepte:
1. Die „gefaltete Signatur" (Erkennen der Situation)
Der Manager betrachtet nicht jedes einzelne Detail jeder Bestellung (was überwältigend wäre). Stattdessen gruppiert er Bestellungen zu „Signaturen".
- Die Analogie: Denken Sie an ein Ampelsystem. Der Manager fragt nicht: „Ist es ein roter Toyota oder ein blauer Ford?" Er fragt: „Ist dies eine Spitzenstunden-Situation (hohes Risiko, Geschwindigkeit erforderlich)?" oder „Ist dies ein langsamer Dienstag (niedriges Risiko, kann sorgfältig sein)?"
- In der Arbeit: Er betrachtet die Aufgabe, um zu sehen, ob sie mehrdeutig, riskant ist oder viele Beweise erfordert. Er gruppiert ähnliche Aufgaben zusammen, damit er den besten Weg lernt, diese Art von Situation zu handhaben, anstatt jede einzelne Bestellung auswendig zu lernen.
2. Die „Überspringen"-Taste (Topologie-Lernen)
In einer starren Küche müssen Sie möglicherweise für jedes Gericht eine Schüssel waschen, eine Zwiebel hacken und einen Topf rühren, selbst wenn das Gericht dies nicht benötigt.
- Die Analogie: AgensFlow gibt dem Manager eine „Überspringen"-Taste. Wenn der Manager eine einfache Bestellung sieht (wie ein Glas Wasser), lernt er, das Hacken und das aufwendige Anrichten zu überspringen. Wenn die Bestellung komplex ist (wie ein fünfgängiges Festmahl), lernt er, zusätzliche Schritte hinzuzufügen, etwa zwei Köche, die die Arbeit doppelt überprüfen.
- In der Arbeit: Dies wird als skip:X bezeichnet. Das System lernt, dass es bei bestimmten Aufgabentypen teure Schritte (wie das Durchsuchen des Webs oder das Überprüfen von Fakten) vollständig überspringen kann, wodurch Zeit und Geld gespart werden, ohne das Ergebnis zu beeinträchtigen.
3. Die „Lernschleife" (Policy-Graph)
Das System rät nicht einfach; es führt eine Punktekarte.
- Die Analogie: Stellen Sie sich vor, der Manager führt ein Notizbuch. Nach jedem Essen bewertet ein Food-Kritiker (der Richter) das Gericht. Der Manager schreibt auf: „Als wir eine ‚Spitzenstunden'-Bestellung hatten, erzielten Chef B und das Überspringen der Garnitur eine 9/10 und kosteten weniger. Chef A erzielte eine 7/10, kostete aber mehr."
- In der Arbeit: Dies ist der Policy-Graph. Er lernt eine „Policy" (eine Reihe von Regeln) für jede „Signatur" (Situation). Er verwendet einen mathematischen Trick namens UCB1, um das Ausprobieren neuer Dinge (Exploration) mit dem Festhalten an funktionierenden Methoden (Exploitation) auszubalancieren.
4. Die „Doppelprüfung" (Reward-Audit)
Eines der größten Probleme bei KI ist, dass der „Kritiker" voreingenommen sein könnte. Vielleicht liebt ein Kritiker scharfes Essen, während ein anderes es hasst.
- Die Analogie: AgensFlow fragt nicht nur einen Food-Kritiker. Es fragt drei verschiedene Kritiker aus unterschiedlichen Hintergründen, das Essen zu bewerten. Wenn sie alle zustimmen, vertraut der Manager dem Score. Wenn sie sich nicht einig sind, weiß der Manager, dass der Score wackelig ist, und ändert die Regeln nicht darauf basierend.
- In der Arbeit: Dies ist das Cross-Judge-Audit. Die Arbeit ergab, dass sich das System, wenn es sich nur auf einen Richter verlässt, täuschen lässt und glaubt, es würde besser abschneiden als tatsächlich. Die Verwendung mehrerer Richter gibt ein wahrheitsgetreueres Bild des Erfolgs.
Was haben sie herausgefunden?
Die Forscher testeten diesen „intelligenten Manager" an zwei sehr unterschiedlichen Aufgabentypen:
- Beheben von Computer-Systemabstürzen (Verteilte Systeme).
- Analyse von Sicherheitswarnungen (Sicherheitsmitteilungen).
Die Ergebnisse:
- Besser bei Schwerem: Der lernende Manager war bei komplexen Aufgaben, die Koordination erforderten (wie das Kombinieren von Informationen aus vielen Quellen), deutlich besser als die starre Rezeptur. Er verbesserte die Qualität der Antwort für diese schwierigen Aufgaben erheblich.
- Gut bei Einfachem: Bei sehr einfachen Aufgaben war der lernende Manager etwa gleichauf mit der starren Rezeptur (er machte die Dinge nicht schlechter, aber er musste nicht besonders raffiniert sein).
- Der „Warm-Start"-Trick: Sie versuchten, den Manager anhand von Sicherheitswarnungen zu unterrichten, indem sie das Wissen nutzten, das er bereits über Computerabstürze hatte. Es funktionierte! Der Manager lernte den neuen Job schneller und verbrachte weniger Zeit mit „Raten" (Exploration), obwohl die Themen unterschiedlich waren.
Das Fazit
AgensFlow beweist, dass Sie für komplexe KI-Teams die Regeln nicht hart codieren sollten. Stattdessen sollten Sie ein System aufbauen, das beobachtet, lernt und sich anpasst. Es behandelt die Entscheidung „wer was, wann und ob wir es überhaupt tun müssen" als eine Fähigkeit, die erlernt werden kann, und nicht als eine feste Einstellung.
Am wichtigsten ist, dass es zeigt, wie sorgfältig Sie sein müssen, wie Sie Erfolg messen. Wenn Ihr „Richter" voreingenommen ist, wird Ihr „Lernen" falsch sein. Durch die Prüfung der Richter selbst bleibt das System ehrlich und effektiv.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.