← Neueste Arbeiten
🤖 AI

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Uno-Orchestra führt eine einheitliche, auf Reinforcement Learning basierende Orchestrierungsrichtlinie ein, die die Tiefe der Aufgabenzerlegung, die Auswahl der Worker und das Inferenzbudget gemeinsam optimiert, um im Vergleich zu starren Multi-Agenten-Systemen über diverse Benchmarks hinweg deutlich höhere Genauigkeit und geringere Kosten zu erzielen.

Ursprüngliche Autoren: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

Veröffentlicht 2026-05-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu Zhang, Xinlei Yu, Qibing Ren, Usman Naseem

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben ein riesiges, komplexes Problem zu lösen, wie etwa die Planung einer landesweiten Roadtrip, bei der Sie Hotels finden, Flüge buchen, den Verkehr prüfen und Mahlzeiten zubereiten müssen.

In der Welt der Künstlichen Intelligenz bewältigen die meisten heutigen Systeme dies auf eine von zwei ungeschickten Arten:

  1. Der „Einheitsgröße"-Chef: Sie stellen den teuersten, superklugen CEO (ein massives KI-Modell) ein, der alles erledigt, vom Buchen des Fluges bis zum Schneiden des Gemüses. Das funktioniert, ist aber selbst für einfache Aufgaben wie das Prüfen des Wetters unglaublich teuer und langsam.
  2. Das „Starre Fließband": Sie haben ein vorab geschriebenes Skript, das besagt: „Zuerst den CEO nach einem Flug fragen. Dann den CEO nach einem Hotel fragen." Das ist unflexibel. Wenn der CEO beschäftigt ist oder sich die Aufgabe ändert, bricht die ganze Linie zusammen.

Uno-Orchestra ist eine neue, intelligentere Art, diese Show zu leiten. Stellen Sie es sich als brillanten, kostensensiblen Tourmanager vor, der die Arbeit nicht selbst erledigt, aber genau weiß, wen er für jeden winzigen Teil des Jobs einstellen muss.

Die Kernidee: „Selektive Delegation"

Der Tourmanager (Uno-Orchestra) betrachtet Ihre Anfrage und stellt gleichzeitig zwei Fragen:

  1. „Muss ich das aufteilen?" (Zerlegung)
  2. „Wer ist die beste Person für dieses spezifische Stück?" (Routing)
  • Wenn die Aufgabe einfach ist (z. B. „Was ist 2+2?"), sagt der Manager: „Ich muss niemanden anrufen. Ich antworte einfach sofort selbst." Das spart Geld und Zeit.
  • Wenn die Aufgabe komplex ist (z. B. „Schreiben Sie ein Python-Skript, um Aktien Daten zu analysieren und zu visualisieren"), zerlegt der Manager sie in Teilaufgaben: „Daten finden", „Code schreiben", „Code ausführen", „Diagramm erstellen".
  • Der magische Trick: Für jede Teilaufgabe wählt der Manager den perfekten Arbeiter aus. Er könnte die Aufgabe „Daten finden" an einen schnellen, billigen Praktikanten (ein kleineres, günstigeres KI-Modell) senden. Aber er sendet die Aufgabe „Diagramm erstellen" an einen spezialisierten, teuren Künstler (ein leistungsfähiges, teures KI-Modell).

Wie es lernte, so gut zu sein

Die Arbeit beschreibt einen zweistufigen Trainingsprozess, wie die Einarbeitung eines neuen Mitarbeiters:

  1. Das Praktikum (Überwachtes Feinabstimmen): Das System beobachtete 61.000 Beispiele eines „Meister-Managers", der Probleme löste. Der Meister-Manager verwendete echte Werkzeuge und echte Code-Ausführung (nicht nur Raten). Das System lernte, diese erfolgreichen Muster zu kopieren: wann man Dinge aufteilt und welchen Arbeiter man für welchen Job auswählt.
  2. Die Simulationsliga (Bestärkendes Lernen): Das System wurde dann in eine „Trainingsarena" versetzt, in der es schwierige Probleme allein lösen musste.
    • Wenn es das Problem korrekt und günstig löste, erhielt es eine hohe Punktzahl.
    • Wenn es es korrekt löste, aber Geld verschwendete, erhielt es eine niedrigere Punktzahl.
    • Wenn es scheiterte, erhielt es eine Null.
    • Entscheidend lernte das System, Gutschriften (oder Schuld) für spezifische Schritte zu vergeben. Wenn es für Schritt 3 den falschen Arbeiter auswählte, lernte es diesen spezifischen Fehler, anstatt nur am Ende eine generische „Sie haben versagt"-Nachricht zu erhalten.

Die Ergebnisse: Schnell, Günstig und Intelligente

Die Forscher testeten diesen neuen Tourmanager gegen 22 andere Systeme (einschließlich anderer „Router" und „Fließbänder") über 13 verschiedene Arten von Herausforderungen, von Mathematik und Programmieren bis hin zum Lesen langer Dokumente.

  • Die Punktzahl: Uno-Orchestra erreichte eine 77%ige Erfolgsrate, was etwa 16% besser war als das nächstbeste System.
  • Die Kosten: Noch beeindruckender ist, dass dies pro Abfrage 10-mal weniger kostete als die schweren Workflow-Systeme.

Warum es besser funktioniert

Die Arbeit behauptet, das Geheimnis sei Flexibilität.

  • Alte Systeme versuchten entweder, alles mit einem einzigen riesigen Gehirn zu erledigen (zu teuer) oder folgten einem starren Skript (zu dumm).
  • Uno-Orchestra ist wie ein Jazzmusiker. Es weiß, wann es eine einfache, einzelne Note spielt (eine direkte Antwort) und wann es eine ganze Band hinzuzieht (die Aufgabe zerlegen), und es weiß genau, welches Instrument (KI-Modell) für jede Note benötigt wird.

Zusammenfassung

Uno-Orchestra ist ein System, das lernt, ein intelligenter Projektmanager zu sein. Es leitet nicht nur Fragen weiter; es entscheidet, wie sie zerlegt werden und wem sie zugewiesen werden, und hält dabei ein strenges Budget ein. Es beweist, dass man nicht die teuerste KI braucht, um die schwierigsten Probleme zu lösen; man braucht nur die richtige KI für den richtigen Job zur richtigen Zeit.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →