← Neueste Arbeiten
🤖 AI

SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters

SAGA ist ein verteilter Scheduler, der die Effizienz von Workflows zusammengesetzter KI-Agenten auf GPU-Clustern verbessert, indem er vom anfrageweisen auf das programmweises Scheduling umstellt, wodurch Zwischenzustände des KV-Caches erhalten bleiben und die Aufgabenabschlusszeit trotz eines Kompromisses beim Spitzen-Durchsatz um den Faktor 1,64 verkürzt wird.

Ursprüngliche Autoren: Dongxin Guo, Jikun Wu, Siu Ming Yiu

Veröffentlicht 2026-05-04
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Dongxin Guo, Jikun Wu, Siu Ming Yiu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie leiten eine belebte Küche (ein GPU-Cluster), in der Köche (KI-Agenten) versuchen, komplexe Mehrgänge-Menüs (KI-Aufgaben) zuzubereiten.

Derzeit behandeln die meisten Küchenchefs (bestehende Scheduler wie vLLM) jede einzelne Bestellung als ein völlig separates, einmaliges Ereignis. Wenn ein Koch Gemüse schneiden muss, dann auf das Vorheizen des Ofens warten und dann weiter Gemüse schneiden muss, zwingt der Manager den Koch dazu:

  1. Die erste Charge zu kochen.
  2. Alles wegzuschmeißen – das geschnittene Gemüse und die schmutzigen Messer (den KV-Cache), weil der Koch auf den Ofen „wartet".
  3. Wenn der Ofen bereit ist, muss der Koch exakt dasselbe Gemüse von vorne anfangen zu schneiden.

Dieser „Neu-Anfang"-Zyklus passiert Dutzende Male pro Menü. Er verschwendet enorme Mengen an Zeit und Platz und macht die Küche 3- bis 8-mal langsamer, als sie sein müsste.

SAGA ist ein neuer Küchenchef, der die Regeln ändert. Anstatt einzelne Bestellungen zu betrachten, betrachtet SAGA das gesamte Rezept als eine einzige Einheit. So funktioniert es, unter Verwendung einfacher Analogien:

1. Das „Rezeptbuch" (Agent Execution Graphs)

Anstatt zu raten, was der Koch als Nächstes tun wird, liest SAGA das Rezeptbuch (den Agent Execution Graph).

  • Das Problem: Der Koch hält an, um auf den Ofen zu warten (ein „Tool Call"). Alte Manager gehen davon aus, dass der Koch fertig ist, und räumen die Arbeitsfläche.
  • SAGAs Lösung: SAGA weiß aus dem Rezept, dass „nach dem Ofen wir wieder Zwiebeln schneiden müssen". Also sagt es dem Koch: „Behalte das geschnittene Gemüse und das Messer auf der Arbeitsfläche. Wasche sie noch nicht ab."
  • Das Ergebnis: Wenn der Ofen fertig ist, setzt der Koch genau dort fort, wo er aufgehört hat. Kein erneutes Schneiden. SAGA sagt dies so gut voraus, dass es fast so perfekt funktioniert wie ein Manager, der in die Zukunft sehen könnte (ein theoretischer „optimaler" Manager).

2. Die „VIP-Tisch"-Strategie (Session-Affinity Batching)

Stellen Sie sich vor, ein Koch arbeitet an einem komplexen 10-Gänge-Menü.

  • Das Problem: Im alten System könnte der Manager, wenn der Koch beschäftigt wird, den nächsten Schritt des Menüs an einen anderen Koch an einem anderen Arbeitsplatz schicken. Der neue Koch muss das gesamte Rezept neu lesen und das Gemüse neu schneiden, weil er die Notizen des ersten Kochs nicht hat.
  • SAGAs Lösung: SAGA sagt: „Dieses gesamte 10-Gänge-Menü gehört zu Koch A an Station 1." Selbst wenn Koch A auf den Ofen wartet, ist der nächste Schritt für ihn reserviert. Wenn Station 1 zu voll wird, könnte SAGA das ganze Menü an eine neue Station verlegen, bringt aber die „Notizen" (den Cache) mit, damit der neue Koch nicht von vorne beginnen muss.
  • Das Ergebnis: Die Küche bleibt organisiert, und die Köche verschwenden keine Zeit damit, Arbeit zu wiederholen.

3. Die „Fairness"-Regel (Agent Fair Share)

Stellen Sie sich ein Restaurant mit zwei Arten von Kunden vor:

  • Kunde A: Bestellt einen einfachen Burger (eine kurze Aufgabe).
  • Kunde B: Bestellt ein riesiges, 50-Gänge-Bankett (eine lange, komplexe Agent-Aufgabe).
  • Das Problem: Alte Manager priorisieren oft den Burger, weil er schnell fertig ist. Der Bankett-Kunde wartet ewig und wird frustriert.
  • SAGAs Lösung: SAGA betrachtet das ganze Bankett. Es erkennt: „Wenn wir weiter den Burger bedienen, wird das Bankett nie fertig." Es stellt sicher, dass das Bankett genug Aufmerksamkeit erhält, um pünktlich fertig zu werden, auch wenn das bedeutet, dass der Burger etwas länger warten muss. Es garantiert, dass jeder sein volles Menü erhält, nicht nur die schnellen Snacks.

Der Kompromiss (Das „Geschwindigkeit vs. Qualität"-Gleichgewicht)

SAGA ist unglaublich schnell darin, einzelne komplexe Menüs fertigzustellen (die Zeit bis zum Abschluss einer Aufgabe wird um den Faktor 1,64 reduziert). Da es jedoch Zeit damit verbringt, Dinge zu organisieren und für den nächsten Schritt bereit zu halten, kann es nicht so viele gesamte Menüs pro Stunde produzieren wie ein Manager, der einfach alles in einen Mixer wirft und das Rezept ignoriert.

  • Die Behauptung des Papers: SAGA ist bei maximalem Rohdurchsatz etwa 30 % langsamer als der „Churn-and-Burn"-Stil.
  • Warum das wichtig ist: Das Paper argumentiert, dass dies ein guter Kompromiss ist. Die meisten KI-Agenten sind interaktiv (wie ein Coding-Assistent oder ein Browser-Bot), bei denen den Benutzern wichtig ist, wie schnell die Aufgabe abgeschlossen ist, und nicht, wie viele Aufgaben der Server theoretisch unterbringen kann.

Zusammenfassung der Ergebnisse

Bei Tests auf einem echten 64-GPU-Supercomputer:

  • Geschwindigkeit: Aufgaben wurden 1,64-mal schneller abgeschlossen als der aktuelle beste Standard (vLLM mit Prefix-Caching).
  • Speicher: Die Küche nutzte ihren Arbeitsplatz (GPU-Speicher) 22 % effizienter, was bedeutet, dass sie komplexere Rezepte bewältigen konnte, ohne den Platz zu erschöpfen.
  • Zuverlässigkeit: 99,2 % der Aufgaben wurden innerhalb ihrer zugesagten Zeitlimits abgeschlossen, selbst wenn die Küche chaotisch und überfüllt war.

Kurz gesagt: SAGA verhindert, dass KI-Agenten ihre Arbeit jedes Mal wegwerfen, wenn sie pausieren, und stellt sicher, dass sie genau dort weitermachen können, wo sie aufgehört haben. Dadurch werden komplexe KI-Aufgaben viel reaktionsschneller und zuverlässiger.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →