← Neueste Arbeiten
💻 computer science

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

Das Papier stellt ConServe vor, ein Scheduling-Framework, das die Planungseinheit von einzelnen Turns auf ganze Konversationen verlagert, um die Notwendigkeit der Vorhersage unbekannter zukünftiger Kosten zu eliminieren, wodurch die Latenz reduziert und die Energieeffizienz durch die Nutzung einer stabilen zweiphasigen Struktur aus rechenintensiver Prefill- und speichergebundener Decoding-Phase verbessert wird.

Ursprüngliche Autoren: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

Veröffentlicht 2026-06-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie führen eine geschäftige Restaurantküche. In den alten Zeiten war jede Bestellung einfach: Ein Kunde kommt herein, Sie kochen das Essen, und er geht wieder. Sie konnten die Küche leicht managen, weil jede Bestellung etwa die gleiche Zeit und Mühe beanspruchte.

Aber heute stellen Sie sich vor, Ihre Kunden sind „KI-Agenten“. Sie bestellen nicht nur ein Gericht; sie starten ein komplexes Projekt.

  1. Die erste Runde (Das große Briefing): Der Kunde setzt sich hin und überreicht Ihnen ein massives, 50-seitiges Instruktionshandbuch. Es dauert lange, dieses zu lesen und zu verstehen (das „Prefill“).
  2. Die mittleren Runden (Die Tool-Aufrufe): Der Koch beginnt zu kochen, hält dann aber inne, um einen Lieferanten anzurufen, auf eine Antwort zu warten, ein Rezept zu prüfen und wieder zurückzurufen. Diese Schritte sind kurz, aber sie passieren immer und immer wieder.
  3. Die letzte Runde (Das Ergebnis): Schließlich ist das Gericht servierbereit.

Das Problem: Die alte Art der Planung

Heutige Küchenmanager (KI-Systeme) behandeln jeden einzelnen Schritt als eine separate Bestellung. Jedes Mal, wenn der Koch stoppt, um einen Lieferanten anzurufen, muss der Manager entscheiden: „Lasse ich den Koch diesen Schritt direkt in der Hauptküche abschließen oder schicke ich diesen spezifischen Schritt zu einer anderen, spezialisierten Station?“

Das Problem ist, dass der Manager raten muss, wie lange dieser Schritt dauern wird oder wie viel Speicher er benötigen wird, bevor er stattfindet. Wenn er falsch rät, schickt er den Schritt an die falsche Station, was zu einem Verkehrsstau führt. Es ist wie ein Verkehrspolizist, der versucht, Autos zu leiten, indem er genau vorhersagt, wie schnell jeder Fahrer fahren wird, noch bevor sie überhaupt losfahren.

Die Lösung: ConServe (Der konversationsbasierte Ansatz)

Das Paper stellt ein neues System namens ConServe vor. Anstatt jeden einzelnen Schritt separat zu verwalten, verwaltet ConServe die gesamte Konversation als eine einzige Einheit.

So ändert ConServe die Regeln mithilfe eines einfachen Zwei-Phasen-Plans:

Phase 1: Die schwere Arbeit (Das Prefill)
Wenn der Kunde zuerst mit diesem 50-seitigen Handbuch ankommt, schickt ConServe ihn sofort zu einer superschnellen, leistungsstarken Station (einer leistungsstarken GPU). Diese Station ist speziell darauf ausgelegt, riesige Dokumente schnell zu lesen. Sie liest das Handbuch, versteht den Kontext und erstellt eine „Gedächtnis-Karte“ (einen sogenannten KV-Cache) von allem, was benötigt wird.

Phase 2: Der lange Schwanz (Der Rest der Konversation)
Sobald diese initiale Karte erstellt wurde, sagt ConServe: „Okay, die schwere Arbeit ist erledigt. Nun gehört diese gesamte Konversation zu einer spezifischen, kleineren und energieeffizienteren Station.“

  • Die „Gedächtnis-Karte“ wird genau einmal an diese neue Station übertragen.
  • Von diesem Moment an findet jeder einzelne Folgeschritt (die Tool-Aufrufe, die kurzen Updates) direkt auf dieser einen Station statt.
  • Das System rät nie wieder. Es spielt keine Rolle, ob der nächste Schritt kurz oder lang ist; die Konversation bleibt an dieser einen Station gebunden, bis die Aufgabe erledigt ist.

Warum das besser ist (Die Analogie)

Denken Sie an einen Lieferwagen:

  • Die alte Art: Sie versuchen vorherzusagen, ob das nächste Paket schwer oder leicht ist. Wenn Sie falsch raten, schicken Sie einen kleinen LKW für eine schwere Last oder einen großen LKW für ein winziges Paket. Sie verschwenden Benzin und Zeit.
  • ConServe: Sie laden den LKW zu Beginn einmal voll. Sie fahren mit dem LKW zum Zielort und parken dort. Alle nachfolgenden Pakete für diesen spezifischen Kunden werden auf denselben LKW geladen. Sie müssen nicht das Gewicht des nächsten Pakets vorhersagen; Sie lassen den LKW einfach effizient weiterlaufen.

Die Ergebnisse

Das Paper hat dies an realen KI-Agenten-Workloads getestet und fand heraus:

  1. Geschwindigkeit: Es reduzierte die Zeit, die der Kunde benötigt, um das erste echte Ergebnis (nicht nur einen Tool-Aufruf) zu sehen, um 51 %. Es ist, als bekäme man sein Essen 50 % schneller, weil die Küche nicht darüber verwirrt ist, wohin sie die Zutaten legen soll.
  2. Effizienz: Es sparte 7,5 % Energie. Indem es eine leistungsstarke Station nur für das erste große Lesen nutzt und eine günstigere Station für den Rest verwendet, verschwendet es weniger Elektrizität.
  3. Zuverlässigkeit: Da das System nicht vorhersagen muss, was als Nächstes passiert, macht es nie „Fehlentscheidungs-Fehler“. Die alten Systeme würden abstürzen oder langsamer werden, wenn ihre Vorhersagen nicht stimmten; ConServe macht einfach weiter, weil es sich auf das stützt, was es gerade tatsächlich sieht.

Kurz gesagt: ConServe hört auf, die Zukunft jedes winzigen Schritts in einer KI-Konversation vorherzusagen. Stattdessen behandelt es die gesamte Konversation als einen einzigen Job, bewältigt den schweren Anfang mit einem leistungsstarken Motor und lässt dann einen stetigen, effizienten Motor den Rest erledigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →