← Neueste Arbeiten
💬 NLP

Kalypso: Relational LLM Serving

Kalypso ist ein relationales LLM-Serving-System, das die Effizienz der semantischen Abfrageausführung durch die Einführung einer abfragespezifischen Pipeline-Ausführung und adaptiven Speicherplanung zur Wiederverwendung von KV-Cache-Zuständen über Operatoren hinweg verbessert und dabei eine bis zu 4,57-fache Beschleunigung gegenüber traditionellen anfragenzentrierten Ansätzen erzielt.

Ursprüngliche Autoren: Hojae Son, Md Ashraful Islam, Huy Gia Cao, Hui Guan, Marco Serafini

Veröffentlicht 2026-07-28
📖 8 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hojae Son, Md Ashraful Islam, Huy Gia Cao, Hui Guan, Marco Serafini

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine Welt vor, in der Computer in der Lage sind, unstrukturierte, ungeordnete Informationen wie medizinische Notizen, rechtliche Verträge oder Produktbewertungen genauso gut zu lesen, zu verstehen und darüber zu urteilen wie ein menschlicher Experte. Dies ist das Versprechen von Large Language Models (LLMs), den superintelligenten KI-Gehirnen hinter vielen modernen Werkzeugen. Diese Modelle sind jedoch wie hungrige Riesen: Sie benötigen gewaltige Mengen an Computerspeicher, um über jeden Satz, den sie lesen, nachzudenken. Wenn Sie einen Computer bitten, einen riesigen Stapel Dokumente zu verarbeiten, behandelt er jede einzelne Anfrage normalerweise als separates, isoliertes Ereignis. Er liest ein Dokument, beantwortet eine Frage, vergisst alles und fängt dann beim nächsten Dokument wieder von vorne an. Dieser „Start-von-vorne“-Ansatz ist unglaublich langsam und verschwendet viel des teuren Computerspeichers, besonders wenn man eine komplexe Kette von Aufgaben ausführen möchte, wie zum Beispiel das Filtern einer Liste, das anschließende Zusammenfassen der Ergebnisse und das abschließende Verknüpfen mit anderen Daten. Die große Frage, die sich Forscher stellen, lautet: Können wir diese KI-Riesen lehren, sich an das zu erinnern, was sie gerade gelernt haben, und es für den nächsten Schritt zu verwenden, anstatt es sofort wieder zu vergessen?

Genau dieses Problem adressiert das Paper „Kalypso: Relational LLM Serving“. Die Autoren führen ein neues System namens Kalypso ein, das wie ein intelligenter Verkehrskontrolleur für diese KI-Anfragen fungiert. Anstatt den KI-Riesen alles zwischen den Schritten vergessen zu lassen, organisiert Kalypso die Arbeit so, dass die KI ihre „Gedanken“ (den sogenannten KV-Cache) am Leben erhält, während sie sich von einer Aufgabe zur nächsten bewegt. Stellen Sie sich das wie einen Staffellauf vor, bei dem die Läufer den Stab nicht fallen lassen und von vorne beginnen, sondern den Stab direkt an den nächsten Läufer übergeben, um den Schwung beizubehalten. Das Paper zeigt, dass Kalypso durch dieses Vorgehen komplexe Datenabfragen bis zu 4,57-mal schneller ausführen kann als aktuelle Methoden, ohne die Antworten der KI zu verändern. Es beweist, dass wir durch das Verständnis der Struktur der Anfrage und ein sorgfältiges Management des Computerspeichers diese leistungsstarken KI-Werkzeuge wesentlich effizienter und weniger verschwenderisch machen können.

Das Problem: Der „vergessliche“ Riese

Um zu verstehen, warum Kalypso so bedeutend ist, müssen wir uns ansehen, wie diese KI-Modelle heute funktionieren. Stellen Sie sich vor, Sie sind ein Student, der eine sehr schwere Prüfung ablegt. Jedes Mal, wenn Sie eine neue Frage erhalten, müssen Sie das gesamte Lehrbuch von der ersten Seite an neu lesen, um die Fakten zu erinnern, die Sie benötigen. Das würde ewig dauern, oder? Das ist im Wesentlichen das, was heutige KI-Systeme tun. Wenn ein Computer eine Liste von 1.000 Dokumenten verarbeiten muss, sendet er sie normalerweise einzeln (oder in kleinen Paketen) an die KI und behandelt jedes als eine völlig neue Anfrage.

Das KI-Modell besitzt einen speziellen Speicher namens KV-Cache (Key-Value Cache). Dies ist wie ein Notizblock, auf dem das Modell die wichtigen Teile eines Satzes aufschreibt, damit es sie nicht jedes Mal neu berechnen muss, wenn es ein neues Wort generiert. Dieser Notizblock ist riesig und nimmt viel Speicher des Computers ein. In einem Standard-System wird dieser Notizblock nach Abschluss einer Anfrage gelöscht, um Platz für die nächste Person zu schaffen.

Das Paper weist auf einen schwerwiegenden Fehler in diesem Ansatz hin: Oft führt die KI eine Kette von Aufgaben aus. Ein System könnte beispielsweise zuerst eine Liste von Produkten filtern, um nur „rote Schuhe“ zu finden, und anschließend die Beschreibungen dieser roten Schuhe zusammenfassen. Die KI liest die Beschreibung von „rotem Schuh Nr. 1“, um zu entscheiden, ob er rot ist. Dann muss sie dieselbe Beschreibung erneut lesen, um sie zusammenzufassen. In einem Standard-System vergisst die KI den ersten Teil und muss die gesamte Beschreibung wieder von Grund auf neu lesen. Es ist, als würde man ein Buch lesen, es schließen und es dann wieder öffnen, um dieselbe Seite zu lesen, nur um eine Randnotiz zu schreiben. Dies verschwendet Zeit und Speicher.

Die Lösung: Kalypso's Staffellauf

Die Autoren schlagen eine neue Denkweise vor, die Relational LLM Serving genannt wird. Anstatt Anfragen als isolierte Ereignisse zu betrachten, analysiert Kalypso den gesamten „Query Plan“ – die Landkarte, wie die Daten fließen sollen. Es erkennt, dass, wenn die KI gerade einen Satz gelesen hat, um ihn zu filtern, sie sofort denselben Speicher nutzen sollte, um ihn zusammenzufassen, ohne die Tafel zu löschen.

Um dies zu ermöglichen, agiert Kalypso wie ein geschickter Manager in einer geschäftigen Küche. Stellen Sie sich eine Küche vor, in der Köche (die KI-Operatoren) Gerichte zubereiten.

  • Der alte Weg (Anfrage-zentriert): Der Manager übergibt einen Beleg an Koch A. Koch A bereitet das Gericht zu, richtet es an und wirft die Zutaten weg. Dann übergibt der Manager einen Beleg an Koch B, der die Zutaten erneut holen und den Kochvorgang von vorne beginnen muss.
  • Der Kalypso-Weg (Pipeline-basiert): Der Manager sieht, dass Koch A gerade dabei ist, ein Gericht fertigzustellen. Anstatt zu warten, sagt der Manager zu Koch B: „Mach dich bereit, Koch A übergibt dir gleich den Teller!“ Koch B beginnt mit dem Gericht zu arbeiten, sobald Koch A fertig ist, und nutzt dabei dieselben Zutaten und Werkzeuge, ohne eine Pause einzulegen.

Dieses „Pipelining“ ist die eigentliche Magie. Aber es gibt einen Haken: Die Küche hat begrenzte Arbeitsflächen (GPU-Speicher). Wenn der Manager zu viele Köche gleichzeitig kochen lässt, wird die Arbeitsfläche überladen und sie müssen Zutaten wegwerfen, um Platz für neue zu schaffen. Dies nennt man Memory Pressure (Speicherdruck). Wenn die Arbeitsfläche zu voll wird, ist das System gezwungen, den „Notizblock“ (den KV-Cache) zu löschen, bevor der nächste Koch ihn benutzen kann, was den gesamten Zweck vereitelt.

Der magische Trick: Adaptives Scheduling

Der wahre Durchbruch von Kalypso ist sein adaptiver Scheduler. Er lässt nicht einfach alle gleichzeitig kochen; er beobachtet ständig die verfügbare Arbeitsfläche.

  • Wenn die Arbeitsfläche zu voll wird, verlangsamt er die ersten Köche, damit die Zutaten nicht weggeworfen werden, bevor die zweiten Köche sie nutzen können.
  • Wenn die Arbeitsfläche leer ist und die zweiten Köche auf das Essen warten, beschleunigt er die ersten Köche, um die Linie in Bewegung zu halten.

Das Paper beschreibt dies als einen Balanceakt. Das System muss schätzen, wie viel Speicher eine Aufgabe benötigen wird (ähn-lich wie die Schätzung, wie viele Zutaten ein Rezept verbrauchen wird). Wenn die Schätzung falsch ist und zu viel reserviert wird, steht die Küche still. Wenn zu wenig reserviert wird, läuft der Speicher aus und eine Aufgabe muss neu gestartet werden. Kalypso nutzt einen intelligenten Algorithmus, um diese Schätzungen laufend anzupassen und die Speicherbudgets zwischen den verschiedenen Phasen des Prozesses zu verschieben, um sicherzustellen, dass niemand auf Arbeit wartet und niemand die Arbeitsfläche blockiert.

Was sie herausgefunden haben: Den Riesen beschleunigen

Die Forscher testeten Kalypso bei vier verschiedenen realen Aufgaben, die von der Überprüfung von Fakten in Wikipedia-Artikeln über den Abgleich medizinischer Unterlagen bis hin zur Analyse rechtlicher Verträge reichten. Sie verglichen es mit bestehenden Systemen, die den „Start-von-vorne“-Ansatz nutzen.

Die Ergebnisse waren beeindruckend. Kalypso machte die Dinge nicht nur ein wenig schneller, sondern signifikant schneller.

  • Bei einer Aufgabe namens ContractNLI (Analyse rechtlicher Verträge) war Kalypso 4,57-mal schneller als das derzeit beste System (Lotus).
  • Bei MEDEC (Erkennung medizinischer Fehler) war es 1,54-mal schneller.
  • Bei BioDEX (Abgleich medizinischer Artikel) war es 1,29-mal schneller.

Entscheidend ist, dass das Paper feststellt, dass Kalypso diese Beschleunigung erreichte, ohne die Antworten der KI zu verändern. Es wurden keine „Tricks“ oder Abkürzungen angewandt, die die Qualität der Ergebnisse mindern könnten. Es hat lediglich den Prozess der Beantwortung effizienter gemacht. Das System zeigte auch, dass es verschiedene Arten von Arbeitslasten gut bewältigen kann, selbst wenn der Computerspeicher knapp war. Tatsächlich blieb Kalypso schnell, selbst wenn der Speicher reduziert wurde, während andere Systeme drastisch langsamer wurden.

Warum das wichtig ist

Das Paper kommt zu dem Schluss, dass wir durch das „bewusstmachen“ der KI bezüglich des Query Plans und das Management ihres Speichers wie ein intelligenter Verkehrskontrolleur enorme Leistungssteigerungen erzielen können. Hierbei geht es nicht nur darum, ein paar Sekunden zu sparen; es geht darum, es möglich zu machen, diese komplexen KI-Aufgaben auf günstigerer Hardware auszuführen oder massive Datenmengen zu verarbeiten, die zuvor zu langsam für eine praktische Anwendung waren.

Die Autoren weisen vorsichtig darauf hin, dass dies eine Systemoptimierung ist und keine Änderung der Intelligenz der KI. Sie haben die KI nicht intelligenter gemacht; sie haben sie nur daran gehindert, ihre Zeit und ihren Speicher zu verschwenden. Indem sie die KI als eine verbundene Pipeline statt als eine Sammlung isolierter Anfragen behandeln, zeigt Kalypso, dass die Zukunft der KI-Effizienz im Management des Informationsflusses liegt und nicht nur im Bau größerer Modelle. Es ist eine Erinnerung daran, dass der beste Weg, einen Riesen schneller zu machen, manchmal darin besteht, ihm beizubringen, sich zu erinnern, wo er gerade war.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →