← Neueste Arbeiten
🤖 machine learning

RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference

RetroInfer ist eine neue Vector-Storage-Engine für die LLM-Inferenz, die durch einen spezialisierten Index (wave index) und ein effizientes GPU-CPU-Speichermanagement die Dekodierungsgeschwindigkeit bei extrem langen Kontexten massiv steigert, ohne dabei an Genauigkeit zu verlieren.

Ursprüngliche Autoren: Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen, Bailu Ding, Xiao Yan, Jiawei Jiang, Chen Chen, Mingxing Zhang, Cheng Li
Veröffentlicht 2026-04-28
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen, Bailu Ding, Xiao Yan, Jiawei Jiang, Chen Chen, Mingxing Zhang, Cheng Li, Yuqing Yang, Fan Yang, Mao Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Problem: Das „Gedächtnis-Problem“ der KI

Stell dir vor, du unterhältst dich mit einem extrem intelligenten Professor. Je länger das Gespräch dauert, desto mehr Details merkt er sich. Er führt ein riesiges Notizbuch mit sich (das ist der sogenannte KV-Cache), in dem jedes Wort, das ihr bisher besprochen habt, akribisch aufgeschrieben ist.

Bei einem kurzen Gespräch ist das kein Problem. Aber wenn das Gespräch Tage dauert (ein „Long-Context“ von Millionen Wörtern), passiert folgendes:

  1. Das Notizbuch wird so schwer, dass der Professor es kaum noch tragen kann (der Grafikspeicher der GPU ist voll).
  2. Das Durchblättern dauert ewig. Jedes Mal, wenn der Professor ein neues Wort sagen will, muss er das gesamte Notizbuch von der ersten Seite bis zur letzten Seite durchblättern, um zu prüfen, was wichtig war. Das macht ihn extrem langsam.

Bisherige Lösungen haben versucht, einfach Seiten aus dem Notizbuch zu reißen, um Gewicht zu sparen. Das Problem: Der Professor vergisst dadurch wichtige Details und fängt an zu halluzinieren (er macht Fehler).


Die Lösung: RetroInfer – Der „Super-Bibliothekar“

Die Forscher haben RetroInfer entwickelt. Man kann sich RetroInfer wie ein Team aus einem genialen Bibliothekar und einem extrem schnellen Assistenten vorstellen.

1. Der Wave-Index (Der schlaue Bibliothekar)

Anstatt das Notizbuch einfach nur wahllos zu kürzen, nutzt der Bibliothekar einen cleveren Index (den Wave-Index). Er teilt die Informationen in drei Zonen ein:

  • Die „Gold-Zone“ (Steady Zone): Das sind die allerwichtigsten Dinge, die ganz am Anfang oder ganz am Ende des Gesprächs standen. Die liegen immer griffbereit auf dem Schreibtisch.
  • Die „Such-Zone“ (Retrieval Zone): Der Bibliothekar hat die restlichen Informationen in kleine, thematische Kisten sortiert (Cluster). Wenn der Professor eine Frage stellt, schaut der Bibliothekar blitzschnell: „Ah, es geht um Quantenphysik! Ich hole nur die Kisten mit Physik-Notizen aus dem Keller.“ Er holt also nur einen Bruchteil der Daten, aber genau die richtigen.
  • Die „Schätz-Zone“ (Estimation Zone): Für die Kisten, die er nicht direkt holt, macht er eine intelligente Schätzung. Er sagt: „Ich habe die Physik-Kiste nicht vor mir, aber ich weiß, dass sie im Durchschnitt so etwas wie das besagt.“ Das ist viel schneller, als die ganze Kiste auszupacken, und es ist trotzdem fast so genau wie das echte Nachlesen.

2. Der Wave-Buffer (Der blitzschnelle Assistent)

Damit der Professor nicht warten muss, während der Bibliothekar im Keller (dem CPU-Speicher) sucht, gibt es den Wave-Buffer. Das ist ein Assistent, der ständig vorausplant. Er hat ein kleines Zwischenlager direkt auf dem Schreibtisch (dem GPU-Speicher). Er weiß schon vorher, welche Kisten der Bibliothekar gleich brauchen wird, und schiebt sie schon mal bereit, noch während der Professor das aktuelle Wort ausspricht.


Warum ist das revolutionär? (Das Ergebnis)

Durch dieses System erreicht RetroInfer zwei Dinge gleichzeitig, die vorher unmöglich schienen:

  1. Enorme Geschwindigkeit: Die KI kann viel schneller antworten (bis zu 12-mal schneller als bisherige Methoden bei extrem langen Texten), weil sie nicht mehr das ganze „Notizbuch“ durchblättern muss.
  2. Perfektes Gedächtnis: Trotz der Abkürzungen macht die KI kaum Fehler. Sie ist fast genauso präzise wie eine KI, die mühsam jedes einzelne Wort im riesigen Notizbuch nachschlägt.

Zusammenfassend: RetroInfer macht aus einem überforderten Professor mit einem unhandlichen Notizbuch einen hochkonzentrierten Experten mit einem perfekt organisierten Archiv. So können KIs nun ganze Bücher oder riesige Datenbanken „lesen“, ohne dabei in Zeitnot zu geraten oder den Faden zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →