← Neueste Arbeiten
💬 NLP

AgentIR: A Workload-Adaptive Cascade Retrieval Substrate for Long-Term Conversational Memory

AgentIR führt eine lastadaptive Kaskaden-Abfrage-Infrastruktur für langfristige konversationelle Erinnerung ein, die auf Basis von Konfidenzschwellenwerten teure dichte Abfragen dynamisch überspringt und einen zeitpartitionierten Index nutzt, um eine Latenz unter 10 ms und eine bis zu 132-fache Beschleunigung zu erreichen, während die Abfragegenauigkeit über diverse Benchmarks hinweg erhalten bleibt oder verbessert wird.

Ursprüngliche Autoren: Aojie Yuan, Haiyue Zhang, Shahin Nazarian

Veröffentlicht 2026-05-26
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Aojie Yuan, Haiyue Zhang, Shahin Nazarian

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Ein intelligenter Bibliothekar für KI-Agenten

Stellen Sie sich vor, Sie haben einen sehr intelligenten KI-Assistenten (einen „Agenten"), der Ihnen über Monate oder sogar Jahre hinweg hilft. Im Laufe der Zeit sammelt dieser Agent ein massives Tagebuch aus Gesprächen, Werkzeugnutzungen und Plänen an – Millionen von Seiten Notizen.

Jedes Mal, wenn der Agent einen Schritt unternimmt, um ein Problem zu lösen, muss er dieses Tagebuch durchsuchen, um die richtigen Informationen zu finden. Wenn der Agent 20 Schritte unternimmt, muss er dieses Tagebuch 20 Mal hintereinander durchsuchen. Wenn die Suche auch nur einen Bruchteil einer Sekunde zu lange dauert, wirkt das gesamte Gespräch für den menschlichen Benutzer „festgefahren" oder langsam.

Das Problem? Die Werkzeuge, die wir normalerweise zum Durchsuchen von Bibliotheken verwenden (wie Standard-Suchmaschinen), wurden entwickelt, um das gesamte Internet zu durchsuchen, nicht um ein einzelnes, ständig wachsendes Tagebuch zu durchsuchen, in dem die wichtigsten Notizen meist die sind, die gerade eben geschrieben wurden.

AgentIR ist eine neue, spezialisierte Suchmaschine, die speziell für diese KI-Agenten entwickelt wurde. Sie ist schneller, intelligenter darin, was durchsucht werden soll, und skaliert hoch, ohne langsamer zu werden.


1. Die „Zeitreise"-Regale (Temporale Partitionierung)

Das Problem: Stellen Sie sich eine Bibliothek vor, in der jede Sekunde neue Bücher hinzugefügt werden. Wenn Sie nach einem Buch fragen, muss ein Standard-Bibliothekar möglicherweise die Regale vom ältesten bis zum neuesten Buch einzeln durchsuchen. Wenn die Bibliothek auf Millionen von Büchern wächst, wird diese Suche immer langsamer.

Die AgentIR-Lösung: AgentIR organisiert die Bibliothek anders. Anstatt einer riesigen Reihe von Büchern werden diese auf Regalen platziert, basierend darauf, wann sie geschrieben wurden.

  • Die Analogie: Denken Sie daran wie an eine „Zeitreise"-Bibliothek. Die neuesten Bücher befinden sich auf einem speziellen, leicht erreichbaren Regal ganz vorne. Ältere Bücher werden weiter nach hinten geschoben.
  • Wie es funktioniert: Da KI-Agenten normalerweise Informationen aus aktuellen Gesprächen benötigen (wie „was haben wir gerade repariert?"), schaut das System zuerst nur auf die vorderen Regale. Wenn es dort die Antwort findet, stoppt es sofort. Es verschwendet keine Zeit damit, die staubigen hinteren Regale zu überprüfen.
  • Das Ergebnis: Selbst wenn die Bibliothek 1.000-mal größer wird, erhöht sich die Suchzeit kaum. Es ist wie das Finden einer Nadel im Heuhaufen, aber die Nadel befindet sich immer in den obersten 1 % des Heus.

2. Die „Zwei-Werkzeug"-Strategie (Hybride Suche)

Das Problem: Manchmal müssen Sie nach exakten Wörtern suchen (wie beim Finden eines spezifischen Fehlercodes), und manchmal müssen Sie nach der Bedeutung suchen (wie beim Finden eines Gesprächs über „Reparieren eines Bugs", selbst wenn das Wort „Bug" nicht verwendet wurde).

  • Werkzeug A (BM25): Großartig bei der exakten Wortübereinstimmung, super schnell.
  • Werkzeug B (Dense/Vector): Großartig beim Verstehen von Bedeutung, aber langsam und schwerfällig.

Die AgentIR-Lösung: AgentIR zwingt Sie nicht, beide Werkzeuge für jede einzelne Frage zu verwenden. Es fungiert wie ein intelligenter Verkehrspolizist.

  • Die Analogie: Stellen Sie sich vor, Sie suchen in einem Geschäft nach einem bestimmten Artikel.
    • Wenn Sie fragen: „Wo ist der rote Hammer?", weiß das System, dass Sie nur die „Hammer"-Gasse (Werkzeug A) durchsuchen müssen. Es überspringt den teuren, langsamen „Bedeutungs"-Scanner.
    • Wenn Sie fragen: „Wo ist das Ding, das das quietschende Türscharnier repariert?", weiß das System, dass es den „Bedeutungs"-Scanner (Werkzeug B) benötigt, um das Konzept zu verstehen.
  • Die Kaskade: Das System versucht zuerst das schnelle Werkzeug. Wenn das schnelle Werkzeug sehr zuversichtlich ist, dass es die Antwort gefunden hat, stoppt es dort. Wenn es unsicher ist, ruft es dann das langsame, schwere Werkzeug hinzu. Dies spart eine enorme Menge an Zeit.

3. Die „Gestaltwandel"-Strategie (Arbeitslast-adaptiv)

Das Problem: Unterschiedliche Fragetypen erfordern unterschiedliche Suchstrategien.

  • Bei einem Datensatz (LongMemEval) funktionierte die Mischung aus Wort- und Bedeutungsübereinstimmung am besten.
  • Bei einem anderen Datensatz (LoCoMo) war nur die Wortübereinstimmung tatsächlich besser und schneller.
  • Alte Systeme zwingen Sie, eine Strategie auszuwählen und sich für immer daran zu halten.

Die AgentIR-Lösung: AgentIR ist ein „Chamäleon". Es hat einen winzigen, schnellen Klassifizierer (einen Entscheider), der Ihre Frage betrachtet und sagt: „Ah, das ist eine 'Zeit'-Frage, lassen Sie uns Strategie A verwenden", oder „Das ist eine 'Fakten'-Frage, lassen Sie uns Strategie B verwenden."

  • Das Ergebnis: Es passt sich automatisch an. Bei einem Test übersprang es das langsame Werkzeug in 63 % der Fälle. Bei einem anderen Test übersprang es es in 100 % der Fälle, weil das schnelle Werkzeug perfekt war. Es passt sich an die jeweilige Aufgabe an, ohne neu trainiert werden zu müssen.

4. Der „Super-Speed"-Motor (GPU- und CPU-Optimierung)

Das Problem: Diese Suchen auf Standard-Prozessoren (CPUs) durchzuführen, ist schnell, aber sie auf leistungsstarke Grafikkarten (GPUs) zu verlagern, ist normalerweise schwierig, da die Mathematik nicht perfekt übereinstimmt. Außerdem haben Standard-Suchmaschinen oft versteckte Fehler, die sie etwas ungenauer machen, wenn man versucht, sie zu beschleunigen.

Die AgentIR-Lösung:

  • Der Motor: Sie haben eine benutzerdefinierte Engine gebaut, die sowohl auf CPUs als auch auf GPUs perfekt läuft.
  • Die „Fehlerbehebung": Die Autoren fanden drei subtile „Fehler", die oft auftreten, wenn Menschen versuchen, Suchmaschinen zu beschleunigen (wie das falsche Normalisieren von Zahlen oder das Vergessen, Speicher zu löschen). Diese Fehler machen Suchergebnisse um das 6- bis 8-fache schlechter, ohne dass es jemand bemerkt. AgentIR hat diese behoben und stellt sicher, dass die superschnelle GPU-Version exakt dieselben korrekten Antworten liefert wie die langsamere CPU-Version.
  • Das Ergebnis: Sie erreichten Geschwindigkeiten von bis zu 132-mal schneller als Standard-Systeme bei bestimmten Aufgaben, wobei die Genauigkeit exakt gleich blieb.

Zusammenfassung der Ergebnisse

  • Geschwindigkeit: Es kann Millionen von Datensätzen verarbeiten und antwortet dennoch für aktuelle Daten in unter 100 Mikrosekunden (das ist 1/10.000stel einer Sekunde).
  • Effizienz: Es kann 8 verschiedene KI-Agenten gleichzeitig auf einem einzigen Computer bedienen, ohne langsamer zu werden.
  • Genauigkeit: Es entspricht oder übertrifft die besten existierenden Suchmaschinen (wie Lucene) beim Finden der richtigen Antworten, tut dies jedoch viel schneller.
  • Kosten: Da es so schnell und effizient ist, kostet es nur einen winzigen Bruchteil dessen, was kommerzielle Cloud-Suchdienste verlangen.

Kurz gesagt: AgentIR ist eine spezialisierte, Hochgeschwindigkeits-Suchmaschine, die weiß, wann sie aktuelle Notizen durchsuchen muss, wann sie einfache Wortübereinstimmungen verwendet und wann sie die schwere Arbeit ganz überspringt, um sicherzustellen, dass KI-Agenten schnell und reaktionsschnell bleiben, selbst wenn ihre Erinnerungen riesig werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →