← Neueste Arbeiten
🤖 AI

The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory

Dieses Paper stellt EARM vor, ein erfahrungsamortisiertes Reranking-Framework, das durch kausale Matrixvervollständigung lernt, zuvor erworbene LLM-Relevanzscores wiederzuverwenden, um die Genauigkeit der Langzeitgedächtnis-Abfrage von Agenten signifikant zu verbessern und gleichzeitig den Inferenzaufwand erheblich zu reduzieren.

Ursprüngliche Autoren: Qi Feng, Chris Ding, Jicong Fan

Veröffentlicht 2026-08-25
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Qi Feng, Chris Ding, Jicong Fan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Gespräch vor, das sich über Monate oder Jahre erstreckt, in dem eine Person Fragen zu Ereignissen stellt, die lange zurückliegen, oder Fakten zusammenfügt, die über Dutzende früherer Austauschrunden verstreut sind. Für ein Computerprogramm, das als hilfreicher Assistent fungieren soll, ist die Verfolgung dieser gewaltigen Historie eine monumentale Aufgabe. Diese Programme, oft als Agenten bezeichnet, speichern ihre vergangenen Interaktionen in einer externen Bibliothek von Erinnerungen. Das Besitzen einer Bibliothek ist jedoch nicht dasselbe wie das Wissen darüber, wie man das richtige Buch findet. Wenn eine neue Frage eintrifft, muss das System Tausende von gespeicherten Erinnerungen schnell durchsuchen, um diejenigen zu finden, die tatsächlich nützlich sind. Traditionell nutzt das System eine schnelle, breite Suche basierend auf Wortähnlichkeit, und wenn es präziser sein muss, bittet es ein leistungsstarkes Sprachmodell, die Frage und die Kandidaten-Erinnerungen zu lesen, um deren Relevanz zu beurteilen. Doch hier liegt eine frustrierende Ineffizienz: Jedes Mal, wenn eine neue Frage gestellt wird, beginnt das System von vorn. Es vergisst die Lektionen, die es aus der letzten Suche gelernt hat, verwirft die berechneten Scores und die bemerkten Muster, als wäre es ein Schüler, der für eine Prüfung lernt, alles sofort nach der Prüfung wieder vergisst und dann für die nächste Prüfung dasselbe Material erneut lernen muss.

Forscher der Chinesischen Universität von Hongkong, Shenzhen, haben einen Weg vorgeschlagen, diesen Kreislauf des Vergessens zu durchbrechen. Sie führten ein neues Framework namens EARM ein, was „Experience-Amortized Reranking for Memory“ bedeutet. Die Kernidee ist einfach, aber tiefgreifend: Das System sollte nicht nur den Inhalt vergangener Gespräche im Gedächtnis behalten, sondern auch daran erinnern, wie es Informationen in der Vergangenheit erfolgreich gefunden hat. Anstatt die Beurteilung der Relevanz als einmalige Kosten zu betrachten, entwarfen die Forscher ein System, das diese Beurteilungen als eine Form von Erfahrung behandelt, die über die gesamte Lebensspanne des Agenten hinweg akkumuliert wird. Indem das System festhält, welche Erinnerungen für welche Arten von Fragen nützlich waren, lernt es eine Karte seines eigenen Gedächtnisses. Diese Karte ermöglicht es dem System, die Relevanz neuer Erinnerungen vorherzusagen, ohne das leistungsstarke Sprachmodell bitten zu müssen, jede einzelne zu lesen.

In ihren Experimenten testeten die Forscher diesen Ansatz auf einem Datensatz mit langen Gesprächen, die komplexe Fragen enthielten, welche den Agenten erforderten, Informationen aus verschiedenen Zeiten miteinander zu verknüpfen. Sie verglichen ihre neue Methode mit zwei Standardansätzen: einem Basissystem, das sich nur auf Wortähnlichkeit stützt, und einem leistungsstärkeren System, das das Sprachmodell bittet, jede einzelne Kandidaten-Erinnerung zu bewerten. Die Ergebnisse zeigten, dass die neue Methode, die eine Mischung aus direkter Bewertung und gelernten Vorhersagen verwendet, das Basissystem deutlich übertraf. Sie verbesserte die Genauigkeit der Antworten um bis zu 6,62 Prozent, ein erheblicher Gewinn in einem Bereich, in dem kleine Verbesserungen schwer zu erreichen sind. Vielleicht noch wichtiger ist, dass das System selbst dann hochwirksam blieb, wenn es nur erlaubt war, einen winzigen Bruchteil der Kandidaten direkt zu bewerten – nämlich gerade einmal 17,5 Prozent. In diesem spärlichen Szenario nutzte das System seine akkumulierte Erfahrung, um die Lücken zu füllen, indem es die Relevanz der verbleibenden Erinnerungen basierend auf den Mustern schätzte, die es aus früheren Interaktionen gelernt hatte.

Der Mechanismus hinter diesem Erfolg beruht auf der Idee, dass Relevanz nicht zufällig ist. Bestimmte Erinnerungen neigen dazu, für spezifische Arten von Fragen nützlich zu sein, und bestimmte Fragen neigen dazu, ähnliche Muster der Relevanz über verschiedene Erinnerungen hinweg auszulösen. Die Forscher bauten ein System, das diese Verbindungen in einer strukturierten Weise aufzeichnet. Wenn eine neue Frage eintrifft, wählt das System eine kleine, strategische Stichprobe von Erinnerungen aus, um sie direkt vom Sprachmodell bewerten zu lassen. Es nutzt dann die Historie vergangener Scores, um die Relevanz der restlichen Erinnerungen zu schätzen. Dieser Prozess ähnelt der Art und Weise, wie ein erfahrener Bibliothekar wissen könnte, dass ein Besucher, der nach einem bestimmten historischen Ereignis fragt, wahrscheinlich ein bestimmtes Set an Dokumenten benötigt, selbst wenn der Besucher diese noch nicht explizit erwähnt hat. Das System rät nicht blind; es nutzt die „Erfahrung“ vergangener Abrufe, um seine Suche zu leiten, und lernt effektiv, wie es auf seine eigene Wissensdatenbank zugreift.

Eines der bemerkenswertesten Ergebnisse war, dass das System den Großteil der Vorteile einer vollständigen, erschöpfenden Suche zurückgewinnen konnte, während es nur ein Viertel der Rechenleistung aufwand, die normalerweise nötig wäre. Bis das System genügend Fragen verarbeitet hatte, um eine robuste Historie aufzubauen, konnte es hochgenaue Entscheidungen mit sehr wenig neuem Input treffen. Die Forscher fanden heraus, dass die durch diese gelernten Schätzungen ausgewählten Erinnerungen nicht bloß Füllmaterial waren; sie fügten einen messbaren Wert hinzu, der die Qualität der endgültigen Antwort um zusätzliche 0,78 bis 2,79 Prozent über das hinaus verbesserte, was die direkt bewerteten Erinnerungen allein leisten konnten. Dies deutet darauf an, dass das System erfolgreich nützliche Informationen identifizierte, die die ursprüngliche, schnelle Suche übersehen hatte, indem es einfach die zugrunde liegende Struktur seines eigenen Gedächtnisses erkannte.

Die Studie hob auch einen Paradigmenwechsel in der Art und Weise hervor, wie wir über das Gedächtnis künstlicher Intelligenz denken könnten. Traditionell lag der Fokus darauf, mehr Informationen zu speichern oder diese besser darzustellen. Diese Arbeit legt nahe, dass ein wahrhaft langlebiger Agent auch lernen muss, wie er diese Informationen effizient abruft. Die Forscher argumentieren, dass ein Agent nicht nur Inhalte akkumulieren sollte, sondern auch Erfahrung darüber, wie diese Inhalte nützlich waren. Indem sie die Retrieval-Scores als einen dauerhaften Zustand statt als ein wegwerfbares Nebenprodukt behandeln, verwandelt das System den Akt der Suche von einer repetitiven Ausgabe in eine gelernte Fähigkeit. Dieser Ansatz ermöglicht es dem Agenten, mit der Zeit intelligenter zu werden – nicht nur dadurch, dass er mehr weiß, sondern dadurch, dass er besser darin wird, das zu finden, was er bereits weiß.

Die Forscher räumen ein, dass diese Methode auf bestimmten Bedingungen beruht, um effektiv zu funktionieren. Sie setzt voraus, dass die über die Zeit gestellten Fragen einige gemeinsame Themen oder Strukturen teilen und dass die Erinnerungen selbst stabil bleiben. Wenn jede Frage völlig unzusammenhängend mit der letzten wäre oder wenn sich die Bedeutung der gespeicherten Erinnerungen schnell ändern würde, hätte das System Schwierigkeiten, Muster zum Lernen zu finden. Doch im Kontext von langfristigen Gesprächen, in denen Nutzer oft zu ähnlichen Themen zurückkehren oder auf bisherigen Ideen aufbauen, erwies sich die Methode als robust. Das System war in der Lage, seinen Vorteil beizubehalten, selbst als die Anzahl der direkten Bewertungen sank, was zeigte, dass die akkumulierte Erfahrung ein zuverlässiger Wegweiser war.

Letztendlich bietet diese Forschung eine neue Perspektive auf die Effizienz künstlicher Intelligenz. Sie demonstriert, dass die Kosten für die intelligente Gestaltung eines Systems nicht linear mit der Menge der Informationen wachsen müssen, die es enthält. Indem sie dem System erlauben, seine eigene Suchhistorie zu erinnern, haben die Forscher gezeigt, dass es möglich ist, Agenten zu bauen, die sowohl wissensreich als auch effizient sind. Das System muss nicht jedes Mal alles von Grund auf neu bewerten; es kann auf den Schultern seiner vergangenen Entscheidungen stehen. Dieser Ansatz bringt das Feld näher an die Schaffung von Agenten heran, die wirklich über lange Zeiträume operieren können, indem sie ihr Verhalten anpassen und verfeinern, während sie mit der Welt interagieren – ganz ähnlich wie ein Mensch, der nicht nur aus seinen Erfahrungen lernt, sondern auch daraus, wie er seine eigene Geschichte navigiert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →