← Neueste Arbeiten
💬 NLP

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

Das Papier schlägt Agentic Plan Caching (APC) vor, ein neuartiges Test-Time-Speichersystem, das strukturierte Planvorlagen aus vorherigen Agenten-Ausführungen extrahiert, adaptiert und wiederverwendet, um die Kosten und die Latenz von LLM-basierten Agenten signifikant zu reduzieren, während die Performance beibehalten wird.

Ursprüngliche Autoren: Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

Veröffentlicht 2026-01-28
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein hochqualifizierter, aber sehr teurer persönlicher Assistent (der KI-Agent), der Ihnen hilft, komplexe Probleme zu lösen, wie etwa das Analysieren von Finanzberichten oder das Navigieren auf einer Website.

Jedes Mal, wenn Sie diesen Assistenten eine Frage stellen, gibt er Ihnen nicht sofort eine Antwort. Stattdessen durchläuft er einen zweistufigen Prozess:

  1. Planung: Er denkt intensiv darüber nach, wie er das Problem lösen soll (z. B. „Zuerst muss ich die Gesamtaktiva finden, dann die Verbindlichkeiten...“). Dieser Schritt verbraucht viel seiner Rechenleistung und kostet viel Geld.
  2. Handeln: Er führt die Arbeit basierend auf diesem Plan tatsächlich aus.

Das Problem: Geldverschwendung durch „Nachdenken“

Das Paper weist auf eine große Ineffizienz hin: Selbst wenn Sie eine leicht andere Frage stellen (z. B. „Was ist die Kennzahl für Unternehmen A?“ vs. „Was ist die Kennzahl für Unternehmen B?“), überlegt der Assistent oft die gesamte Strategie von Grund auf neu (er „denkt“ neu). Er ignoriert die Tatsache, dass der „Denkprozess“ (der Plan) für beide Aufgaben fast identisch ist. Er tauscht lediglich den Namen des Unternehmens aus.

Bestehende Methoden zur Kostenersparnis (wie „Semantic Caching“) sind wie ein Bibliothekar, der sich nur an exakte Buchtitel erinnert. Wenn Sie nach „Der Große Gatsby“ fragen, findet er ihn. Aber wenn Sie nach „Dem Buch über das grüne Licht“ fragen, erkennt er es vielleicht nicht, oder wenn Sie nach „Der Große Gatsby (Ausgabe 2024)“ fragen, denkt er, es sei ein völlig anderes Buch. Sie sind zu starr für diese komplexen, variierenden Aufgaben.

Die Lösung: Agentic Plan Caching (APC)

Die Autoren schlagen ein neues System namens Agentic Plan Caching (APC) vor. Stellen Sie sich das wie das Geben eines „Rezeptbuchs“ an Ihren Assistenten vor, anstatt nur ein Gedächtnis für vergangene Gespräche.

So funktioniert es, unter Verwendung einer Koch-Analogie:

  1. Die „Rezept“-Extraktion (Das Geheimnis des Chefs):
    Wenn Ihr Assistent ein Problem erfolgreich löst (wie die Berechnung einer Finanzkennzahl), speichert das System nicht einfach nur die fertige Antwort. Es analysiert die Schritte, die der Assistent unternommen hat, und entfernt die spezifischen Details (wie „Costco“ oder „2019“).

    • Originaler Plan: „Finde die kurzfristigen Gesamtaktiva für Costco im Jahr 2019.“
    • Gespeichertes „Rezept“ (Vorlage): „Finde die kurzfristigen Gesamtaktiva für [Unternehmensname] im Jahr [Jahr].“
  2. Die „Schlüsselwort“-Suche:
    Wenn Sie eine neue Frage stellen, versucht das System nicht, den ganzen Satz abzugleichen. Stattdessen extrahiert ein kleiner, günstiger Helfer (ein „leichtgewichtiges Modell“) das Schlüsselwort oder das Hauptziel, wie zum Beispiel „Working Capital Ratio“. Es nutzt dieses Schlüsselwort, um im Rezeptbuch nach dem richtigen „Rezept“ zu suchen.

  3. Die „Anpassung“:
    Wenn das System ein passendes Rezept findet, ruft es nicht den teuren, superintelligenten Assistenten erneut auf, um erneut nachzudenken. Stattdessen nimmt es das gespeicherte „Rezept“, und ein kleiner, günstiger Assistent füllt die Lücken mit Ihren spezifischen Details aus (z. B. indem er „Costco“ durch „Walmart“ ersetzt).

    • Ergebnis: Sie erhalten einen maßgeschneiderten Plan sofort, ohne für den teuren „Denkprozess“ zu bezahlen.

Warum dies besser ist

Das Paper hat dieses System bei fünf verschiedenen Arten von realen Aufgaben getestet (wie Finanzanalysen und mathematische Probleme) und stellte fest:

  • Es ist günstiger: Es senkte die Kosten für den Betrieb dieser Agenten um etwa 50 %. Sie hören auf, jedes Mal für das teure „Nachdenken“ zu bezahlen.
  • Es ist schneller: Es reduzierte die Wartezeit um etwa 27 %.
  • Es ist genau: Es hat den Assistenten nicht „dümmer“ gemacht. Die Ergebnisse waren zu 96,6 % so gut, als hätte der Assistent jedes Problem von Grund auf neu durchdacht.

Die „Cold Start“-Falle

Das Paper weist auch auf eine Einschränkung hin: Wenn Sie dieses System zum ersten Mal verwenden, ist das „Rezeptbuch“ leer. Der Assistent muss die ersten Aufgaben noch einmal mit dem teuren Denkvorgor von Grund auf erledigen, um die Rezepte aufzuschreiben. Dies wird als „Cold Start“ bezeichnet. Sobald das Buch jedoch mit Rezepten gefüllt ist, wird das System unglaublich effizient.

Zusammenfassung

Kurz gesagt: Agentic Plan Caching ist wie das Beibringen an eine KI, das Rad nicht ständig neu zu erfinden. Anstatt einen Genie zu fragen, jedes Mal ein neues Auto zu entwerfen, wenn Sie zum Einkaufen fahren wollen, geben Sie ihm einen Standard-Auto-Bauplan (den Plan) und sagen ihm nur, dass er die Farbe ändern soll (den Kontext). Dies spart eine enorme Menge an Zeit und Geld, während Sie dennoch sicher ans Ziel kommen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →