Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding
Dieses Paper identifiziert das „katastrophale Erinnern“ als die Ursache für das unbegrenzte Wachstum in agentischen Coding-Prompts wie CLAUDE.md, indem es demonstriert, dass das Anhängen von Instruktionen kostengünstig ist, während das Löschen derselben rechnerisch prohibitiv ist, und schlägt vor, dass das Einbetten latenter Argumentation in Prompt-Kommentaren dieses Divergieren effektiv stoppen und die Befolgung von Instruktionen signifikant verbessern kann.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bringen einem sehr intelligenten, aber etwas vergesslichen Roboterassistenten eine spezifische Aufgabe bei, wie zum Beispiel das Schreiben von Blogposts oder das Reparieren von Code. Sie beginnen damit, ihm eine einfache Liste von Regeln zu geben: „Verwende drei Absätze“, „Benutze nicht das Wort ‚sehr‘“ und „Beende immer mit einem Lächeln“. Dies nennt man einen Prompt. In der Welt der künstlichen Intelligenz sind diese Prompts wie die Bedienungsanleitungen für Roboter.
Stellen Sie sich nun vor, der Roboter macht einen Fehler. Sie korrigieren ihn, indem Sie eine neue Regel hinzufügen: „Okay, und stelle sicher, dass du genau fünf Aufzählungspunkte verwendest.“ Der Roboter versucht es erneut, scheitert jedoch, und Sie fügen eine weitere Regel hinzu: „Und denke daran, den ersten Buchstaben jedes Satzes großzuschreiben.“ Mit der Zeit wird diese Liste der Regeln immer länger und länger. In der Informatik gibt es ein berühmtes Problem namens katastrophales Vergessen (catastrophic forgetting), bei dem ein Roboter etwas Neues lernt und dabei versehentlich sein Gedächtnis über die alten Dinge löscht. Diese Arbeit spricht jedoch über das gegenteilige Problem: katastrophales Erinnern (catastrophic remembering). Dies ist der Fall, wenn ein Roboter (oder der Mensch, der ihn verwaltet) ständig Regeln hinzufügt, aber die alten nie löscht, selbst wenn sie nicht mehr benötigt werden. Die Liste wird so riesig und chaotisch, dass der Roboter verwirrt wird, langsamer wird und wieder Fehler macht. Die große Frage ist: Warum wächst diese Liste ewig weiter, und wie stoppen wir das?
Das Rätsel der niemals endenden Liste
Der Autor dieser Arbeit, Kushal Chakrabarti von South Park Commons, beschloss zu untersuchen, warum diese „agentischen“ Anweisungslisten (Dateien, die in Softwareprojekten oft CLUTE.md oder AGENTS.md heißen) scheinbar unbegrenzt wachsen. Er untersuchte fast 1.870 reale Softwareprojekte auf GitHub und verfolgte die Lebenszyklen von über 247.000 einzelnen Anweisungen.
Er fand ein seltsames Muster: Diese Listen schrumpfen fast nie. Stattdessen wachsen sie im Durchschnitt um 4,9 neue Anweisungen für jede einzelne Aktualisierung der Datei. Im Laufe des Lebens einer Datei verdreifacht sich die Anzahl der Anweisungen mehr als; sie wächst um 226 %. Die durchschnittliche Datei endet mit 39 Anweisungen, einige haben jedoch über 100.
Die Forscher fragten sich: Warum löschen die Leute nicht einfach die alten, nutzlosen Regeln?
Sie fanden heraus, dass die Ursache nicht darin liegt, dass die Regeln „veraltet“ (stale) sind oder dass schlechte Regeln früh sterben. Stattdessen ist das Problem die unvollkommene Erinnerung (imperfect recall). Stellen Sie es sich so vor: Wenn Sie eine neue Regel zur Liste hinzufügen, wissen Sie, warum Sie sie hinzugefügt haben. Vielleicht haben Sie „Verwende drei Absätze“ hinzugefügt, weil der Roboter ständig vier schrieb. Aber dieses „Warum“ ist nur ein Gedanke in Ihrem Kopf. Es ist nicht aufgeschrieben.
Im Laufe der Zeit, wenn andere Personen die Datei bearbeiten oder sich das Projekt ändert, verblasst dieser ursprüngliche Grund. Wenn Sie sechs Monate später auf die Liste schauen, sehen Sie die Regel „Verwende drei Absätze“, aber Sie haben keine Ahnung, warum sie da ist. War es, weil der Roboter zu geschwätzig war? War es, weil der Chef es so wollte? Oh\ne ohne diesen Grund fühlt sich das Löschen der Regel riskant an. Sie haben Angst, dass der Roboter wieder kaputtgeht, wenn Sie die Regel löschen. Also lassen Sie sie dort. Währenddessen fügen Sie für neue Probleme immer wieder neue Regeln hinzu. Das Ergebnis ist eine aufgeblähte, verwirrende Liste von Regeln, die niemand mehr versteht. Der Autor nennt dies katastrophales Erinnern: alles aufzubewahren, was man eigentlich hätte vergessen sollen.
Der „Bulldozer“-Effekt
Die Studie fand auch etwas Lustiges darüber heraus, wie Menschen versuchen, diese chaotischen Listen zu korrigieren. Sie löschen selten nur ein oder zwei schlechte Regeln. Stattdessen drücken sie oft den Button „Alle löschen“. Die Daten zeigten, dass 76,8 % aller Löschungen von Anweisungen in einem einzigen riesigen „Umschreiben“ geschehen, bei dem jemand die Hälfte oder mehr der Datei auf einmal löscht. Es ist wie ein Gärtner, der sich nicht entscheiden kann, welche Unkräuter er zupfen soll, also verbrennt er einfach den ganzen Garten und fängt von vorne an.
Aber hier kommt der Clou: Selbst nachdem dieses „Verbrennen“ stattgefunden hat, wächst der Garten wieder nach. Die Liste beginnt sofort wieder mit demsem gleichen schnellen Tempo zu wachsen wie zuvor. Dies wird als Ratschen-Effekt (ratchet effect) bezeichnet. Die Größe sinkt, aber die Wachstumsrate ändert sich nicht. Die eigentliche Ursache – die Tatsache, dass die Menschen nicht mehr wissen, warum die Regeln ursprünglich hinzugefügt wurden – wurde nie behoben, sodass sich die Liste einfach wieder füllt.
Die Magie der „Kommentare“
Wie also verhindern wir, dass die Liste ewig weiterwächst? Die Arbeit schlägt eine Lösung vor, die Softwareentwickler seit Jahrzehnten anwenden: Kommentare.
In regulärem Computercode schreiben Programmierer kleine Notizen neben ihren Code, um zu erklären, warum sie ihn so geschrieben haben. Diese Notizen sind für den Computer unsichtbar, aber hilfreich für den nächsten Menschen, der den Code liest. Die Forscher testeten, ob dieser Trick auch für KI-Prompts funktioniert.
Sie richteten eine Simulation ein, in der „Maintainer“ (KI-Agenten) einen Prompt aufbauen und reparieren mussten. In einer Gruppe mussten sie Anweisungen ohne jegliche Notizen schreiben. In der anderen Gruppe durften sie einen Kommentar neben jede Anweisung setzen, der den Grund erklärt. Zum Beispiel könnte neben „Verwende drei Absätze“ der Kommentar stehen: „Hinzugefügt, weil der Roboter in Runde 3 ständig vier Absätze schrieb.“
Die Ergebnisse waren dramatisch.
- Ohne Kommentare: Der Prompt wurde um 211,3 % größer als die perfekte, minimale Größe, die für die Aufgabe nötig wäre.
- Mit Kommentaren: Der Prompt blieb fast perfekt dimensioniert und wuchs nur um 1,4 % über das Minimum hinaus.
Die Kommentare wirkten wie eine Zeitmaschine. Sie bewahrten das „latente Denken“ (den verborgenen Grund) für jede Regel. Wenn ein Maintainer später auf die Liste blickte, konnte er den Kommentar lesen, verstehen, dass die Regel noch benötigt wurde, oder erkennen, dass sie nicht mehr notwendig war, und sie sicher löschen. Die Kommentare entfernten 99,3 % der überschüssigen, unnötigen Anweisungen.
Funktioniert es tatsächlich besser?
Die Forscher blieben nicht nur dabei, die Listen kürzer zu machen; sie prüften auch, ob die Roboter tatsächlich eine bessere Arbeit leisteten. Sie fanden heraus, dass Roboter, wenn Prompts mit nutzlosen, verrauschten Anweisungen aufgebläht waren, verwirrt wurden und mehr Fehler machten. Durch die Verwendung von Kommentaren, um die Liste sauber und fokussiert zu halten, verbesserte sich die Fähigkeit der Roboter, Anweisungen zu befolgen, um bis zu 23,1 %.
Die Studie zeigte auch, dass dies selbst dann funktioniert, wenn die Anweisungen komplex sind und die „Maintainer“ sehr intelligente KI-Agenten sind. Je leistungsfähiger die KI ist, desto eher neigt sie dazu, übermäßig viele Regeln hinzuzufügen, aber desto mehr profitiert sie auch von den hilfreichen Kommentaren, um dies unter Kontrolle zu halten.
Das Wichtigste in Kürze
Das Paper schließt mit einer spielerischen, aber ernsten Frage: „Wenn Englisch der neue Code ist, warum haben wir dann noch keine Kommentare?“
Genau wie menschliche Programmierer schon vor langer Zeit lernten, dass man erklären muss, warum man eine Zeile Code geschrieben hat, müssen auch die Menschen (und KI-Agenten), die diese KI-Prompts verwalten, damit beginnen, aufzuschreiben, warum sie eine Regel hinzugefügt haben. Ohne diese Erklärung häufen sich die Regeln an, das System wird verwirrt und die Leistung sinkt. Die Lösung besteht nicht darin, das Hinzufügen von Regeln zu stoppen; sondern darin, eine kleine Notiz neben jede Regel zu schreiben, damit der nächste Mensch (oder Roboter) genau weiß, was er behalten und was er wegwerfen kann. Dies verwandelt ein chaotisches, wachsendes Monster in ein sauberes, effizientes Werkzeug.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.