Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail
Diese Arbeit zeigt auf, dass Agenten auf Basis kleiner Sprachmodelle signifikant wahrscheinlicher fehlerhafte Tool-Aufrufe wiederholen, wenn der Fehler wortwörtlich im Transkript festgehalten wird, ein kontraproduktiver Effekt, der primär durch die Oberflächenform der fehlgeschlagenen Aktion als vielmehr durch die Fehlermeldung selbst getrieben wird, was durch das Ersetzen des rohen Aufrufs durch eine zur Laufzeit generierte Beschreibung des Fehlers effektiv gemildert werden kann.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich einen digitalen Assistenten vor, der Werkzeuge nutzen kann, um Probleme zu lösen, wie etwa das Nachschlagen eines Kontakts, das Überprüfen eines Kalenders oder das Schreiben eines Stücks Code. Um dies zu tun, folgt der Assistent einer einfachen Schleife: Er denkt sich eine Aktion aus, versucht, sie auszuführen, und liagt dann das Ergebnis ab. Wenn die Aktion fehlschlägt, zeichnet das System genau auf, was der Assistent versucht hat und welche Fehlermeldung er erhalten hat, und bittet den Assistenten dann, es erneut zu versuchen. Diese Methode, bekannt als Agenten-Schleife (Agent Loop), ist der Standardweg, wie diese Systeme aus ihren Fehlern lernen. Die Logik scheint fundiert zu sein: Wenn man einer Person sagt: „Du hast versucht, eine verschlossene Tür zu öffnen, und es hat nicht funktioniert“, wird sie nicht versuchen, dieselbe verschlossene Tür erneut zu öffnen. Sie wird nach einem anderen Schlüssel oder einer anderen Tür suchen. Jahrelang gingen Ingenieure davon aus, dass kleine Computermodelle, die viele dieser Assistenten antreiben, sich genauso verhalten würden. Sie glaubten, dass das Zeigen der Fehlermeldung an das Modell es lehren würde, diesen spezifischen Fehler zu vermeiden.
Ein Forscher an der Universität Passau in Deutschland beschloss, diese Annahme mit extremer Präzision zu testen. Er beobachtete die Assistenten nicht nur dabei, wie sie scheiterten oder Erfolg hatten; er maß die exakte mathematische Wahrscheinlichkeit, mit der das Modell dieselbe falsche Aktion wählte, bevor und nachdem es die Fehlermeldung sah. Er führte diese Tests an sechs verschiedenen kleinen Computermodellen durch, die von sehr winzig bis moderat groß reichten, in zwei verschiedenen Umgebungen: einer, in der die Modelle versuchten, simulierte Büro-Werkzeuge zu nutzen, und einer anderen, in der sie versuchten, defekte Computerprogramme zu reparieren. Der Forscher wollte wissen, ob die Fehlermeldung das Verhalten des Modells tatsächlich korrigierte.
Was er fand, war das Gegenteil dessen, was alle erwarteten. Anstatt aus dem Fehler zu lernen, wurde es die Modelle signifikant wahrscheinlicher, genau denselben Fehler zu wiederholen. Wenn das System dem Modell den gescheiterten Versuch und die Fehlermeldung zeigte, sprang die interne Wahrscheinlichkeit des Modells, dieselbe gescheiterte Aktion erneut zu wählen, dramatisch an. In den Tests zum Aufrufen von Werkzeugen stieg die Chance, dass das Modell den gescheiterten Aufruf wiederholte, von einem niedrigen Wert von sechs Prozent auf über fünfzig Prozent. In fast jedem einzelnen Fall, den der Forscher testete, wirkte die Fehlermeldung nicht wie eine Warnung, sondern wie ein Magnet, der das Modell zurück zu genau der Aktion zog, die es gerade eben noch nicht erfolgreich ausgeführt hatte.
Der Forscher fragte sich dann, warum dies geschah. Er vermutete, dass die Modelle möglicherweise einfach zu klein seien, um die Fehlermeldung zu verstehen. Seine Untersuchung ergab jedoch einen anderen Übeltäter. Er entdeckte, dass das Problem nicht die Bedeutung des Fehlers war, sondern die Anwesenheit des Textes selbst. Als die gescheiterte Aktion in das Protokoll geschrieben wurde, klammerte sich die interne Mechanik des Modells, die darauf ausgelegt ist, gesehenen Mustern zu kopieren, an den Text der gescheiterten Aktion. Dieser Kopier-Effekt war so stark, dass er die eigentliche Nachricht über den Fehler überlagerte. Selbst als der Forscher die lange, detaillierte Fehlermeldung durch einen einfachen Hinweis ersetzte, der besagte, dass „dies fehlschlug“, wiederholte das Modell den Fehler dennoch. Aber als er den Text der gescheiterten Aktion vollständig entfernte und durch eine Beschreibung dessen ersetzte, was schiefgelaufen war, hörte das Modell auf, den Fehler zu wiederholen.
Dieser Befund stellte die Standardweise, wie diese Systeme aufgebaut werden, auf den Kopf. Der gängige Rat zur Behebung eines festgefahrenen Agenten bestand darin, den gescheiterten Versuch aus dem Verlauf zu löschen und das Modell neu starten zu lassen, in der Hoffnung, die „Kontamination“ zu bereinieren. Der Forscher fand heraus, dass dies tatsächlich das Schlechteste war, was man tun konnte. Durch das Löschen des Fehlers stellte das System exakt die Bedingungen wieder her, die den Fehler verursacht hatten, was garantierte, dass das Modell denselben Fehler erneut begehen würde. Die Lösung bestand laut seiner Entdeckung nicht darin, den Verlauf zu löschen, sondern ihn zu verändern. Wenn das System die Aufzeichnung des Fehlers behielt, aber den rohen Text des gescheiterten Befehls durch eine vom System generierte Beschreibung ersetzte, stoppte die Wiederholung.
Die Studie testete auch eine offensichtlichere Lösung: dem Modell in seinen Anweisungen einfach vorzugeben, die gescheiterte Aktion nicht zu wiederholen. Dieser Ansatz, der für einen Menschen logisch klingt, hatte fast keine Wirkung. Das Modell konnte einer Regel, die es anwies, einen spezifischen Textstring zu ignorieren, der direkt vor ihm lag, kaum folgen. Der Forscher kam zu dem Schluss, dass das Problem nicht ein Mangel an Intelligenz des Modells war, sondern ein Fehler in der Art und Weise, wie die Informationen präsentiert wurden. Die Standardmethode, die gescheiterte Aktion zusammen mit der Fehlermeldung anzuzeigen, erzeugt einen starken Drang zum Kopieren, der stärker ist als der Drang, aus dem Fehler zu lernen.
Durch die Durchführung dieser Experimente auf einem Standard-Prozessor ohne spezialisierte Grafikkarten bewies der Forscher, dass dieses Verhalten eine fundamentale Eigenschaft der Funktionsweise dieser kleinen Modelle ist und kein Fehler, der durch massive Rechenleistung behoben werden muss. Seine Arbeit legt nahe, dass Ingenieure, um zuverlässige digitale Assistenten zu bauen, aufhören müssen, die gescheiterte Aktion als eine hilfreiche Lektion zu behandeln, die man lesen kann, und statfangen müssen, sie als ein gefährliches Muster zu behandten, das verborgen werden muss. Die Lösung ist struktureller Natur: Der Kontext nach einem Fehler muss anders aussehen als der Kontext vor dem Fehler, aber der Unterschied darf nicht die gescheiterte Aktion selbst sein. Indem man den rohen Text des Fehlers entfernt und nur die Diagnose beibehält, kann das System den Kreislauf der Wiederholung durchbrechen und es dem Modell ermöglichen, tatsächlich voranzukommen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.