← Neueste Arbeiten
🤖 machine learning

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

ANNEAL ist ein neuro-symbolischer Agent, der eine sichere und dauerhafte Beseitigung wiederkehrender Ausführungsfehler gewährleistet, indem er Fehler in kontrollierte, validierte Änderungen eines symbolischen Prozesswissensgraphen umwandelt, ohne die Gewichte des Fundamentmodells zu modifizieren.

Ursprüngliche Autoren: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr intelligenten, hilfsbereiten Roboterassistenten (einen LLM-Agenten), der Hotels buchen, IT-Tickets verwalten oder Bestellungen bearbeiten kann. Manchmal macht dieser Roboter einen Fehler.

Das Problem: Die Schleife „derselbe Fehler"
Die meisten aktuellen Roboterassistenten sind wie eine Person, die vergisst, warum sie gescheitert ist. Wenn sie versuchen, mit einer Firmenkarte während eines „Blackout-Termins" ein Hotel zu buchen und abgelehnt werden, versuchen sie es möglicherweise sofort mit einer anderen Karte erneut. Wenn das funktioniert, fahren sie fort. Aber wenn Sie sie nächste Woche bitten, mit derselben Firmenkarte an denselben Daten erneut ein Hotel zu buchen, werden sie exakt denselben Fehler wiederholen. Sie haben die Regel nicht wirklich gelernt; sie hatten diesmal nur Glück. Sie scheitern weiterhin am selben zugrunde liegenden Logikfehler, weil das „Handbuch", dem sie folgen, nicht korrigiert wurde.

Die Lösung: ANNEAL (der „Regelbuch-Korrigierer")
Die Arbeit stellt ein neues System namens ANNEAL vor. Anstatt das Gehirn des Roboters neu zu trainieren (was langsam und riskant ist), agiert ANNEAL wie ein strenger Redakteur, der das Handbuch des Roboters (sein symbolisches Prozesswissen) korrigiert, sobald ein wiederkehrender Fehler auftritt.

So funktioniert ANNEAL, unter Verwendung einer kreativen Analogie:

1. Die Phase „Detektiv" (Lokalisierung)

Wenn der Roboter scheitert, sagt ANNEAL nicht einfach: „Versuchen Sie es erneut." Es agiert wie ein Detektiv. Es betrachtet das Scheitern und fragt: „Welche spezifische Regel im Handbuch hat dies verursacht?"

  • Analogie: Stellen Sie sich einen Koch vor, der einen Kuchen verbrennt. Anstatt dem Koch nur zu sagen: „Versuchen Sie es härter", zeigt ANNEAL auf den spezifischen Schritt im Rezept: „Sie haben den Kuchen bei 500 Grad in den Ofen geschoben, aber die Regel sagt 350."

2. Die Phase „Konstrukteur" (Eingeschränkte Generierung)

Sobald die schlechte Regel gefunden ist, bittet ANNEAL den Roboter, eine neue Regel zu schreiben, um sie zu beheben. Aber hier ist der Haken: Der Roboter darf kein Gedicht oder einen vagen Vorschlag schreiben. Er muss einen strengen, typisierten Code-Patch (wie eine spezifische Codezeile) schreiben, der in das bestehende Handbuch passt.

  • Analogie: Der Roboter ist wie ein junger Architekt. Er darf kein neues Gebäude einfach zeichnen; er muss eine spezifische, blau gedruckte Änderung der Grundrisspläne einreichen, wie etwa „Fügen Sie hier einen Stützbalken hinzu."

3. Die Phase „Sicherheitsrat" (Governance)

Dies ist der einzigartigste Teil. Bevor die neue Regel tatsächlich zum Handbuch hinzugefügt wird, muss sie eine strenge Sicherheitsprüfung bestehen. ANNEAL nutzt einen mehrschichtigen „Sicherheitsrat", um die neue Regel zu prüfen:

  • Die Logik-Prüfung: Brechen diese neue Regel irgendetwas anderes? (z. B. „Wenn wir Firmenkarten zulassen, bricht das dann das Budget?")
  • Die Ethik-Prüfung: Verstößt dies gegen moralische oder Unternehmensrichtlinien? (z. B. „Ist diese Regel gesetzlich erlaubt?")
  • Der Kanarienvogel-Test: Das System probiert die neue Regel in einer sicheren, simulierten Sandbox (wie einem Flugsimulator) aus, um zu sehen, ob sie funktioniert, ohne abzustürzen.
  • Analogie: Denken Sie daran, wie ein neues Gesetz vorgeschlagen wird. Es wird nicht nur zum Gesetz, weil der Präsident es unterzeichnet. Es muss den Senat (Logik), den Obersten Gerichtshof (Ethik) und einen öffentlichen Probelauf (Kanarienvogel-Test) bestehen, bevor es offiziell erlassen wird.

4. Die „Dauerhafte Korrektur" (Commit)

Wenn die neue Regel alle Tests besteht, committ ANNEAL sie. Das bedeutet, das Handbuch wird dauerhaft aktualisiert.

  • Das Ergebnis: Wenn der Roboter das nächste Mal versucht, dieses Hotel zu buchen, wird er den falschen Pfad nicht einmal versuchen. Er wird die neue Regel sehen („Keine Firmenkarten an diesen Daten") und automatisch einen anderen Pfad wählen. Der Fehler ist für immer verschwunden.
  • Analogie: Es ist wie das Reparieren einer Schlagloch auf einer Straße. Früher fuhren die Autos immer wieder hinein. Jetzt ist die Straße über dem Schlagloch gepflastert. Niemand fährt wieder hinein.

Warum ist das besonders?

Die Arbeit vergleicht ANNEAL mit anderen Systemen (wie ReAct und Reflexion):

  • Andere Systeme: Sie sind wie ein Schüler, der hart für einen Test lernt, besteht, aber die Lektion am nächsten Tag vergisst. Sie können sich während einer einzelnen Aufgabe erholen, aber wenn Sie ihnen später dieselbe kaputte Aufgabe geben, scheitern sie erneut.
  • ANNEAL: Es ist wie ein Schüler, der nach dem Scheitern an einer Matheaufgabe eine Korrektur in sein Lehrbuch schreibt, damit er diesen spezifischen Fehler nie wieder macht.

Die Ergebnisse
In Tests über vier verschiedene Bereiche (Reisen, E-Commerce, IT usw.) war ANNEAL das einzige System, das die zugrunde liegenden Regeln dauerhaft korrigierte.

  • Andere Systeme hatten eine Ausfallrate von 72 % bis 100 % bei wiederkehrenden Fehlern (sie machten denselben Fehler immer wieder).
  • ANNEAL reduzierte dies auf 0 %. Sobald es eine Regel korrigiert hatte, geschah der Fehler nie wieder.

Zusammenfassung
ANNEAL ist ein System, das aus „Ups, ich habe einen Fehler gemacht" ein „Ich habe das Regelbuch aktualisiert, sodass dieser Fehler unmöglich ist" macht. Dies geschieht, ohne das Gehirn des Roboters zu verändern, sondern durch sorgfältiges Editieren seines Handbuchs mit strengen Sicherheitsprüfungen, wodurch sichergestellt wird, dass der Roboter mit der Zeit intelligenter und sicherer wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →