← Neueste Arbeiten
💻 computer science

Runtime Continuation after Faults in Partially Executed Agent Workflows

Dieses Paper schlägt einen Runtime-Continuation-Mechanismus für teilweise ausgeführte Workflow-Abläufe von Sprachmodell-Agenten vor, der eine sichere Wiederherstellung aus Fehlern gewährleistet, indem er eine vertrauenswürdige Front rekonstruiert, residuelle Verpflichtungen aus einem kanonischen Vertrag ableitet und den Zustand nur durch autorisierte Effekte vorantreibt, die durch gültige, frische und eindeutig übereinstimmende Evidenz gestützt werden.

Ursprüngliche Autoren: Li Zeng, Chuanwu Yang, Qiang Zhao, Qinde Chen, Deyang Qu

Veröffentlicht 2026-09-22
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Li Zeng, Chuanwu Yang, Qiang Zhao, Qinde Chen, Deyang Qu

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen digitalen Landschaft hat sich künstliche Intelligenz von einem System, das lediglich Texte schreibt, zu einemem System entwickelt, das aktiv Aufgaben ausführt. Diese intelligenten Agenten können das Web durchsuchen, Dateien bearbeiten, Nachrichten senden und Datenbanken im Namen eines Nutzers aktualisieren. Sie arbeiten nach dem Prinzip einer Abfolge von Schritten, die oft als Workflow bezeichnet werden, wobei jede Aktion den Zustand der realen Welt verändert. Diese Fähigkeit zu handeln schafft jedoch eine einzigartige Schwachstelle. Wenn ein Agent einen Fehler macht, durch einen Trick verwirrt wird oder auf einen Systemfehler stößt, nachdem er bereits eine Datei geändert oder eine Nachricht gesendet hat, kann ein einfaches Wiederholen oder Neustarten gefährlich sein. Das erneute Ausführen einer fehlgeschlagenen Sequenz könnte eine schädliche Aktion wiederholen, während das Fortfahren aus einem verwirrten Zustand auf einer falschen Annahme aufbauen könnte. Die zentrale Herausforderung besteht darin, genau zu bestimmen, welcher Teil der Historie vertrauenswürdig ist, welche Arbeit noch unerledigt ist und welcher Beweis benötigt wird, um sicher voranzukommen, ohne Fehler zu wiederholen oder auf Täuschungen hereinzufallen.

Die Forscher Li Zeng und sein Team am Institute of Information Technology der National Immigration Administration und der Hong Kong University of Science and Technology haben eine neue Methode entwickelt, um dieses Problem zu lösen. Sie nennen ihr System AgentMirror. Anstatt einen unterbrochenen Workflow als einfachen Fehler zu behandeln, der durch eine neue Vermutung behoben werden muss, betrachtet AgentMirror den Erholungsprozess als eine strikte, schrittweise Verifizierung der Realität. Das System arbeitet nach dem Prinzip, dass sobald ein Agent eine Aktion ausgeführt hat, die Historie dieser Aktion zu einem festen Punkt der Wahrheit wird. Wenn der Agent abstürzt oder getäuscht wird, nachdem dieser Punkt erreicht wurde, lässt das System die künstliche Intelligenz nicht entscheiden, was passiert ist. Stattdessen blickt es auf eine verifizierte Aufzeichnung dessen, was tatsächlich geschehen ist, identifiziert genau, welche Aufgaben noch zu erledigen sind, und verlangt einen konkreten Beweis, bevor es irgendeine neue Aktion erlaubt, den Zustand der Welt erneut zu verändern.

Die Forscher bauten dieses System um ein Konzept auf, das sie „Trusted Frontier“ (vertrauenswürdige Grenze) nennen. Stellen Sie sich eine Linie im Sand vor, die den exakten Moment markiert, in dem die Historie des Agenten als sicher und korrekt bestätigt wird. Alles vor dieser Linie wird als wahr akzeptiert; alles danach ist unverifiziert. Wenn ein Fehler auftritt, lässt das System die künstliche Intelligenz diese Linie nicht neu ziehen oder so tun, als wäre kein Fehler passiert. Es rekonstruiert den Zustand des Agenten ausschließlich basierend auf der verifizierten Historie bis zu dieser Linie. Von diesem Punkt aus berechnet das System eine Liste von „Residual Obligations“ (verbleibenden Verpflichtungen) – die spezifischen, obligatorischen Aufgaben, die der Agent noch abschließen muss, um die Arbeit zu beenden. Es präsentiert diese Liste der künstlichen Intelligenz als Leitfaden, der ihr sagt, welche Arbeit noch ansteht, ohne der Intelligenz jedoch die Macht zu geben, diese einfach nur auszuführen.

Die entscheidende Innovation liegt darin, wie das System den nächsten Schritt handhabt. Wenn die künstliche Intelligenz eine neue Aktion vorschlägt, wird dieser Vorschlag als nicht vertrauenswürdig behandelt. Das System zwingt die Aktion durch eine Standard-Sicherheitsprüfung, bekannt als „Ordinary Admission“ (gewöhnliche Zulassung), um sicherzustellen, dass sie ausgeführt werden darf. Wenn die Aktion ausgeführt wird, akzeptiert das System nicht sofort, dass die Aufgabe erledigt ist. Es wartet auf einen „Runtime Receipt“ (Laufzeitbeleg), ein digitales Zertifikat, das von einer vertrauenswürdigen Instanz ausgestellt wird und bestätigt, dass die Aktion tatsächlich stattgefunden hat und korrekt beobachtet wurde. Dieser Beleg muss aktuell sein, was bedeutet, dass er gerade erst erstellt wurde, und er muss an die aktuelle „Trusted Frontier“ gebunden sein, was bedeutet, dass er keine Wiederholung einer alten Aktion oder ein Fake aus einer anderen Sitzung sein darf. Erst wenn dieser Beleg verifiziert wurde und exakt mit einer der verbleibenden Aufgaben übereinstimmt, erlaubt das System, dass die offizielle Aufzeichnung des Fortschritts des Agenten voranschreitet.

Um ihre Idee zu testen, verwendeten die Forscher einen Benchmark namens AgentDojo, der verschiedene Aufgaben simuliert und absichtlich Fehler und Angriffe einführt, um das Verhalten von Agenten zu prüfen. Sie verglichen ihr AgentMirror-System mit anderen Wiederherstellungsmethoden, wie etwa dem einfachen Wiederholen des letzten Schritts oder dem Versuch, die künstliche Intelligenz durch bloßes Raten aus der Situation zu führen. Die Ergebnisse zeigten, dass AgentMirror signifikant besser darin war, Aufgaben sicher abzuschließen. Es konnte erfolgreich aus Fehlern regenerieren, ohne zuzulassen, dass unbefugte Aktionen durchrutschten, und es verhinderte, dass der Agent auf täuschende Anweisungen hereinfiel, die versuchten, ihn zu wiederholten schädlichen Operationen zu verleiten. Die Studie demonstrierte, dass durch die Trennung der der künstlichen Intelligenz gegebenen Anleitung von der Autorität zur Ausführung von Aktionen und durch die Forderung nach frischen Beweisen für jeden Schritt, das System einen sicheren Pfad aufrechterhalten konnte, selbst wenn der Agent selbst kompromittiert war.

Die Forscher untersuchten auch, was passieren würde, wenn sie bestimmte Teile ihrer Sicherheitsregeln entfernen würden. Sie fanden heraus, dass, wenn sie den Schritt der Verifizierung des Belegs übersprungen hätten, das System gefälschte oder alte Beweise akzeptiert hätte, was zu einem falschen Fortschritt geführt hätte. Wenn sie die Wiederherstellungsanleitung als Erlaubnis zur Ausführung zugelassen hätten, hätte das System nicht vertrauenswürdigen Aktionen die Ausführung erlaubt. Wenn sie nicht geprüft hätten, ob die Aktion exakt mit einer spezifischen Aufgabe übereinstimmt, hätte das System möglicherweise die falsche Aufgabe geschlossen oder Arbeit unerledigt gelassen. Diese Tests bestätigten, dass jeder Teil ihres Prozesses notwendig ist; keine einzelne Prüfung kann die anderen ersetzen. Das System funktioniert, weil es eine Vertrauenskette erzwingt, in der die künstliche Intelligenz zwar vorschlagen, aber das System entscheiden kann, und nur die verifizierte Realität den Datensatz ändern kann.

Diese Arbeit beansprucht nicht, die künstliche Intelligenz perfekt zu machen oder jedes mögliche Versagen zu lösen. Das System beruht darauf, dass der ursprüngliche Vertrag oder der Satz an Regeln korrekt ist; wenn die Regeln selbst falsch sind, wird das System dem falschen Pfad treu folgen. Es kann zudem keine Aktionen rückgängig machen, die bereits in der realen Welt ausgeführt wurden, falls der Beweis für diese Aktionen verloren gegangen ist. Es bietet jedoch einen robusten Rahmen für das Management des Augenblicks, in dem Dinge schiefgehen. Indem es den Wiederherstellungsprozess als einen strikten Übergang von einem bekannten, sicheren Zustand zu einem neuen, verifizierten Zustand behandelt, bietet AgentMirror einen Weg, intelligente Agenten auch dann sicher am Arbeiten zu halten, wenn sie auf Fehler oder böswillige Interferenzen stoßen. Die Studie kommt zu dem Schluss, dass der Schlüssel zu einem sicheren Fortfahren nicht in besseren Vermutungen liegt, sondern in besserer Verifizierung.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →