← Neueste Arbeiten
🤖 AI

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

Diese qualitative Pilotstudie zeigt, dass agentive KI-Modelle beim Auftreten inkonsistenter gegenüber unvollständiger Tool-Antworten distinkte, kanalspezifische Signaturen in ihren Log-Wahrscheinlichkeiten aufweisen, was offenbart, dass die Robustheit gegenüber diesen unterschiedlichen Fehlertypen asymmetrisch ist und maßgeschneiderte Detektionsmechanismen anstelle eines universellen Ansatzes erfordert.

Ursprüngliche Autoren: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

Veröffentlicht 2026-08-25
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Landschaft der künstlichen Intelligenz ist eine neue Art von digitalem Arbeiter entstanden: der Sprachagent. Im Gegensatz zu früheren Programmen, die lediglich Fragen basierend auf einer statischen Datenbank beantworteten, sind diese Agenten darauf ausgelegt, zu handeln. Sie können im Web surfen, Datenbanken abfragen und Software-Tools nutzen, um komplexe Probleme zu lösen, ganz ähnlich wie ein menschlicher Assistent, der das Telefon hebt, um eine Reservierung vorzunehmen oder ein Tabellenkalkulationsprogramm prüft, um den Lagerbestand zu kontrollieren. Diese digitalen Arbeiter sind jedoch nicht unfehlbar. Wenn sie auf ein Tool zugreifen, erwarten sie eine saubere, genaue Antwort. In der realen Welt versagen Tools manchmal und geben Fehlermeldungen zurück, oder sie liefern Daten, die oberflächlich betrachtet perfekt aussehen, aber eine subtile Lüge enthalten. Die zentrale Herausforderung für Forscher besteht nicht nur darin, Agenten zu bauen, die funktionieren, wenn alles richtig läuft, sondern solche zu entwickeln, die erkennen können, wenn etwas schiefgelaufen ist, und angemessen darauf reagieren. Wenn ein Agent nicht zwischen einem defekten und einem irreführenden Tool unterscheiden kann, wird er die falsche Korrektur anwenden und potenziell Zeit verschwenden oder die Situation verschlimmern.

Ein Team von Forschern der Aalborg University und der Zhejiang University machte sich daran, genau diesen Moment der Entscheidung zu untersuchen. Sie wollten wissen, ob eine künstliche Intelligenz augenblicklich zwischen einem Tool, das keine Daten zurückgegeben hat, und einem Tool, das eine wohlgeformte, aber falsche Antwort geliefert hat, unterscheiden kann. Um dies zu testen, schufen sie eine kontrollierte Umgebung, die ein Kundenservice-Szenario im Einzelhandel simulierte. In dieser digitalen Welt agiert ein Agent als Support-Mitarbeiter und nutzt einen Satz von sechzehn verschiedenen Tools, um Bestelldetails nachzuschlagen, Zahlungsmethoden zu prüfen und Benutzerinformationen zu aktualisieren. Die Forscher nahmen eine standardmäßige, erfolgreiche Sequenz von Aktionen und ersetzten an einem spezifischen Punkt die normale Antwort des Tools durch eine fehlerhafte. Sie erstellten drei Arten von Fehlern: ein vollständiges Versagen, bei dem das Tool eine Fehlermeldung zurückgab, einen gefälschten Bestellstatus, der die Regeln dessen änderte, was der Agent als Nächstes tun durfte, und eine gefälschte Zahlungsidentifikation, die korrekt aussah, aber nicht zum Kunden gehörte.

Die Forscher beobachteten den Agenten nicht einfach nur dabei, wie er versuchte, die Aufgabe abzuschließen, und sahen nach, ob er erfolgreich war. Stattdessen unterbrachen sie den Prozess in dem Moment, in dem die fehlerhaften Daten eintrafen. Sie untersuchten den internen „Denkprozess“ des Modells und prüften speziell, wie wahrscheinlich es war, dass das nächste Wort in seiner Antwort generiert wurde. Sie maßen zwei unterschiedliche Dinge. Erstens prüften sie, wie gut die zurückgegebenen Daten dem erwarteten Format des Tools entsprachen. Zweitens prüften sie, wie gut diese Daten mit allem übereinstimmten, was der Agent bisher im Gespräch gesehen hatte, einschließlich der ursprünglichen Anfrage des Benutzers und früherer Tool-Ergebnisse. Sie betrachteten auch den Plan des Agenten für den unmittelbar nächsten Schritt und maßen, wie sicher er sich bei der Wahl einer Aktion war und ob diese Aktion die Überprüfung des Systemzustands beinhaltete oder den Übergang zu einer Änderung darstellte.

Die Ergebnisse zeigten einen scharfen und unmittelbaren Unterschied darin, wie der Agent auf diese verschiedenen Arten von Fehlern reagierte. Wenn das Tool eine defekte Fehlermeldung zurückgab, erkannte der Agent sofort, dass die Daten nicht dem grundlegenden Format des Tools entsprachen. Dies war ein klares Signal, dass das Tool fehlgeschlagen war. Folglich änderte sich der Plan des Agenten drastisch; es war höchst wahrscheinlich, dass er eine Aktion wählte, die den Systemzustand erneut auslas, was im Wesentlichen bedeutete, es erneut zu versuchen oder die Fakten zu prüfen. Im Gegensatz dazu sah der Agent bei einer wohlgeformten, aber falschen Antwort kein Problem mit dem Format. Die Daten sahen perfekt aus. Jedoch offenbarte der interne Vergleich des Agenten der neuen Daten mit dem Verlauf des Gesprächs einen Konflikt. Die falschen Daten kollidierten mit dem, was der Benutzer zuvor angegeben hatte oder was die Systemrichtlinie vorschrieb.

Entscheidend war, dass die Reaktion des Agenten auf diese falschen Antworten vollständig von der Art der Lüge abhing. Wenn die gefälschten Informationen eine einfache Diskrepanz waren, wie etwa eine Zahlungs-ID, die nicht zum Benutzer gehörte, blieb der Plan des Agenten weitgehend unverändert. Er wurde weder verwirrt noch unsicher; er akzeptierte die falschen Daten einfach und fuhr fort, da die Lüge die grundlegenden Regeln der Interaktion nicht veränderte. Aber wenn die gefälschten Informationen einen Bestellstatus betrafen, der die Regeln dessen änderte, was an Aktionen zulässig war, änderte sich das Verhalten des Agenten. Er wurde unsicher darüber, was als Nächstes zu tun sei, und sein Plan änderte sich, um die neue, falsche Realität widerzuspiegeln. Dies zeigte, dass der Agent zwar zwischen einem defekten Tool und einem lügenden Tool unterscheiden konnte, aber nicht immer zwischen einer harmlosen Lüge und einer folgenschweren Lüge, die die Aufgabe aus dem Ruder laufen lässt, unterscheiden konnte.

Die Studie untersuchte auch, was nach dem anfänglichen Fehler geschah. Die Forscher fanden heraus, dass die Art des Fehlers eine bleibende Spur in der zukünftigen Behavior des Agenten hinterließ. Das defekte Tool führte dazu, dass der Agent in den folgenden Schritten ständig versuchte, den Systemzustand erneut auszulesen, ein Zeichen dafür, dass er in einer Schleife der Verifizierung feststeckte. Der gefälschte Bestellstatus hingegen lenkte den Agenten auf einen völlig anderen Pfad, der ihn dazu brachte, Aktionen vorzunehmen, die den Systemzustand basierend auf den falschen Informationen änderten. Die gefälschte Zahlungs-ID, die der Agent anfangs ohne Probleme akzeptiert hatte, wurde in späteren Schritten weiterhin akzeptiert, ohne dass Anzeichen dafür vorlagen, dass der Agent bemerkt hatte, dass er getäuscht worden war. Dies demonstrierte, dass die Fähigkeit des Agenten, einen Fehler zu erkennen, kein einzelner, universeller Alarm war. Stattdessen handelte es sich um eine Sammlung verschiedener Signale. Ein Signal sagte dem Agenten, dass das Tool defekt war, ein anderes sagte ihm, dass die Daten inkonsistent mit der Vergangenheit waren, und ein drittes sagte ihm, dass die Daten inkonsistent mit den Regeln waren. Kein einzelnes Signal konnte jede Art von Fehler erfassen.

Die Forscher kamen zu dem Schluss, dass Robustheit in diesen Agenten nicht durch eine einzige Metrik erreicht wird, die alle schlechten Daten kennzeichnet. Stattdessen erfordert es das gleichzeitige Lesen mehrerer Informationskanäle. Ein Agent muss in der Lage sein zu sehen, wenn Daten nicht mit der Form eines Tools übereinstimmen, wenn sie im Widerspruch zur Historie des Gesprächs stehen und wenn sie im Widerspruch zu den Regeln des Bereichs stehen. Die Studie zeigte, dass diese verschiedenen Arten von Fehlern distinkte Signaturen in den internen Berechnungen des Agenten erzeugen. Ein defektes Tool ist sofort offensichtlich, weil es das Format bricht. Ein lügendes Tool ist schwerer zu fassen, weil es dem Format entspricht, aber die Geschichte bricht. Die gefährlichsten Lügen sind jene, die die Regeln des Spiels ändern, da sie den Agenten auf einen völlig falschen Pfad führen können, ohne Verwirrung auszulösen. Durch das Verständnis dieser spezifischen Signaturen können Entwickler Agenten bauen, die besser in der Lage sind, ihre eigenen Fehler zu diagnostizieren und die richtige Abhilfe zu wählen, sei es durch das Wiederholen eines Tools, das Überprüfen eines Faktums oder das Anhalten, um um Klärung zu bitten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →