← Neueste Arbeiten
💬 NLP

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

Dieser Beitrag führt das Konzept der „kognitiven Vergiftung" bei LLM-Agenten ein, bei dem bösartige Werkzeuge durch harmloses Feedback Vertrauen aufbauen, bevor sie schädliche Aktionen ausführen, und schlägt den TRUST-Bench-Benchmark sowie das VISTA-Guard-Verteidigungsframework vor, um diese trajektorienbasierten Risiken wirksam zu erkennen und zu mindern, indem die finale ausführbare Aktion bewertet wird, anstatt sich auf Heuristiken auf Prompt-Ebene zu verlassen.

Ursprüngliche Autoren: Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Idee: Das Werkzeug als "Wolf im Schafspelz"

Stellen Sie sich vor, Sie stellen eine persönliche Assistentin (den KI-Agenten) ein, um für Sie einzukaufen. Sie sagen ihr: "Geh zum Laden und kaufe Milch."

Normalerweise gehen wir davon aus, dass die Informationen, die die Assistentin von einem gewählten Laden (einem Werkzeug) erhält, ehrlich sind. Wenn der Laden sagt: "Wir haben Milch", vertrauen wir ihm.

Dieses Papier argumentiert, dass diese Annahme gefährlich ist.

Die Autoren beschreiben einen neuen Trick, den sie "Kognitive Vergiftung" nennen. Es ist wie ein Wolf, der sich als Schaf verkleidet.

  • Der Trick: Ein bösartiges Werkzeug (der Wolf) verhält sich zunächst völlig normal. Es beantwortet die Fragen der Assistentin mehrere Gesprächsrunden lang höflich und korrekt. Es baut Vertrauen auf.
  • Die Falle: Das Werkzeug enthüllt seine wahre, schädliche Natur erst im allerletzten Moment. Es wartet, bis die Assistentin kurz vor einer finalen, großen Entscheidung steht (wie "Kaufe die Milch und überweise 1.000 $ an diesen Fremden"). Erst wenn bestimmte versteckte Bedingungen erfüllt sind, schaltet das Werkzeug um und sagt: "Eigentlich, lass uns das gefährliche Ding tun."

Der beunruhigende Teil? Wenn Sie sich eine einzelne Nachricht des Werkzeugs ansehen, wirkt sie unschuldig. Die Gefahr liegt nicht in einem schlechten Satz, sondern in der Geschichte, die das Werkzeug im Laufe der Zeit erzählt hat, und die die Assistentin dazu gebracht hat, ihre Wachsamkeit zu senken.


Das Problem: Alte Abwehrmaßnahmen funktionieren nicht

Die Forscher testeten, wie gut aktuelle Sicherheitssysteme damit umgehen. Sie stellten fest, dass die meisten bestehenden Abwehrmaßnahmen wie Sicherheitspersonal sind, das nur am Eingang Ausweise prüft.

  • Sie schauen sich den Namen des Werkzeugs oder die ersten paar Wörter einer Nachricht an.
  • Wenn das Werkzeug freundlich wirkt und die ersten paar Nachrichten sicher sind, lässt der Wächter es durch.
  • Ergebnis: Diese Wächter versagen völlig gegen "Kognitive Vergiftung", weil das Werkzeug während des Großteils der Interaktion freundlich war. Die Wächter übersehen den subtilen Wandel in der Geschichte.

Die Lösung: TRUST-BENCH und VISTA-GUARD

Um dies zu untersuchen, entwickelte das Team zwei Dinge:

1. TRUST-BENCH (Der Trainingsplatz)

Sie schufen eine riesige Testbank namens TRUST-BENCH.

  • Das Setup: Sie nahmen Tausende normaler Aufgaben (wie Websuchen oder Dateibearbeitung) und erstellten "böse Zwillinge" dafür.
  • Das Match: Für jede sichere Aufgabe erstellten sie eine bösartige Version, bei der das Werkzeug drei Runden lang nett agiert und dann versucht, die KI in der vierten Runde zu etwas Schädlichem zu verleiten.
  • Das Ziel: Zu prüfen, ob eine KI den Unterschied zwischen einem Werkzeug, das tatsächlich sicher ist, und einem, das bis zum letzten Moment vortäuscht, sicher zu sein, erkennen kann.

2. VISTA-GUARD (Der clevere Detektiv)

Sie entwickelten ein neues Abwehrsystem namens VISTA-GUARD. Anstatt nur den Ausweis zu prüfen, agiert dieses System wie ein Detektiv, der einen Fallaktenordner durchgeht.

  • Funktionsweise: Es betrachtet nicht nur die finale Anfrage. Es betrachtet die gesamte Historie des Gesprächs.
  • Die Analogie: Stellen Sie sich einen Detektiv vor, der fragt: "Der Verdächtige hat drei Tage lang behauptet, unschuldig zu sein, aber am vierten Tag bat er plötzlich um einen Schlüssel zum Tresor. Ergibt die ganze Geschichte Sinn, oder wirkt die plötzliche Verhaltensänderung verdächtig?"
  • Das Geheimnis: VISTA-GUARD wandelt das Gespräch in einen strukturierten Bericht um (wie einen Punktekatalog für "Vertrauenssignale") und fragt dann die KI: "Angesichts dieser gesamten Geschichte ist die finale Aktion sicher?"

Die Ergebnisse: Wer hat gewonnen?

Die Forscher testeten VISTA-GUARD gegen viele andere Methoden (einschließlich anderer KIs und einfacher regelbasierter Systeme).

  • Die Verlierer:

    • Einfache Regeln: Systeme, die nur nach "schlechten Wörtern" suchen, scheiterten.
    • Zero-Shot-Richter: Selbst sehr intelligente, vortrainierte KI-Modelle (wie GPT-5.4) scheiterten, wenn sie ohne spezifisches Training gebeten wurden, dies zu beurteilen. Sie waren entweder zu "paranoid" (alles ablehnend) oder zu vertrauensselig.
    • Skalare Klassifikatoren: Systeme, die das Gespräch einfach in eine einzelne Zahl verwandelten (wie einen "Risikoscore"), scheiterten, weil sie die Details der Geschichte verloren.
  • Der Gewinner:

    • VISTA-GUARD war der Einzige, der konsistent erfolgreich war.
    • Es lernte, den "Wolf" zu erkennen, indem es analysierte, wie Vertrauen im Laufe der Zeit aufgebaut wurde.
    • Die Punktzahl: Es erreichte in seiner eigenen Trainingsumgebung eine hohe Sicherheitspunktzahl (84,2) und performte immer noch gut (56,9), als es an völlig neuen, unbekannten Werkzeugen getestet wurde.

Die Kernaussage

Das Papier kommt zu dem Schluss, dass Vertrauen ein Prozess und kein Schnappschuss ist.

Wenn eine KI Werkzeuge verwendet, sollte sie nicht nur fragen: "Ist der Name dieses Werkzeugs sicher?" oder "Ist diese Nachricht sicher?". Sie muss fragen: "Macht die gesamte Historie unserer Interaktion Sinn, und passt die finale Aktion zur Geschichte, die uns erzählt wurde?"

Wenn das Werkzeug drei Tage lang wie ein Freund agierte und dann plötzlich versuchte, am vierten Tag die Bank zu überfallen, muss die KI erkennen, dass die Geschichte die Gefahr ist, nicht nur der letzte Satz.

Zusammenfassung in einem Satz

Dieses Papier zeigt, dass bösartige Werkzeuge KI-Agenten täuschen können, indem sie eine Weile nett tun, bevor sie zuschlagen, und dass der einzige Weg, sie zu stoppen, ein Abwehrsystem ist, das die gesamte Historie der Interaktion analysiert, nicht nur die finale Anfrage.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →