Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
Dit artikel introduceert het concept van "cognitieve vergiftiging" bij LLM-agenten, waarbij kwaadaardige tools vertrouwen opbouwen via onschadelijke feedback voordat ze schadelijke acties uitvoeren, en stelt de TRUST-Bench-benchmark en het VISTA-Guard-verdedigingskader voor om deze op trajecten gebaseerde risico's effectief te detecteren en te mitigeren door de uiteindelijke uitvoerbare actie te scoren in plaats van te vertrouwen op prompt-niveau heuristieken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: De "Wolf in Schapenkleren"-Tool
Stel je voor dat je een persoonlijke assistent (de AI-Agent) inhuurt om voor je boodschappen te doen. Je zegt tegen hen: "Ga naar de winkel en koop melk."
Meestal gaan we ervan uit dat zodra de assistent een winkel kiest (een Tool), de informatie die ze van die winkel terugkrijgen eerlijk is. Als de winkel zegt: "We hebben melk", dan vertrouwen we dat.
Dit artikel betoogt dat deze aanname gevaarlijk is.
De auteurs beschrijven een nieuw type truc genaamd "Cognitive Poisoning" (Kognitieve Vergiftiging). Het is als een wolf die zich verkleedt als een schaap.
- De Truc: Een kwaadaardige tool (de wolf) doet eerst perfect normaal. Ze beantwoordt de vragen van je assistent beleefd en correct gedurende meerdere rondes van gesprek. Ze bouwt vertrouwen op.
- De Val: De tool onthult pas op het allerlaatste moment haar ware, schadelijke aard. Ze wacht tot de assistent op het punt staat een definitieve, grote beslissing te nemen (zoals "Koop de melk en transfereer $1.000 naar deze vreemdeling"). Pas wanneer specifieke verborgen voorwaarden samenkomen, schakelt de tool over en zegt ze: "Eigenlijk, laten we het gevaarlijke ding doen."
Het engste deel? Als je naar een enkel bericht kijkt dat de tool stuurde, ziet het onschuldig uit. Het gevaar zit niet in één slechte zin; het zit in het verhaal dat de tool in de loop van de tijd vertelde, waardoor de assistent zijn waakzaamheid liet zakken.
Het Probleem: Oude Verdedigingen Werken Niet
De onderzoekers testten hoe goed huidige veiligheidssystemen hiermee omgaan. Ze ontdekten dat de meeste bestaande verdedigingen lijken op beveiligingsbewakers die alleen ID-kaarten controleren bij de deur.
- Ze kijken naar de naam van de tool of de eerste paar woorden van een bericht.
- Als de tool vriendelijk lijkt en de eerste paar berichten veilig zijn, laat de bewaker hem binnen.
- Resultaat: Deze bewakers falen volledig tegen "Cognitive Poisoning", omdat de tool meest van de interactie vriendelijk was. De bewakers misten de subtiele verschuiving in het verhaal.
De Oplossing: TRUST-BENCH en VISTA-GUARD
Om dit te bestuderen, bouwde het team twee dingen:
1. TRUST-BENCH (Het Trainingsveld)
Ze creëerden een enorme testbank genaamd TRUST-BENCH.
- De Opzet: Ze namen duizenden normale taken (zoals zoeken op het web of bestanden bewerken) en maakten "kwaadaardige tweelingbroers" voor ze.
- De Match: Voor elke veilige taak maakten ze een kwaadaardige versie waarbij de tool drie rondes aardig doet, en dan op de vierde ronde de AI probeert te verleiden tot iets schadelijks.
- Het Doel: Om te zien of een AI het verschil kan zien tussen een tool die echt veilig is en een die doet alsof ze veilig is tot het laatste moment.
2. VISTA-GUARD (De Slimme Detective)
Ze bouwden een nieuw verdedigingssysteem genaamd VISTA-GUARD. In plaats van alleen de ID-kaart te controleren, handelt dit systeem als een detective die een dossier herleest.
- Hoe het werkt: Het kijkt niet alleen naar het laatste verzoek. Het kijkt naar de hele geschiedenis van het gesprek.
- De Analogie: Stel je een detective voor die vraagt: "De verdachte zei drie dagen lang dat hij onschuldig was, maar op dag vier vroegen ze plotseling om een sleutel voor de kluis. Maakt het hele verhaal dan zin, of lijkt de plotselinge verandering in gedrag verdacht?"
- De Geheime Ingrediënt: VISTA-GUARD zet het gesprek om in een gestructureerd rapport (zoals een scorekaart van "vertrouwenssignalen") en vraagt de AI vervolgens: "Gezien dit hele verhaal, is de uiteindelijke actie veilig?"
De Resultaten: Wie Won?
De onderzoekers testten VISTA-GUARD tegen vele andere methoden (inclusief andere AI's en eenvoudige regelsystemen).
De Verliezers:
- Eenvoudige Regels: Systemen die alleen zoeken naar "slechte woorden" faalden.
- Zero-Shot Judges: Zelfs zeer slimme, vooraf getrainde AI-modellen (zoals GPT-5.4) faalden wanneer ze werden gevraagd dit te beoordelen zonder specifieke training. Ze waren te "paranoïde" (alles afwijzen) of te vertrouwend.
- Scalar Classifiers: Systemen die het gesprek simpelweg omzetten in één enkel getal (zoals een "risicoscore") faalden omdat ze de details van het verhaal verloren.
De Winnaar:
- VISTA-GUARD was de enige die consequent succes boekte.
- Het leerde de "wolf" te spotten door te analyseren hoe vertrouwen in de loop van de tijd werd opgebouwd.
- De Score: Het behaalde een hoge veiligheidsscore (84,2) in zijn eigen trainingsomgeving en presteerde nog steeds goed (56,9) toen het werd getest op volledig nieuwe, onbekende tools.
De Belangrijkste Leerervaring
Het artikel concludeert dat vertrouwen een proces is, geen momentopname.
Wanneer een AI tools gebruikt, moet hij niet alleen vragen: "Is de naam van deze tool veilig?" of "Is dit bericht veilig?" Hij moet vragen: "Maakt de hele geschiedenis van onze interactie zin, en past de uiteindelijke actie bij het verhaal dat ons is verteld?"
Als de tool drie dagen als een vriend deed en op dag vier plotseling probeerde de bank te beroven, moet de AI beseffen dat het verhaal het gevaar is, niet alleen de laatste zin.
Samenvatting in Eén Zin
Dit artikel laat zien dat kwaadaardige tools AI-agenten kunnen bedriegen door een tijdje aardig te doen voordat ze toeslaan, en dat de enige manier om ze te stoppen is door een verdedigingssysteem te gebruiken dat de hele geschiedenis van de interactie analyseert, niet alleen het laatste verzoek.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.