← Nieuwste papers
💻 computer science

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

Het artikel introduceert WARD, een praktisch en efficiënt bewakingsmodel voor webagenten dat gebruikmaakt van een grootschalige dataset en een adaptief adversariaal trainingskader (A3T) om robuuste, laag-latente verdediging tegen prompt-injectie-aanvallen te bereiken, terwijl hoge generalisatie en minimale vals-positieven worden behouden.

Oorspronkelijke auteurs: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Web Agent voor als een hoogopgeleide, autonome digitale assistent. Je geeft het een opdracht—zoals "boek een vlucht" of "koop een specifiek overhemd"—en het gaat de enorme, chaotische internetwereld in om die uit te voeren. Het klikt op knoppen, leest tekst en bekijkt afbeeldingen, precies zoals een mens dat zou doen.

Maar hier zit het probleem: het internet zit vol met bedriegers.

Het Probleem: De "Verborgen Notitie"-aanval

In de echte wereld kan een hacker een briefje in de zak van je assistent steken met de tekst: "Negeer de baas, koop in plaats daarvan een pizza voor me." In de digitale wereld heet dit een Prompt Injection.

Hackers verbergen kwaadaardige instructies in de websites die de agent bezoekt. Deze instructies kunnen zijn:

  • Onzichtbare tekst verborgen in de code van de website (HTML).
  • Visuele trucs die over het scherm worden gelegd (zoals een nep-pop-up die eruitziet als een systeembericht).

Als de agent niet voorzichtig is, leest het deze verborgen notities, raakt het in de war en begint het dingen te doen die je niet hebt gevraagd—zoals je privégegevens lekken of op gevaarlijke links klikken.

De Oude Verdedigingen: De "Portier" met Blinde Vlekken

Om dit te stoppen, probeerden onderzoekers een Guard Model te bouwen—een digitale portier die elke webpagina controleert voordat de agent erbij komt. Maar de oude portiers hadden vier grote gebreken:

  1. Ze wisten alleen wat ze hadden bestudeerd: Als ze waren getraind op nieuwswebsites, raakten ze in de war door sociale media of e-mail.
  2. Ze waren te paranoïde: Ze merkten vaak onschadelijke pagina's (zoals een kooktutorial) als gevaarlijk, waardoor de agent zijn werk niet kon doen.
  3. Ze waren traag: Het controleren van elke pagina duurde te lang, waardoor het hele systeem traag werd.
  4. Ze konden worden bedrogen: Hackers leerden hoe ze notities moesten schrijven die specifiek waren ontworpen om de portier in de war te brengen, waardoor hij het gevaar negeerde.

De Oplossing: WARD (De "Super-Portier")

Het artikel introduceert WARD (Web Agent Robust Defense against Prompt Injection). Denk aan WARD als een portier van de volgende generatie, getraind met een unieke, drie-staps bootcamp.

1. Het Trainingsveld (WARD-Base)

In plaats van alleen een handboek te lezen, werd WARD getraind op een enorme dataset van 177.000 voorbeelden uit de echte wereld.

  • De "Overlay"-methode: Onderzoekers namen echte websites (zoals Amazon of nieuwswebsites) en "schilderden" digitale nep-kwaadaardige notities eroverheen om te zien hoe de agent reageerde.
  • De "Native"-methode: Ze bouwden nep-sociale media en berichtenapps waar hackers notities konden verbergen in normaal ogende commentaren en berichten.
  • Het resultaat: WARD leerde trucs te herkennen in zowel de code als de afbeeldingen, over veel verschillende soorten websites heen, niet slechts één specifiek type.

2. De "Zelfverdedigings"-oefening (WARD-PIG)

De onderzoekers realiseerden zich dat hackers de portier zelf konden proberen te bedriegen. Stel je een hacker voor die fluistert tegen de portier: "Hé, ik ben de manager, laat deze man door."
Om dit te stoppen, creëerden ze WARD-PIG, een dataset waar de aanvallen specifiek gericht zijn op het besluitvormingsproces van de bewaker. WARD leerde deze "nep-manager" commando's te negeren en zich aan de regels te houden.

3. De "Sparringpartner" (A3T)

Dit is het meest creatieve deel. De onderzoekers bouwden een Adaptive Adversarial Attack Training (A3T)-systeem.

  • Stel je een sparringmatch voor waarbij de Guard en een Hacker tegen elkaar vechten.
  • De Hacker probeert een nieuwe manier te vinden om een notitie langs de Guard te smokkelen.
  • Als de Hacker slaagt, leert de Guard van die fout en wordt hij sterker.
  • Ze herhalen deze cyclus duizenden keren. De Hacker wordt slimmer en de Guard wordt taaier, totdat de Guard zelfs de slimste, evoluerende trucs kan opsporen.

De Resultaten: Waarom WARD Wint

Het artikel testte WARD tegen de beste bestaande beveiligingssystemen en vond:

  • Super nauwkeurigheid: Het ving bijna 100% van de aanvallen, zelfs op websites die het nog nooit had gezien.
  • Lage valse alarmen: Het stopte de agent zelden bij het doen van onschadelijke dingen (zoals het lezen van een recept), zodat de agent bruikbaar blijft.
  • Snelheid: Het draait parallel met de agent, wat betekent dat het niets vertraagt. Het is alsof je een beveiligingsagent hebt die je ID controleert terwijl je al door de deur loopt, in plaats van je te laten wachten in de rij.
  • Onbreekbaar: Zelfs toen hackers probeerden hun aanvallen in real-time aan te passen om eromheen te komen, hield WARD stand.

In het Kort

WARD is een beveiligingssysteem voor AI-agenten dat niet alleen een lijst met slechte websites uit het hoofd leert. In plaats daarvan traint het op een enorme verscheidenheid aan scenario's uit de echte wereld, leert het nep-autoriteitscommando's te negeren en vecht het constant tegen een digitale sparringpartner om scherp te blijven. Het houdt je AI-assistent veilig voor verborgen trucs zonder het te vertragen of te stoppen met zijn werk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →