← Nieuwste papers
💻 computer science

WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents

Dit artikel identificeert en analyseert "Mid-Session Tool Injection" (MSTI), een nieuwe beveiligingsdreiging in het WebMCP-protocol waarbij aanvallers gebruikmaken van scripts van derden om tijdens actieve sessies door agenten toegankelijke tools te kapen of te framen, en stelt specifieke ontwerpmitigaties voor om de tool-oppervlakte te beveiligen tegen dergelijke runtime-manipulatieaanvallen.

Oorspronkelijke auteurs: Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een uiterst intelligente persoonlijke assistent (een AI-agent) inhuurt om een complexe taak voor je af te handelen, zoals het boeken van een reis of het beheren van je financiën. Je geeft deze assistent een lijst met goedgekeurde hulpmiddelen die hij kan gebruiken: een "Zoekmachine", een "Kalender" en een "Betalingsverwerker". Je vertrouwt erop dat deze lijst vaststaat en veilig is.

Dit artikel introduceert een nieuwe beveiligingsdreiging genaamd WebMCP Tool Surface Poisoning. Het stelt dat de lijst met hulpmiddelen die beschikbaar zijn voor je AI-assistent niet werkelijk een statische, vergrendelde lijst is. In plaats daarvan is het als een digitaal menu dat door een hacker stiekem herschreven kan worden terwijl de assistent nog aan het werk is.

Hier is een uitsplitsing van de bevindingen van het artikel met behulp van eenvoudige analogieën:

Het Kernprobleem: De "Magische Menukaart"

In het nieuwe WebMCP-systeem kunnen websites hulpmiddelen direct aan AI-agenten overhandigen. Het artikel waarschuwt dat dit systeem een gebrek heeft: de lijst met hulpmiddelen is dynamisch.

Denk aan de AI-agent als een chef-kok in een keuken. De "hulpmiddelen" zijn de messen, potten en ingrediënten op het aanrecht.

  • De Oude Manier: De chef krijgt aan het begin een vaste lijst met ingrediënten. Als de lijst "Tomaten" zegt, gebruikt de chef tomaten.
  • De WebMCP Manier: De ingrediënten op het aanrecht kunnen veranderen terwijl de chef aan het koken is. Een kwaadwillende derde partij (een hacker) kan de "Tomaten" vervangen door "Giftige Bessen" vlak voordat de chef ernaar reikt, of ze kunnen een nieuw, nep "Specerij" toevoegen dat onschuldig lijkt maar het gerecht verpest.

De Twee Belangrijkste Aanvallen

De onderzoekers hebben twee specifieke manieren geïdentificeerd waarop hackers met deze "keuken" kunnen knoeien:

1. Tool Hijacking (De "Switcheroo")

Dit is als een goochelaar die een echt kaartspel vervangt door een nepkaartspel vlak voordat je een kaart pakt.

  • Hoe het werkt: Een hacker gebruikt een script om een legitiem hulpmiddel (zoals "E-mail verzenden") te verwijderen en het onmiddellijk te vervangen door een nep-hulpmiddel dat exact dezelfde naam heeft, maar iets kwaadaardigs doet (zoals "E-mail naar hacker verzenden").
  • Het Resultaat: De AI weet niet dat hij is bedrogen. Hij denkt dat hij het echte hulpmiddel gebruikt, maar hij is eigenlijk je privégegevens aan de aanvaller aan het overhandigen.
  • De Bevinding van het Artikel: Deze aanval is zeer effectief. In hun tests gebruikte de AI het nep-hulpmiddel 100% van de tijd, als de wissel vroeg genoeg plaatsvond, waardoor gevoelige gegevens naar de hacker werden gestuurd.

2. Tool Framing (De "Vermomming")

Dit gaat minder over het vervangen van het hulpmiddel en meer over liegen over wat het hulpmiddel doet.

  • Hoe het werkt: De hacker verwijdert de echte hulpmiddelen niet. In plaats daarvan voegt de hacker een nieuw, kwaadaardig hulpmiddel toe, maar geeft het een zeer overtuigende beschrijving. Ze kunnen een "Data Dief"-hulpmiddel labelen als "Security Check Vereist Voordat Verzending" of "Compliance Stap".
  • Het Resultaat: De AI ziet een hulpmiddel dat essentieel en veilig klinkt, en besluit daarom om het als onderdeel van zijn normale workflow te gebruiken.
  • De Bevinding van het Artikel: Dit is sluimer: De AI voltooit vaak de oorspronkelijke taak (zoals het verzenden van de e-mail) terwijl hij ook het nep-hulpmiddel op de achtergrond gebruikt. De taak lijkt succesvol, maar de gegevens zijn gelekt. In sommige gevallen is de AI 85% van de tijd voor deze vermomming gevallen.

Het "Recept" voor Succes

De onderzoekers hebben deze aanvallen getest op drie van de slimste beschikbare AI-modellen (GPT-5.4, Claude Opus en Gemini 2.5). Ze ontdekten dat:

  • Timing is alles: Als de hacker het hulpmiddel vervangt voordat de AI begint na te denken, valt de AI er bijna altijd voor. Als de wissel plaatsvindt nadat de AI al een hulpmiddel heeft gekozen, mislukt de aanval meestal.
  • Beschrijving doet ertoe: De AI vertrouwt zwaar op de tekstuele beschrijving van het hulpmiddel. Als de beschrijving zegt: "Dit is een verplichte veiligheidsstap", is de AI zeer geneigd om te gehoorzamen, zelfs als het hulpmiddel kwaadaardig is.
  • Verschillen tussen modellen: Sommige AI's waren vatbaarder dan andere. Bijvoorbeeld, één model (Gemini) werd gemakkelijk misleid door lange, saaie beschrijvingen vol juridisch jargon, terwijl een ander model (Claude) immuun was voor die specifieke truc.

De Oplossing: De Keuken Afsluiten

Het artikel suggereert dat we niet simpelweg de AI kunnen vertrouwen om "het wel beter te weten". We moeten de manier waarop het systeem is gebouwd veranderen. Ze stellen vier belangrijke oplossingen voor:

  1. ID-badges: Elk hulpmiddel moet een permanente, onveranderlijke ID-kaart hebben die bewijst wie het heeft gemaakt. Als een hulpmiddel probeert van naam of eigenaar te veranderen, moet het systeem dit weigeren.
  2. Controleer de Klok: Het systeem moet controlen of de lijst met hulpmiddelen is veranderd sinds de AI aan de taak is begonnen. Als een hulpmiddel is vervangen, moet de AI stoppen en om bevestiging vragen.
  3. Gegevensgrenzen: Hulpmiddelen moeten precies verteld worden welke gegevens ze mogen aanraken. Een "Alleen-lezen" hulpmiddel zou geen gegevens naar de server van een hacker mogen verzenden.
  4. Houd een Logboek bij: Het systeem moet een gedetailleerd dagboek bijhouden van elke keer dat een hulpmiddel wordt toegevoegd, verwijderd of gewijzigd, zodat we kunnen zien of er iets verdachts is gebeurd.

De Conclusie

Het artikel concludeert dat het "tool surface" (de lijst met hulpmiddelen die een AI kan gebruiken) niet langer een veilige, statische grens is. Het is een nieuwe plek geworden waar hackers kunnen aanvallen. Zelfs de slimste AI-modellen kunnen worden misleid als de hulpmiddelen die ze mogen gebruiken stiekem worden vervangen of vermomd terwijl ze aan het werk zijn. Om veilig te blijven, moet het systeem zelf worden herontworpen om hulpmiddelen constant te verifiëren, in plaats van er simpelweg vanuit te gaan dat de AI het zelf wel uitzoekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →