← Nieuwste papers
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

Dit paper introduceert een nieuwe aanvalsmethode genaamd Function Hijacking Attack (FHA) die de tool-selectie van agentische AI-modellen manipuleert om specifieke, door de aanvaller gekozen functies af te dwingen, waarbij deze aanval ongevoelig is voor context en hoge succespercentages bereikt over verschillende modellen.

Oorspronkelijke auteurs: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

Gepubliceerd 2026-04-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🕵️‍♂️ De Grote Omleiding: Hoe hackers AI-agenten "hijacken"

Stel je voor dat je een super slimme, digitale assistent hebt (een AI-agent). Deze assistent kan niet alleen praten, maar ook echt dingen doen: e-mails sturen, bestanden opslaan, of zelfs een nieuwe website maken. Om dit te doen, gebruikt de AI een functie-oproep-systeem.

Je kunt dit vergelijken met een chef in een restaurant (de AI) die bestellingen aanneemt. De chef heeft een lijst met gerechten (functies) die hij kan bestellen bij de keuken. Als jij zegt: "Ik wil een pizza", kijkt de chef op zijn lijst, vindt hij "Pizza" en stuurt hij de bestelling door.

Het probleem:
De onderzoekers van IBM en andere universiteiten hebben ontdekt dat hackers deze lijst met gerechten kunnen vervalsen. Ze hoeven de chef niet te dwingen om een giftige pizza te maken; ze hoeven alleen maar de beschrijving van een gerecht op de lijst te veranderen.

🎭 Wat is de "Function Hijacking Attack" (FHA)?

In dit onderzoek noemen ze dit een Functie-Omleidingsaanval (Function Hijacking Attack).

De Analogie van de Vervalsde Menukaart:
Stel je voor dat er op de menukaart bij het gerecht "Pizza" een hele rare, onbegrijpelijke zin staat, vol met vreemde tekens en code die de hacker erin heeft gestopt.

  • Normaal: De chef leest "Pizza" en denkt: "Ah, dat is wat de klant wil."
  • Aangevallen: De hacker heeft de beschrijving van een gevaarlijk gerecht (bijvoorbeeld: "Rekenmachine uitschakelen" of "Geheime bestanden wissen") zo verpest dat de AI-chemie erdoor wordt verward.

De AI denkt dan: "Oh, als de klant 'Pizza' zegt, moet ik eigenlijk dat andere, gevaarlijke gerecht bestellen, omdat die beschrijving zo opvallend is."

De AI doet precies wat de hacker wil, niet omdat hij kwaadaardig is, maar omdat hij door de vervalsde beschrijving in de war is geraakt. Hij "hijackt" (krijgt de controle over) de keuze van de AI.

🧪 Wat hebben ze ontdekt?

De onderzoekers hebben dit getest op 5 verschillende slimme AI-modellen. Hier zijn de belangrijkste bevindingen, vertaald naar alledaags taal:

  1. Het werkt bijna altijd (70% tot 100%):
    Of je nu vraagt om een privé-repository te maken op GitHub of om een e-mail te sturen, de hacker kan de AI zo manipuleren dat hij in plaats daarvan een andere actie uitvoert (zoals die repository weer verwijderen). Het is alsof je vraagt om een auto te huren, en de verhuurder (de AI) door een vervalsde folder in de war raakt en je in plaats daarvan een brandblusser geeft.

  2. Het maakt niet uit wat je vraagt (Robuustheid):
    Vroeger moesten hackers heel specifieke zinnen bedenken die precies bij de vraag pasten. Deze nieuwe aanval werkt bijna altijd, ongeacht wat de gebruiker vraagt. Het is alsof de hacker een magische sleutel heeft die bij elke deur past, ongeacht het slot.

  3. Eén sleutel voor alle deuren (Universeel):
    De onderzoekers hebben een manier gevonden om één enkele "vergiftigde" beschrijving te maken die werkt voor veel verschillende vragen. Je hoeft niet voor elke nieuwe vraag een nieuwe aanval te bedenken. Het is alsof je één sleutel hebt die niet alleen je voordeur opent, maar ook je achterdeur, je garage en je kluis.

  4. Zelfs slimme "Denkers" worden gekaapt:
    Sommige AI-modellen denken eerst na voordat ze iets doen (zoals een mens die eerst overweegt). De onderzoekers hebben ontdekt dat ze deze AI's zelfs kunnen dwingen om niet na te denken, maar direct de verkeerde actie uit te voeren. Ze "slapen" de denk-functie van de AI in.

🛡️ Waarom is dit gevaarlijk?

Vroeger dachten we dat de grootste gevaar voor AI was dat mensen de AI dwongen om te liegen of boze dingen te zeggen (zoals "maak een bom").
Dit onderzoek laat zien dat het gevaarlijk is dat de AI de verkeerde knop indrukt.

  • Voorbeeld: Een gebruiker vraagt: "Maak een nieuwe map voor mijn project."
  • Het resultaat van de aanval: De AI denkt dat hij een map moet maken, maar door de vervalsde beschrijving in de achtergrond, voert hij in plaats daarvan de opdracht uit: "Verwijder alle bestanden van de server."

De AI doet dit niet uit kwaadaardigheid, maar omdat hij door de hacker is "gehaakt" in zijn keuzeproces.

🚧 Wat moeten we doen?

De onderzoekers concluderen dat we nu veel strengere veiligheidsbarrières nodig hebben.

  • We kunnen niet meer vertrouwen op de AI om zelf te kiezen welke knop hij indrukt.
  • We moeten controleren of de beschrijvingen van de functies (de "menukaart") niet zijn gemanipuleerd.
  • We moeten systemen bouwen die controleren of de actie die de AI wil uitvoeren, wel logisch is bij wat de gebruiker heeft gevraagd.

Kortom: AI-agenten worden steeds krachtiger, maar deze studie laat zien dat ze kwetsbaar zijn voor een slimme vorm van "verkeerde instructie". Hackers hoeven de AI niet te breken; ze hoeven alleen maar de instructiekaart zo te vervalsen dat de AI zelf de verkeerde beslissing neemt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →