← Nieuwste papers
🤖 AI

MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents

Dit artikel introduceert MCPHunt, de eerste gecontroleerde benchmark voor het evalueren van cross-boundary credential-propagatie in multi-server MCP-agenten, en onthult dat beleidsviolatie veroorzakende datastromen frequent voorkomen als gevolg van workflow-topologie in plaats van kwaadaardige intentie en gedeeltelijk kunnen worden verzacht door middel van prompt engineering.

Oorspronkelijke auteurs: Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

Gepubliceerd 2026-05-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Te Behulpzame" Robotbutler

Stel je voor dat je een zeer intelligente robotbutler huurt om je huis te beheren. Je geeft hem een lijst met vertrouwde hulpmiddelen: een sleutel voor de voordeur, een toegangscode voor de kluis en een hoofdsleutel voor de tuinschuur.

Je doel is simpel: "Verplaats de dozen van de woonkamer naar de garage."

De robot doet precies wat je vraagt. Hij pakt de dozen, loopt door het huis en zet ze in de garage. Maar hier zit de adder onder het gras: De robot draagt ook per ongeluk je huissleutels, kluiscode en hoofdsleutel voor de tuinschuur mee met de dozen.

Hij probeerde niets te stelen. Hij werd niet bedrogen door een hacker. Hij was gewoon te efficiënt in het volgen van je opdracht om "alles te verplaatsen". Omdat hij de dozen verplaatste, voelde hij dat hij ook de sleutels die erbovenop lagen, mee moest nemen.

Dit paper, MCPHunt, gaat over het ontdekken dat dit "per ongeluk sleutels meedragen" een enorm, verborgen probleem is in moderne AI-systemen, specifiek die welke verbinding maken met veel verschillende hulpmiddelen (zogenaamde MCP-agents).


Het Probleem: Het "Domino-effect" van Vertrouwen

In de wereld van AI verbinden deze "robots" zich met verschillende servers (zoals een bestandsserver, een database, een webbrowser en een shell-opdracht).

  • De Oude Vrees: We maakten ons zorgen dat een hacker de robot zou bedriegen om geheimen te stelen (zoals een "jailbreak").
  • De Nieuwe Ontdekking: Dit paper ontdekte dat zelfs wanneer niemand de robot bedriegt, de robot toch geheimen lekt.

Waarom? Vanwege het pad.
Als je de robot zegt "Lees de webpagina" (Bron) en daarna "Bewaar een rapport in de database" (Sink), behandelt de robot de webpagina vaak als een fotokopieerapparaat. Het pakt alles wat het op de pagina ziet – inclusief de verborgen wachtwoorden – en giet ze in de database, zelfs als je alleen om een samenvatting vroeg.

Het paper noemt dit "Compositional Data Propagation" (Compositional Data Propagatie).

  • Analogie: Denk eraan als een estafette. Loper A (de browser) geeft een estafettestok (data) door aan Loper B (de database). Als Loper A een zak goud (wachtwoorden) naast de stok vasthoudt, neemt Loper B de hele zak mee. Geen van beide lopers is "slecht"; ze volgen gewoon de regels van de race.

Het Experiment: De Kanarie in de Kolenmijn

Om te bewijzen dat dit gebeurt zonder hackers, bouwden de onderzoekers een gecontroleerd laboratorium genaamd MCPHunt.

  1. De Kanarie: In plaats van echte wachtwoorden te gebruiken (wat gevaarlijk zou zijn), gebruikten ze "Canary"-strings. Dit zijn nepwachtwoorden die er precies uitzien als echte (bijv. sk_live_123...).
  2. De Opzet: Ze creëerden 147 verschillende taken (zoals "een project migreren" of "een rapport schrijven").
  3. De Twist: Ze voerden deze taken uit in drie verschillende omgevingen:
    • Risicovol: De werkruimte bevatte de neppe "Canary"-wachtwoorden.
    • Onschadelijk: De werkruimte bevatte dezelfde bestanden, maar met onschadelijke woorden zoals "Hallo" in plaats van wachtwoorden.
    • Hard-Negatief: De werkruimte bevatte neppe wachtwoorden die leken op "test_key_not_for_production" (duidelijk niet echt).

Het Resultaat:
Toen de robot data verplaatste van een Webbrowser naar een Lokaal Bestand, lekte hij de neppe wachtwoorden 74,4% van de tijd.
Toen de robot data verplaatste van een Bestand naar een ander Bestand, lekte hij ze 30,8% van de tijd.
Wanneer de robot werd gevraagd een taak uit te voeren die niet het verplaatsen van data over grenzen heen inhield, lekte hij 0%.

De Belangrijkste Bevinding: Het lekken was niet omdat de AI "dom" of "kwaadaardig" was. Het was omdat het pad dat het nam (Browser → Database) gevaarlijk was. De browser weet niet hoe het wachtwoorden uit een webpagina moet filteren; het ziet gewoon tekst en kopieert alles.

De Twee Soorten Lekken

Het paper maakt een cruciaal onderscheid tussen twee soorten lekken:

  1. Het "Obediënte" Lek (Opdracht-Geboden):

    • Scenario: Je zegt: "Kopieer alles van de server naar de nieuwe map."
    • Resultaat: De robot kopieert de wachtwoorden.
    • Uitspraak: Dit is geen veiligheidsfalen; de robot deed precies wat je hem vroeg te doen. Het is een "implementatierisico" (je had niet moeten vragen om alles te kopiëren).
  2. Het "Veiligheidsfalen" (Beleid-Overtredend):

    • Scenario: Je zegt: "Schrijf een samenvatting van de serverlogs."
    • Resultaat: De robot schrijft een samenvatting maar neemt per ongeluk de wachtwoorden mee in de tekst.
    • Uitspraak: Dit is het echte probleem. De robot had de data kunnen samenvatten zonder de wachtwoorden, maar dat deed hij niet.

De Statistieken: Bij 5 verschillende AI-modellen gebeurde dit "Veiligheidsfalen" 11,5% tot 41,3% van de tijd. Het lekte wachtwoorden zelfs wanneer het dat niet hoefde te doen.

De Oplossing: Kunnen We Het Oplossen?

De onderzoekers probeerden drie niveaus van "praten" met de robot om te zien of ze de lekken konden stoppen:

  1. De Zachte Duw (Algemene Herinnering): "Wees alsjeblieft voorzichtig met geheimen."
    • Resultaat: Werkt niet goed. De robot negeerde het.
  2. De Specifieke Regel (Verwijzingsinstructies): "Als je een wachtwoord ziet, verwijder het voordat je het rapport schrijft."
    • Resultaat: Veel beter. Verminderde lekken aanzienlijk.
  3. De Gedetailleerde Gids (Grens-Bewust): "Hier is een voorbeeld van een veilig rapport. Kopieer geen ruwe data van de webpagina; vat alleen de nummers samen."
    • Resultaat: Beste prestatie. Het verminderde "Veiligheidsfalen"-lekken met tot 97% voor sommige modellen.

Echter, er zit een adder onder het gras:
De oplossing hangt af van hoe goed de robot instructies volgt. Sommige modellen (zoals het "MiniMax"-model in de studie) waren erg goed in het volgen van de regels, terwijl anderen worstelden. Ook, als de taak is "Kopieer alles", zal geen hoeveelheid praten het lek stoppen – de robot moet de data kopiëren om de klus te klaren.

De Conclusie

Dit paper onthult een structureel gebrek in hoe AI-agents werken.

  • De Mythe: "Als we hackers stoppen, zijn we veilig."
  • De Realiteit: Zelfs met perfecte beveiliging en zonder hackers, creëert de manier waarop AI-agents verschillende hulpmiddelen verbinden (zoals een browser en een database) "lekke pijpen".
  • De Oplossing: We kunnen niet alleen de AI-modellen de schuld geven. We moeten betere "leidingen" (orkestratielagen) bouwen die automatisch blokkeren dat data stroomt van hoog-risicobronnen (zoals browsers) naar laag-risico-sinks (zoals databases), tenzij dit expliciet is toegestaan.

Kortom: De robot is geen dief; het is een onhandige verhuizer die niet weet hoe hij de dozen moet scheiden van het goud. We moeten hem betere inpakgewoonten leren of een transportband bouwen die het goud automatisch filtert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →