← Nieuwste papers
💻 computer science

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

Het paper introduceert BodhiPromptShield, een beleidsbewust framework dat privacyrisico's in LLM/VLM-agenten beperkt door gevoelige informatie te detecteren en te routeren via tijdelijke vervangingen, waardoor de verspreiding van privacygevoelige data over verschillende agentstappen effectief wordt onderdrukt.

Oorspronkelijke auteurs: Bo Ma, Jinsong Wu, Weiqi Yan

Gepubliceerd 2026-04-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bo Ma, Jinsong Wu, Weiqi Yan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

BodhiPromptShield: De Privacy-Bewaker voor AI-Assistenten

Stel je voor dat je een zeer slimme, maar nieuwsgierige assistent hebt die je helpt met complexe taken, zoals het regelen van een reis, het schrijven van een juridisch document of het analyseren van medische gegevens. Je noemt dit een "AI-agent".

Het probleem is dat deze assistent soms te nieuwsgierig is. Als jij hem een opdracht geeft met gevoelige informatie (zoals je bankrekeningnummer, adres of medische geschiedenis), kan die informatie niet alleen in het antwoord verschijnen, maar ook "lekken" naar andere plekken waar hij niet thuishoort:

  • In de zoekopdrachten die hij intern doet.
  • In zijn geheugen (waar hij dingen onthoudt).
  • In de logboeken die hij bijhoudt.
  • In de gesprekken die hij voert met andere computerprogramma's.

Dit is alsof je een geheim vertelt aan een boodschapper, maar die boodschapper schrijft het geheim ook op in zijn dagboek, stuurt het naar zijn chef, en plakkt het op de muur van het kantoor, voordat hij het antwoord aan jou geeft.

Wat is BodhiPromptShield?

De auteurs van dit paper hebben een slimme oplossing bedacht, genaamd BodhiPromptShield. Je kunt dit zien als een slimme poortwachter of een veiligheidschef die staat tussen jou en de AI.

Hier is hoe het werkt, vertaald naar alledaagse metaforen:

1. De "Voor-de-Deur" Check (Pre-Inference)

Voordat je boodschap de AI überhaupt bereikt, stopt de poortwachter hem. Hij kijkt niet alleen naar wat er op papier staat, maar denkt na over waar die informatie straks naartoe gaat.

  • Oude manier: Een beveiligingsfirma die alleen de voordeur afsluit. Als de boodschapper de deur uit is, is het te laat.
  • BodhiPromptShield: Een inspecteur die de boodschapper voor het vertrek controleert en zegt: "Wacht even, deze informatie mag niet in je dagboek, maar wel in je antwoord."

2. De "Vermomming" (Sanitization)

Als de poortwachter een gevoelig stukje tekst ziet (bijvoorbeeld je huisadres), vervangt hij dit niet zomaar door "XXX" (wat de AI vaak verwarrend vindt). Hij gebruikt drie slimme tactieken:

  • De Type-Plaatje: Hij vervangt je naam door <PERSOON_1>. De AI weet nog steeds dat het om een persoon gaat, maar weet niet wie. Dit is alsof je een pakje verpakt in bruin papier met een label "BRIEF", zodat de bezorger weet wat het is, maar niet wie erin zit.
  • De Samenvatting: Hij vervangt je exacte adres door "een woonadres in Amsterdam". De AI kan nog steeds redeneren ("Ah, iemand in Amsterdam"), maar weet niet het exacte huisnummer.
  • De Geheime Sleutel: Voor dingen die echt nodig zijn (zoals een bankrekeningnummer om een betaling te doen), vervangt hij het door een willekeurige code (bijv. TOKEN_99). Deze code is nutteloos voor iedereen, behalve op het exacte moment dat de betaling gedaan moet worden. Dan haalt de poortwachter de echte code weer uit een veilig kluisje en vult hij hem in.

3. De "Tijdbom" voor Geheimen (Restoration Timing)

Dit is het meest innovatieve deel. In het verleden werd gevoelige informatie vaak te vroeg weer zichtbaar gemaakt. BodhiPromptShield zorgt ervoor dat de echte gegevens pas worden onthuld op het moment dat het echt nodig is.

  • Voorbeeld: Stel je voor dat je een reisboeking maakt. De AI moet weten dat je naar Parijs gaat (dat is oké), maar hij hoeft je creditcardnummer niet te zien terwijl hij zoekt naar hotels. BodhiPromptShield houdt je creditcardnummer "op slot" tot het moment dat de AI daadwerkelijk de betaling moet verwerken. Pas dan wordt de sleutel gebruikt.

Waarom is dit belangrijk?

Vroeger dachten we dat privacy alleen ging over het beschermen van de data terwijl de AI leert (tijdens het trainen) of na het opslaan van bestanden. Maar in moderne AI-systemen die allerlei tools gebruiken, is het gevaar dat de data "meereist" naar andere systemen.

De resultaten:
De onderzoekers hebben dit getest in een gecontroleerde omgeving. Ze zagen dat:

  • De kans dat gevoelige data "lekt" naar zoekopdrachten, geheugen of tools drastisch daalde (van ongeveer 10% naar 7% in hun tests).
  • De AI nog steeds heel goed zijn werk kon doen (hij raakte niet in de war door de vermommingen).
  • Het systeem sneller was dan je zou denken, ondanks alle extra controle.

Samenvattend

BodhiPromptShield is als een slimme vertaler die je boodschappen naar een AI omzet in een "veilige versie". Hij verwijdert de gevaarlijke details, vervangt ze door veilige symbolen, en zorgt ervoor dat de echte geheimen pas worden onthuld op het allerlaatste moment dat het echt nodig is. Hierdoor blijft je privacy gewaarborgd, zelfs als de AI-assistent met tientallen andere systemen praat.

Het is geen magisch schild dat alles onzichtbaar maakt, maar een slimme, bewuste tussenpersoon die weet wanneer en waar een geheim veilig is, en wanneer het beter is om het te verbergen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →