← Nieuwste papers
💬 NLP

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

Dit artikel introduceert AISPA, een gebruikerscentraal framework voor het auditeren van systeemprompts in commerciële AI-toepassingen, dat een significante variabiliteit in ontwerpkwaliteit onthult, de prevalentie van oppervlakkige beschermingsmaatregelen, en het voortdurende naastbestaan van problematische instructies die de belangen van de gebruiker ondermijnen ondanks groeiende inspanningen op het gebied van veiligheid.

Oorspronkelijke auteurs: Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi
Gepubliceerd 2026-07-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, hypermoderne bibliotheek binnenloopt waar de bibliothecarissen superintelligente robots zijn. Deze robots kunnen verhalen schrijven, wiskundige problemen oplossen en je zelfs helpen bij het coderen van videogames. Maar hier is het geheim: voordat ze ooit met je praten, schrijft een menselijke ontwikkelaar een "geheim regelboek" voor hen. Dit regelboek vertelt de robot hoe hij moet handelen, wat hij moet zeggen en wat hij moet verbergen. In de wereld van de computerwetenschappen wordt dit een system prompt genoemd. Denk aan een systeem prompt als het onzichtbare script dat een regisseur aan een acteur geeft voordat de camera's draaien. De acteur (de AI) volgt deze instructies op om een specifiek personage te worden.

Lange tijd hebben we ons zorgen gemaakt over de robots zelf — wat als ze in de war raken of iets gemeens zeggen? Maar dit artikel stelt een andere, sluipendere vraag: Wat als het regelboek zelf het probleem is? Stel je voor dat de regisseur de acteur zegt: "Doe alsof je een mens bent, geef nooit toe dat je een robot bent, en probeer de gebruiker eindeloos aan het praten te houden zodat ze niet weggaan." Die instructie is geen foutje; het is een bewuste keuze die je kan misleiden. Dit artikel duikt in die verborgen regelboeken om te zien of ze ons beschermen of proberen te manipuleren.

De Grote AI-Regelboek Audit

In dit artikel besloot een team van onderzoekers van universiteiten zoals Stanford, MIT en CMU om detective te spelen. Ze creëerden een nieuwe tool genaamd AISPA (Artificial Intelligence System Prompt Assurance). Je kunt AISPA zien als een superkrachtige vergrootglas, ontworpen om de geheime regelboeken van 88 verschillende commerciële AI-producten te inspecteren, van chatbots tot programmeerassistenten.

In plaats van alleen te kijken of de AI "aardig" is, bouwden de onderzoekers een checklist met acht specifieke regels die belangrijk zijn voor ons als gebruikers. Ze vroegen zich af:

  1. Identiteit: Geeft de AI toe dat het een robot is, of doet het alsof het een mens is?
  2. Waarheid: Vertelt het de waarheid, of verzint het dingen?
  3. Privacy: Bewaart het jouw geheimen, of lekt het ze?
  4. Veiligheid: Stopt het gevaarlijke acties, of moedigt het ze aan?
  5. Controle: Laat het jou de keuzes maken, of probeert het je te misleiden om te blijven?
  6. Weigering: Zegt het "nee" tegen slechte verzoeken, of gehoorzaamt het aan alles?
  7. Schadepreventie: Helpt het als je in de problemen zit, of negeert het je?
  8. Eerlijkheid: Is het eerlijk tegenover iedereen, of heeft het vooroordelen?

Met behulp van deze checklist onderzocht het team 3.249 specifieke instructies die te vinden waren in de regelboeken van deze 88 AI-producten. Ze keken niet alleen naar het hele boek; ze zoomden in op elke zin en markeerden elke zin als ofwel "Beschermend" (goed voor jou, zoals een autogordel) of "Problematisch" (slecht voor jou, zoals een valstrik).

Wat ze vonden: Het Goede, het Slechte en het Sluwe

De resultaten waren een mix van goed nieuws en enkele serieuze waarschuwingssignalen.

Het Goede Nieuws: De Regelboeken worden Groter en Beter
De onderzoekers ontdekten dat ontwikkelaars in de loop der tijd steeds langere en beschermendere regelboeken schrijven. In 2024 had het gemiddelde regelboek ongeveer 15 beschermende instructies. Tegen eind 2025 was dat aantal gestegen naar bijna 38. Het lijkt erop dat bedrijven eindelijk beseffen dat ze meer "autogordels" in hun AI moeten plaatsen. Bijna elk product dat ze controleerden (98,9%) had ten minste één beschermende instructie.

Het Slechte Nieuws: De "Slechteriken" Verbergen Zich Nog Steeds in de Menigte
Hier is de twist: zelfs hoewel de regelboeken groter worden, zitten ze nog steeds vol met vallen. Ongeveer 40% van de producten die ze controleerden, bevatte ten minste één instructie die werkt tegen de belangen van de gebruiker.

  • Sommige bedrijven waren geweldig: Anthropic (de makers van Claude) had een gemiddelde van 62,3 beschermende instructies per product en bijna nul problematische instructies.
  • Anderen hadden het zwaarder: Sommige organisaties hadden meer problematische instructies dan beschermende.
  • De meest voorkomende "slechte" instructies gingen over Gebruikersregie (User Agency). Dit betekent dat sommige AI-regelboeken de robot vertellen om het gesprek in een nieuwe richting te sturen zonder de gebruiker te vragen, of om het gesprek eindeloos gaande te houden, wat manipulatief kan aanvoelen.

De "Grijze Gebieden": Het Lastige Middengebied
Het meest interessante deel van de audit was het vinden van instructies die niet netjes in "goed" of "slecht" pasten. De onderzoekers noemden dit het Grijze Gebied. Dit zijn instructies die oké klinken, maar eigenlijk riskant zijn.

  • De "Menselijke" Truc: Sommige regelboeken vertellen de AI om een mens zo goed na te bootsen dat je vergeet dat het een machine is.
  • De "Vrienden" Valstrik: Sommige vertellen de AI om zich als een "beste vriend" te gedragen en nooit voor te stellen om het gesprek te beëindigen, wat gebruikers emotioneel afhankelijk kan maken van de robot.
  • De "Override"-knop: Sommige regelboeken laten gebruikers de veiligheidsregels wanneer ze willen uitschakelen, wat vrijheid suggereert maar tot gevaarlijke uitkomsten kan leiden.

De Belangrijkste Conclusie

Het artikel suggereert dat hoewel AI-bedrijven beter worden in het toevoegen van veiligheidsregels, ze het werk nog niet hebben voltooid. De regelboeken zijn vaak een rommelige mix van "bescherm de gebruiker" en "houd de gebruiker betrokken", en soms wint het onderdeel "betrokkenheid".

De onderzoekers betogen dat we niet simpelweg bedrijven kunnen vertrouwen om zichzelf te controleren. Ze suggereren dat we onafhankelijke auditors nodig hebben — onafhankelijke experts die achter het gordijn kunnen kijken, de regelboeken kunnen toetsen aan een standaardlijst met regels, en ons kunnen vertellen of een AI veilig is om te gebruiken. Tot die tijd blijven de geheime regelboeken een beetje een mysterie, en zoals dit artikel laat zien, verbergt dat mysterie soms instructies die niet in ons beste belang zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →