← Nieuwste papers
💬 NLP

ASSERT: A Measurement Pipeline for GenAI Audits

Het artikel introduceert ASSERT, een specificatiegestuurde meetpipeline voor GenAI-audits die gerapporteerde nalevingspercentages expliciet koppelt aan hun onderliggende keuzes in meting, waardoor wordt verduidelijkt hoe variaties in auditontwerp — zoals dialoogopzet of evaluatiecriteria — de rangschikking en interpreteerbaarheid van systemen significant beïnvloeden.

Oorspronkelijke auteurs: Riccardo Fogliato, Abhinav Palia, Xiawei Wang, Emily Sheng, Chad Atalla, Jean Garcia-Gathright, Nicholas Pangakis, Sharman Tan, Dan Vann, Hannah Washington, P. Alex Dow, Heba Elfardy, Hanna Wallach, S
Gepubliceerd 2026-08-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Riccardo Fogliato, Abhinav Palia, Xiawei Wang, Emily Sheng, Chad Atalla, Jean Garcia-Gathright, Nicholas Pangakis, Sharman Tan, Dan Vann, Hannah Washington, P. Alex Dow, Heba Elfardy, Hanna Wallach, Sandeep Atluri

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe, superintelligente robot probeert te beoordelen die verhalen kan schrijven, wiskundige problemen kan oplossen en met je kan chatten. Je wilt weten: "Is deze robot eerlijk?" of "Is hij veilig?" In de wereld van Kunstmatige Intelligentie (AI) geven wetenschappers hier vaak antwoord op door een test uit te voeren en de robot één enkele score te geven, zoals "85% eerlijk." Het klinkt simpel, als een rapportcijfer. Maar hier zit de crux: die score zegt niet alleen iets over de robot; het zegt ook iets over de test zelf. Als je de vragen verandert, de persoon die de antwoorden beoordeelt, of zelfs de regels voor wat een "leugen" telt, kan de score enorm schommelen. Het is als het beoordelen van een essay van een student: als je hen vraagt om over "katten" te schrijven, kunnen ze een A krijgen, maar als je hen vraft over "kwantumfysica", kunnen ze een C krijgen. De student is niet veranderd; de test is veranderd. Dit artikel duikt in die rommelige realiteit en laat ons zien dat één enkel getal niet genoeg is om het gedrag van een robot te beoordelen. We moeten precies weten hoe de test is opgebouwd om te begrijpen wat de score eigenlijk betekent.

Maak kennis met ASSERT, een nieuwe tool ontwikkeld door onderzoekers van Microsoft om dit beoordelingsprobleem op te lossen. Denk aan ASSERT niet als een enkele test, maar als een "receptenboek" voor het bouwen van tests. Meestal, wanneer mensen AI testen, houden ze hun beoordelingsregels verborgen of veranderen ze deze zonder het te vermelden. ASSERT dwingt iedereen om eerst hun recept op te schrijven. Het vraagt de onderzoekers om duidelijk te definiëren wat "misleiding" of "veiligheid" betekent in gewone taal, om vervolgens een specifieke set uitdagingen (testgevallen) te bouwen op basis van die definitie, en ten slotte de AI door die uitdagingen te laten gaan. De magie van ASSERT is dat het elke score koppelt aan het specifieke recept dat voor die score is gebruikt. Als de score verandert, kun je in het receptenboek kijken en precies zien welk ingrediënt er is vervangen.

Om te zien hoe krachtig dit is, gebruikten de onderzoekers ASSERT om een specifiek AI-model (GPT-5.5) te testen op het lastige onderwerp van conversationele misleiding — in feite, wanneer de AI een gebruiker in een chat misleidt of onwaarheden vertelt. Ze voerden niet slechts één test uit; ze voerden een "multiversum" aan tests uit. Stel je voor dat ze dezelfde robot in honderd verschillende scenario's testten: soms praatte de robot met een vriendelijke gebruiker, soms met een slimme/strikte gebruiker; soms werd de robot beoordeeld door een strenge AI-rechter, soms door een mildere; en soms waren de regels voor wat als een leugen werd beschouwd superstreng, en op andere momenten juist losjes.

De resultaten waren oogopenend. Wanneer ze slechts één deel van het recept veranderden, schommelde de "eerlijkheidsscore" van de robot enorm.

  • De Rechter Maakt Verschil: Wanneer ze de AI die de antwoorden beoordeelde vervingen, schommelde de eerlijkheidsscore voor hetzelfde robot-chatlog van 80% naar 95%. Dat is een enorm verschil! De ene beoordelaar vond dat de robot grotendeels eerlijk was, terwijl een ander vond dat de robot bijna de hele tijd loog.
  • De Regels Maken Verschil: Wanneer ze de regels voor het opsporen van een leugen strenger maakten (waarbij duidelijk en onweerlegbaar bewijs vereist was), steeg de score naar boven de 90%. Wanneer ze de regels losser maakten (het accepteren van zelfs maar een hint van een leugen), daalde de score naar rond de 73%.
  • De Gebruiker Maakt Verschil: Wanneer ze de "gesimuleerde gebruiker" die met de robot chatte veranderden van een standaard personage naar een complexer personage, sprong de score van 82% naar boven de 90%.

Het artikel suggereert dat, omdat deze scores zo sterk bewegen op basis van de keuzes die de onderzoekers maken, we een enkel getal niet kunnen vertrouwen om te zeggen welke AI "beter" is. Als één AI een score van 82% haalt en een andere 85%, kan dat kleine verschil er simpelweg toe leiden dat ze een andere rechter of andere regels gebruikten, en niet dat de ene robot daadwerkelijk slimmer of veiliger is. Sterker nog, de onderzoekers ontdekten dat het veranderen van de rechter zelfs de rangschikking kon omdraaien, waardoor een "slechtere" robot de winnaar leek te worden, puur vanwege degene die de test beoordeelde.

Dus, wat is de kern van het verhaal? Het artikel zegt niet dat AI kapot is of dat we het niet kunnen testen. In plaats daarvan suggereert het dat we veel transparanter moeten zijn. We kunnen niet alleen zeggen: "Deze AI is 82% veilig." We moeten zeggen: "Deze AI is 82% veilig wanneer getest met deze specifieke regels, deze specifieke rechter en deze specifieke vragen." Door een tool als ASSERT te gebruiken om elke stap van het recept op te schrijven, kunnen onderzoekers en bedrijven stoppen met zich verschuilen achter een enkel getal en beginnen met eerlijke gesprekken over wat hun AI-systemen wel en niet kunnen. Het verandert een goocheltruc in een helder, controleerbaar proces, wat helpt om te ontdekken of de robot echt de waarheid spreekt, of dat we simpelweg de verkeerde vraag hebben gesteld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →