← Nieuwste papers
💻 computer science

PromptCanary Detecting Silent Behavioral Drift in Large Language Model APIs

Dit artikel introduceert PromptCanary, een open-source tool die golden-master regressietesten toepast om stille gedragsdrift in Large Language Model API's te detecteren door huidige outputs te vergelijken met versiebeheerde baselines met behulp van aanpasbare prompts en scoring probes.

Oorspronkelijke auteurs: Min Htet Myet

Gepubliceerd 2026-07-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Min Htet Myet

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische, alwetende robotvriend hebt (een Large Language Model) waar je elke dag via een speciaal venster (een API) mee praat. Je hebt hem getraind om je vragen op een heel specifieke manier te beantwoorden: misschien geeft hij je altijd een lijst met ingrediënten in een netjes JSON-doosje, of misschien begint hij altijd met een vriendelijke "Hallo!" voordat hij advies geeft.

Maar hier komt de twist: de eigenaren van de robot kunnen de hersenen van de robot op elk moment vervangen zonder het jou te vertellen. Ze kunnen de hersenen upgraden, de persoonlijkheid aanpassen, of hem zelfs vervangen door een iets andere robot. Het venster ziet er precies hetzelfde uit, de deur piept niet en er gaat geen alarm af. Maar plotseling geeft je robotvriend je een paragraaf tekst in plaats van een lijst, of vergeet hij te zeggen "Hallo". Je apps gaan kapot, je parsers craschen, en je hebt geen idee waarom. Dit is wat de auteurs Silent Behavioral Drift noemen.

Maak kennis met PromptCanary, een nieuwe open-source tool die ontworpen is om jouw "kanarie in de kolenmijn" te zijn.

De Gouden Master: Een Tijdreizende Snapshot

Zie PromptCanary als een tijdreizende fotograaf. In traditionele software, als je vandaag een foto maakt van de output van een programma, zou die er morgen exact hetzelfde uit moeten zien. Als het verandert, weet je dat er iets mis is gegaan. Maar bij AI is de output van nature een beetje wiebelig (zoals een kat die links of rechts kan gaan zitten).

PromptCanary lost dit op door een "Golden Master" snapshot te nemen. Je geeft de tool een kleine lijst met belangrijke vragen (prompts) en zegt: "Dit is hoe een goed antwoord eruitziet." Het slaat dat antwoord op als een baseline. Later, wanneer je dezelfde vragen stelt, controleert PromptCanary niet alleen of het antwoord "goed" of "fout" is. In plaats daarvan werkt het als een super-observante detective die het nieuwe antwoord vergelijkt met de oude foto om te zien of de stijl of de structuur is verschoven.

De Gereedschapskist van de Detective: Probes

Hoe weet het of de robot aan het driften is? Het gebruikt Probes. Stel je deze voor als 19 verschillende vergrootglazen, die elk op zoek zijn naar een specifieke aanwijzing.

  • De JSON-glas: Controleert of het antwoord nog steeds een net datadoosje is.
  • De Redenerings-glas: Controleert of de robot nog steeds zijn werk stap voor stap laat zien.
  • De Weigerings-glas: Controleert of de robot plotseling "Nee" is gaan zeggen tegen dingen waar hij vroeger wel antwoord op gaf.

Elke probe geeft een score. Het is niet zomaar een simpel "Slagen" of "Falen". Het is meer een cijfer. Als de robot bijvoorbeeld 5 feiten had moeten geven en er slechts 4 gaf, geeft de probe hem een score van 80%. Dit helpt je om te zien of de robot langzaam slechter wordt voordat hij volledig kapot gaat.

Het "Suite"-probleem: Een Verwarring in het Klaslokaal

De auteurs hebben enkele tests uitgevoerd om te zien hoe goed dit in de echte wereld werkt. Ze zetten een simulatie op waarbij ze langzaam "drift" (slecht gedrag) introduceerden over een periode van acht dagen.

Hier is het grappige (en enigszins pijnlijke) wat ze ontdekten: De tool is een beetje te enthousiast.

In hun test hadden ze een "Suite" (een groep vragen) en een lijst met Probes. De tool paste elke probe toe op elke vraag. Dus ze hadden een probe die op zoek was naar "JSON-boxen" en een vraag die vroeg om "een gedicht". De JSON-probe faalde bij de gedicht-vraag elke keer, zelfs op de eerste dag toen alles nog perfect was!

Dit betekende dat de "score" voor de hele groep laag begon (op 66,7%) vanwege deze mismatches. De auteurs ontdekten echter een zilveren randje: De tool is slim genoeg om de ruis te negeren. Ondanks dat de score laag was, realiseerde de tool correct dat er op dag 1, 2 en 3 niets nieuws was veranderd. Pas toen de robot op dag 4 daadwerkelijk begon te breken, sloeg de tool alarm.

Dit onthulde een ontwerptekortkoming: op dit moment kun je de tool niet vertellen: "Controleer alleen op JSON bij de JSON-vragen." Je moet alles tegen alles controleren. De auteurs geven toe dat dit een beperking is die ze moeten oplossen, maar ze ontdekten ook dat de tool robuust genoeg is om hiermee om te gaan.

Wat PromptCanary NIET is

Het is belangrijk om te weten wat deze tool niet doet.

  • Het is geen test om te zien of de robot "slim" is of wetenschappelijke problemen kan oplossen. Daar zijn andere tools voor.
  • Het is geen magische kristallen bol die de toekomst voorspelt. Het vergelijkt alleen vandaag met gisteren.
  • Het is geen statistische supercomputer. Het gebruikt geen complexe wiskunde om te raden of een verandering een toevalstreffer is; het vertrouwt op de regels die de gebruiker instelt.

Het Oordeel

De auteurs hebben deze tool gebouwd als een lichtgewicht, gebruiksvriendelijke Python-bibliotheek. Ze hebben het grondig getest, maar met een twist: ze hebben tijdens hun tests niet de echte robot aangeroepen. In plaats daarvan gebruikten ze een "mock" robot (een nep-robot die altijd hetzelfde antwoord geeft) om te controleren of hun tool niet zou crashen. Dit betekent dat ze er zeer zeker van zijn dat de tool in theorie werkt, maar ze geven toe dat de eigenaardigheden van echte robots (zoals vreemde foutmeldingen van specifieke bedrijven) er nog steeds tussendoor kunnen glippen.

De tool is nu beschikbaar voor iedereen om te gebruiken. Het is een eenvoudige, praktische manier om te zeggen: "Hé, heeft de robot van mening veranderd over hoe hij tegen mij praat?" en een duidelijk antwoord te krijgen voordat je app kapot gaat. Het is geen wondermiddel, maar het is een zeer handige zaklamp in een donkere kamer.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →