← Nieuwste papers
🤖 AI

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

Dit artikel vestigt een fundamenteel raamwerk voor het standaardiseren van gerandomiseerde gecontroleerde trials in AI-evaluatie door het vier-validiteitsmodel van Shadish et al. en de TOP-richtlijnen aan te passen tot vijf principes en 33 operationele richtlijnen die prioriteit geven aan menselijke prestaties, causale inferentie en transparantie om unieke uitdagingen in studies naar mens-AI-interactie aan te pakken.

Oorspronkelijke auteurs: Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

Gepubliceerd 2026-05-06
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert uit te vinden of een nieuwe, super slimme rekenmachine mensen echt helpt om wiskundeproblemen beter op te lossen, of dat het hen alleen maar het gevoel geeft dat ze het beter doen.

Lange tijd hebben wetenschappers die AI testen, zich gedragen als koks die hun eigen soep proeven zonder recept. Ze zeggen misschien: "Deze soep smaakt geweldig!" maar ze hebben je niet verteld welke ingrediënten ze hebben gebruikt, hoeveel zout er is toegevoegd, of ze het proefden terwijl ze een blinddoek droegen. Soms verandert de "soep" (de AI) halverwege de proeverij van smaak, of zijn de proevers allemaal professionele koks in plaats van gewone gasten.

Dit artikel is een nieuw, streng receptenboek voor het testen van AI. Het zegt: "Stop met gokken. Laten we een behoorlijk, wetenschappelijk experiment uitvoeren om te zien of AI mensen echt helpt."

Hier is de eenvoudige uitleg van hun "recept", met behulp van alledaagse analogieën:

1. De Kernidee: De "Menselijke Opwaartse Beweging"-test

De meeste AI-tests vandaag zijn als een crashtest waarbij ze de auto gewoon tegen een muur laten knallen om te zien hoeveel de auto beschadigt. Dit artikel zegt dat we de bestuurder moeten testen, niet alleen de auto.

  • De Oude Manier: "Kijk, de AI heeft deze code geschreven!"
  • De Nieuwe Manier: "We hebben de helft van de mensen de AI gegeven en de andere helft niet. Hebben de mensen met de AI eigenlijk betere code geschreven, sneller geleerd of minder fouten gemaakt dan de mensen zonder?"

2. De Vijf Regels van het Spel (De Principes)

De auteurs hebben regels ontleend aan de geneeskunde en psychologie en er een nieuwe voor AI aan toegevoegd. Denk hierbij aan de vijf pijlers die een brug dragen. Als één zwak is, stort de brug (het onderzoek) in.

  • Regel 1: Meten we het juiste ding? (Construct Validiteit)

    • Analogie: Stel je wilt testen of een nieuwe hardloopschoen je sneller maakt. Als je meet "hoe hard de schoen piept", meet je geen snelheid.
    • Het Punt van het Artikel: Tel niet alleen hoeveel woorden een AI iemand heeft geholpen te schrijven (dat is makkelijk te vervalsen). Meet of de kwaliteit van het denken daadwerkelijk is verbeterd.
  • Regel 2: Heeft de AI de verandering daadwerkelijk veroorzaakt? (Interne Validiteit)

    • Analogie: Als je een groep mensen een nieuwe vitamine geeft en ze worden gezonder, was het dan de vitamine? Of was het dat ze ook zijn gaan salade eten en meer zijn gaan slapen?
    • Het Punt van het Artikel: Je moet ervoor zorgen dat het enige verschil tussen de twee groepen de AI is. Als de "AI-groep" ook betere instructies kreeg of een mooiere computer, kun je de AI niet de schuld geven van het succes. Ook moet je voorkomen dat de "geen-AI-groep" in het geheim een kijkje neemt bij de AI.
  • Regel 3: Werkt dit voor iedereen? (Externe Validiteit)

    • Analogie: Als een medicijn werkt op 20-jarige mannen in een lab, werkt het dan op 70-jarige vrouwen in een ziekenhuis?
    • Het Punt van het Artikel: Test AI niet alleen op computerexperts of alleen op universitair studenten. Als je dat doet, kun je niet beweren dat het voor iedereen werkt. Je moet duidelijk zeggen: "Dit werkt voor deze mensen, in deze situatie."
  • Regel 4: Zijn de cijfers echt? (Statistische Conclusie Validiteit)

    • Analogie: Als je een muntstuk 3 keer opgooit en elke keer kop krijgt, denk je misschien dat de munt magisch is. Maar als je het 1.000 keer opgooit, is het waarschijnlijk gewoon geluk.
    • Het Punt van het Artikel: Raak niet enthousiast over kleine verbeteringen die gewoon geluk kunnen zijn. De auteurs zeggen dat we super streng moeten zijn met onze wiskunde (door een strengere "p-waarde" van 0,005 te gebruiken in plaats van de gebruikelijke 0,05) omdat AI-beweringen hoge inzet hebben. We moeten weten hoeveel beter de AI dingen heeft gemaakt, niet alleen of het dingen "beter" heeft gemaakt.
  • Regel 5: Laat je werk zien! (Transparantie, Herhaalbaarheid en Verificatie)

    • Analogie: Als een goochelaar zegt: "Ik heb een konijn laten verschijnen", maar je de hoed of het konijn niet laat zien, geloof je hem niet.
    • Het Punt van het Artikel: AI verandert snel. Als je niet precies opschrijft welke versie van de AI je hebt gebruikt, welke prompts je hebt getypt en je data deelt, kan niemand je werk later controleren. Het artikel creëert een "vertrouwensladder" van 4 niveaus:
      1. Openbaarmaking: "We hebben je verteld wat we hebben gedaan."
      2. Delen: "We hebben je de data en code gegeven."
      3. Verificatie: "Een onafhankelijke persoon heeft gecontroleerd of de code daadwerkelijk draait."
      4. Herhaalbaarheid: "Een ander team heeft het geprobeerd met nieuwe mensen en hetzelfde resultaat gekregen."

3. De 33-Stappen Checklist

Het artikel geeft niet alleen regels; het geeft een 33-stappen checklist voor onderzoekers.

  • Voorbeeld: "Schrijf voordat je begint precies op wat je test, zodat je de regels halverwege niet kunt veranderen."
  • Voorbeeld: "Zorg ervoor dat de mensen in de 'geen AI'-groep niet in het geheim AI op hun eigen telefoons gebruiken."
  • Voorbeeld: "Controleer of de AI het werk sneller maar slechter maakt, of langzamer maar beter."

4. Waarom hebben we dit nodig?

Op dit moment zit de wereld vol met AI-studies die verwarrend zijn. Sommigen zeggen dat AI geweldig is; anderen zeggen dat het nutteloos is. De auteurs zeggen dat dit komt omdat iedereen volgens verschillende regels speelt.

  • Het Probleem: Als we de studies niet kunnen vertrouwen, kunnen we misschien gevaarlijke AI inzetten, of kunnen we nuttige AI negeren.
  • De Oplossing: Dit artikel is een "standaard operationele procedure". Het is een blauwdruk voor het bouwen van een brug van vertrouwen. Het helpt onderzoekers bij het plannen van hun studies, helpt reviewers controleren of een studie goed is, en helpt overheden wetten te maken op basis van echte feiten, niet op gissingen.

Samenvatting

Denk aan dit artikel als de FDA (Food and Drug Administration) voor AI-experimenten. Net zoals je geen nieuw medicijn zou eten zonder een rigoureuze, dubbelblinde klinische studie, zouden we geen beweringen over AI die mensen helpt moeten vertrouwen zonder deze strenge, gestandaardiseerde tests. Het gaat erom te gaan van "We denken dat AI cool is" naar "We hebben bewijs dat AI deze mensen helpt deze taak beter uit te voeren."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →