← Nieuwste papers
🤖 AI

Is your AI Model Accurate Enough? The Difficult Choices Behind Rigorous AI Development and the EU AI Act

Dit artikel daagt het idee uit dat nauwkeurigheid een puur technische eigenschap is en toont aan dat de definitie en meting ervan afhankelijk zijn van contextgebonden normatieve keuzes, met name in het licht van de EU AI-wetgeving die een 'adequaat niveau van nauwkeurigheid' voor hoogrisicosystemen voorschrijft.

Oorspronkelijke auteurs: Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

Gepubliceerd 2026-04-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Is je AI slim genoeg? De moeilijke keuzes achter de "juiste" nauwkeurigheid

Stel je voor dat je een nieuwe, slimme app hebt ontwikkeld die huidaandoeningen kan detecteren. De makers zeggen trots: "Onze app is 99,8% nauwkeurig!" Klinkt geweldig, toch? Maar wat als die app simpelweg altijd zegt dat het vlekje onschuldig is? Omdat de meeste vlekjes inderdaad onschuldig zijn, zou die app inderdaad 99,8% van de tijd gelijk hebben. Maar dan heeft hij de ene keer dat het écht kanker is, net die ene keer niet gezien. Dat is dodelijk.

Dit is precies waar dit paper over gaat: Nauwkeurigheid is niet zomaar een cijfer. Het is geen objectieve meetlat zoals een liniaal, maar meer zoals een kompas dat je zelf moet instellen.

De auteurs (juristen en tech-experts) kijken naar de nieuwe EU AI-wet. Deze wet zegt dat gevaarlijke AI-systemen (zoals die huidaandoeningen-app) een "passend niveau van nauwkeurigheid" moeten hebben. Maar wat is "passend"? Dat is de vraag.

Het paper legt uit dat er vier cruciale keuzes zijn die ontwikkelaars moeten maken. Elke keuze is een mix van techniek en ethiek (ze noemen dit techno-normatieve keuzes). Laten we deze vier keuzes uitleggen met een creatief verhaal: Het bouwen van een veiligheidsbril.

De Vier Keuzes (De "Recept" voor een veilige AI)

Stel je voor dat je een bril bouwt die moet voorkomen dat je tegen een muur loopt. Hoe bepaal je of die bril goed genoeg is?

1. Welke maatstaf gebruik je? (De "Welke regel telt?"-keuze)

Je kunt kijken naar hoeveel keer je niet tegen de muur loopt (algemene nauwkeurigheid). Maar wat als je bril je wel laat struikelen over een klein steentje, maar wel beschermt tegen de muur?

  • De keuze: Moet je tellen hoeveel keer je alles goed ziet, of moet je vooral kijken of je gevaarlijke dingen ziet?
  • In de praktijk: Bij een huidaandoeningen-app is het veel belangrijker om een kankervlek te zien (zelfs als je dan ook wat onschuldige vlekken foutief als kanker bestempelt) dan om niets te missen. Als je alleen naar "algemene score" kijkt, kun je een gevaarlijke app goedkeuren.
  • De les: Je moet eerst beslissen: welke fouten zijn het ergst?

2. Hoe weeg je verschillende maatstaven tegen elkaar af? (De "Balans"-keuze)

Stel, je bril moet twee dingen doen: je beschermen tegen de muur (veiligheid) én je niet laten struikelen over steentjes (gemak). Soms gaat dit niet samen. Als je de bril heel dik maakt (veiligheid), word je onhandig (gemak).

  • De keuze: Hoe maak je één eindcijfer? Tel je de scores op? Geef je veiligheid een zwaarder gewicht?
  • In de praktijk: In de tech-wereld gebruiken ze vaak een "F-score" (een gemiddelde van veiligheid en gemak). Maar hoe je dat gemiddelde berekent, is een ethische keuze. Wil je liever dat de app 10 gezonde mensen naar de dokter stuurt voor niets, of dat hij 1 zieke persoon over het hoofd ziet? Dat is een keuze die je in het algoritme "inpakt".
  • De les: Het samenvoegen van cijfers verbergt vaak de moeilijke ethische afwegingen.

3. Met welke data meet je? (De "Testgroep"-keuze)

Je test je bril op een loopbaan. Maar wat als die baan alleen gladde asfalt is, terwijl je in het echte leven over modder en stenen loopt?

  • De keuze: Wie zit er in je testgroep? Zijn er genoeg mensen van verschillende achtergronden, leeftijden en huidtypes?
  • In de praktijk: Als je AI alleen getest is op lichte huidtinten, werkt hij misschien slecht op donkere huidtinten. Als je dat niet ziet in je testdata, denk je dat de AI perfect is, terwijl hij voor een groot deel van de bevolking gevaarlijk is.
  • De les: Je kunt niet zeggen dat iets "nauwkeurig" is als je het niet hebt getest op de mensen die het straks echt gaan gebruiken.

4. Wat is het "Goedkeuring"-drempel? (De "Stoplicht"-keuze)

Je hebt je bril getest. De score is 85%. Is dat goed genoeg om te dragen?

  • De keuze: Waar trek je de lijn? Moet de AI beter zijn dan een gemiddelde arts? Of net zo goed? En wat als de AI 90% goed is, maar 10% van de tijd een dodelijke fout maakt?
  • In de praktijk: De EU-wet zegt "passend niveau". Dat betekent: voor een app die kanker detecteert, moet de drempel extreem hoog liggen voor het missen van kanker. Voor een app die muziek aanbeveelt, mag de drempel lager liggen.
  • De les: Het getal op zich zegt niets zonder de context. Een 90% score is geweldig voor een spelletje, maar catastrofaal voor een hartoperatie.

Waarom is dit belangrijk voor de EU-wet?

De EU-wet wil dat alleen veilige AI's worden gebruikt. Maar de wet schrijft geen specifieke cijfers voor (zoals "99% moet het zijn"). Dat is slim, want elke situatie is anders.

Het probleem is echter dat ontwikkelaars, toezichthouders en juristen vaak denken dat "nauwkeurigheid" een simpele technische term is. Dit paper waarschuwt: Nee, het is een ethische keuze die vermomd is als techniek.

Als we deze keuzes niet bewust maken en documenteren, kunnen we gevaarlijke systemen goedkeuren die "op papier" perfect lijken, maar in de praktijk mensen schaden.

De Conclusie in één zin

Om te weten of een AI "nauwkeurig genoeg" is, moet je niet alleen kijken naar het eindcijfer, maar naar de vier moeilijke keuzes die ontwikkelaars hebben gemaakt om dat cijfer te krijgen: welke fouten tellen, hoe weeg je ze af, op wie heb je getest, en waar trek je de lijn? Zonder deze vragen te stellen, is de "nauwkeurigheid" van een AI slechts een leugen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →