← Nieuwste papers
💻 computer science

Escaping the Agreement Trap: Defensibility Signals for Evaluating Rule-Governed AI

Dit artikel stelt een nieuw evaluatiekader voor voor regelgebaseerde AI dat gebrekkige op overeenstemming gebaseerde metrieken vervangt door op beleid gebaseerde correctheidsmaatstaven, zoals het Defensibiliteitsindex en het Probabilistisch Defensibiliteitssignaal, om op accurate wijze onderscheid te maken tussen geldige beslissingen en echte fouten in contentmoderatie.

Oorspronkelijke auteurs: Michael O'Herlihy, Rosa Català

Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Michael O'Herlihy, Rosa Català

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Dit artikel presenteert een verrassende bevinding: bij het beoordelen of een AI zich aan regels houdt, mag je niet alleen kijken of deze het met mensen eens is.

In plaats van complexe academische termen te gebruiken, leggen we dit uit aan de hand van een productieomgeving voor een televisieserie.


🎬 Vergelijking: "Scenariocontrole" en "Regisseursbevoegdheid"

Een online gemeenschap (bijvoorbeeld Reddit) is een enorm filmset, en de regels (beleid) zijn het scenario. De AI is een beginnende redacteur die dit scenario leest en beslist: "Mag deze scène uitgezonden worden (Goedkeuren) of moet deze worden verwijderd (Verwijderen)?"

De bestaande evaluatiemethode controleerde alleen of de mening van de AI overeenkwam met die van een menselijke commissielid. Dit artikel wijst echter op een dodelijke valkuil in deze aanpak: de 'Val van de Overeenstemming'.

1. De Val van de Overeenstemming (The Agreement Trap)

Situatie: Het scenario bevat alleen de tekst "Geweldige scènes zijn verboden". Een scène bevindt zich echter in een grijs gebied: "Is dit gewelddadig, maar heeft het toch artistieke waarde?"

  • Menselijke commissielid A: "Het is artistiek, dus zenden we het uit!" (Goedkeuren)
  • Menselijke commissielid B: "Het is gewelddadig, dus we verwijderen het!" (Verwijderen)
  • AI: "Het is gewelddadig, dus we verwijderen het!" (Verwijderen)

De bestaande evaluatiemethode concludeert dat de AI een fout heeft gemaakt omdat deze het niet eens is met mens A. Maar de AI heeft het scenario (de regels) juist gelezen. De AI kwam tot de conclusie dat het verwijderd moet worden; dit is een verdedigbare beslissing gebaseerd op het scenario.

Kernboodschap: Het feit dat een AI het niet eens is met een mens, betekent niet automatisch dat deze ongelijk heeft. Als de AI binnen de interpretatiemarge (het grijze gebied) van de regels een logisch juiste beslissing neemt, is dit geen 'fout', maar een 'verdedigbare beslissing'.

2. Een nieuwe kompas: de "Verdedigbaarheidsindex (DI)" en de "Ambiguïteitsindex (AI)"

Het artikel stelt twee nieuwe indicatoren voor bij het evalueren van AI.

  • Verdedigbaarheidsindex (Defensibility Index, DI):
    • Vergelijking: "Hoe logisch kan deze beslissing verdedigd worden op basis van het scenario (de regels)?"
    • Als de beslissing van de AI letterlijk of logisch voortvloeit uit het scenario, krijgt deze 100 punten, zelfs als deze het niet eens is met mensen.
  • Ambiguïteitsindex (Ambiguity Index, AI):
    • Vergelijking: "Is deze scène in het scenario echt dubbelzinnig?"
    • Dit identificeert secties waar het scenario zo abstract is dat zowel mensen als AI worstelen met de vraag "Wat moeten we doen?". Dit is geen fout van de AI, maar een signaal dat het scenario (de regels) onvolledig is.

3. Technologie om de 'innerlijke gedachten' van de AI te lezen (PDS)

AI zegt meestal: "Ik ben 99% zeker!", maar vaak twijfelt deze toch. Het artikel beschrijft een technologie die de kansverdeling (Log-probs) analyseert van de woorden die de AI gebruikt tijdens het proces om een beslissing te nemen, vlak voordat deze wordt genomen.

  • Vergelijking: Het detecteren van de innerlijke twijfel van de AI vlak voordat deze zegt: "Dit moet verwijderd worden!". In gedachten mompelt de AI dan: "Hmm... volgens pagina 3 van het scenario... maar ook op pagina 5..."
  • Als deze 'innerlijke twijfel' groot is, worstelt de AI met de onduidelijkheid van de regels. Via dit signaal kan men vooraf weten waar menselijke ingrijping nodig is.

4. Praktische toepassing: de "Automatiseringspoort (Governance Gate)"

Als deze technologie op een echt systeem wordt toegepast, levert dit de volgende voordelen op:

  • Veilige automatisering: Als de AI de regels duidelijk begrijpt en logisch een beslissing neemt (hoge verdedigbaarheidsindex), wordt dit automatisch verwerkt.
  • Menselijke ingrijping: Als de regels te vaag zijn of de AI twijfelt (hoge ambiguïteitsindex), wordt dit door een mens gecontroleerd.
  • Resultaat: De studie toont aan dat de bestaande methode 80% van de juiste beslissingen van de AI ten onrechte als 'fout' classificeerde. Deze nieuwe methode bereikte echter een prestatie waarbij 78,6% van het werk geautomatiseerd kon worden, terwijl het risico met 64,9% werd verminderd.

📝 Samenvatting in één zin

"Het feit dat een AI het niet eens is met mensen, betekent niet automatisch dat deze ongelijk heeft. Als de AI een logisch juiste beslissing neemt op basis van de regels (het scenario), moeten we die 'verschil' erkennen als een 'verdedigbare interpretatie' en niet als een 'fout'. Mensen hoeven alleen maar in te grijpen waar de regels dubbelzinnig zijn."

Dit artikel pleit ervoor om AI niet langer te beoordelen als een 'machine die mensen nabootst', maar als een 'expert die regels logisch interpreteert', en biedt hiermee een weg naar veiligere en efficiëntere AI-operaties.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →