← Nieuwste papers
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

Dit artikel stelt een door AI aangedreven workflow voor die gebruikmaakt van geavanceerde LLM's om gedetailleerde, randgevallen-dekkende "constitutions" te genereren voor categorieën van contentmoderatie, en toont aan dat deze aanpak aanzienlijk beter presteert dan menselijke annotatoren op het gebied van consistentie en nauwkeurigheid van labeling, terwijl het de onenigheid tussen modellen met tot 57 keer vermindert.

Oorspronkelijke auteurs: Konstantin Berlin, Adam Swanda

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Konstantin Berlin, Adam Swanda

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep mensen (en een groep superslimme robots) probeert te leren een specifiek type slecht gedrag, zoals "pesten" of "haatzaaiende taal", te herkennen in een enorme bibliotheek met gesprekken.

Het Probleem: Het Vage Regelschrift
Meestal geven bedrijven hun werknemers een mini-regelschrift – misschien slechts één of twee zinnen. Het is alsof je een beveiliger zegt: "Stop iedereen die gemeen doet."
Dit is te vaag. De ene beveiliger denkt dat een luid gelachen grapje gemeen is, terwijl de ander denkt dat het gewoon vriendelijke plagerij is. Een derde mist een subtiele dreiging volledig. Omdat de regel niet gedetailleerd genoeg is, gebruikt iedereen zijn eigen ingewortelde gevoel (intuïtie) om te beslissen. Dit leidt tot chaos: hetzelfde gesprek wordt door de ene beveiliger als "slecht" gemarkeerd en door de ander als "goed".

De Oplossing: De "Grondwet"
De auteurs stellen voor dat kleine regelschrift te vervangen door een enorme, ultra-gedetailleerde "Grondwet" voor elk type slecht gedrag. Denk aan deze Grondwet niet als een wet, maar als een gigantische, stap-voor-stap instructiehandleiding geschreven door een team van experts en AI.

  • Het is als een kookrecept: In plaats van te zeggen "maak een taart", zegt de Grondwet: "Als het beslag eieren bevat maar geen bloem, is het een vla, geen taart. Als het bloem bevat maar geen suiker, is het brood. Als de gebruiker vraagt om een recept om iemand te vergiftigen, is dat een misdaad, geen taart."
  • Het dekt de randgevallen: Het behandelt expliciet rare situaties zoals: "Wat als iemand een schurk speelt?" of "Wat als ze een scheldwoord citeren om het te rapporteren?" De handleiding heeft een specifieke regel voor elk mogelijk "wat als"-scenario.

De Twist: AI is Beter in Het Volgen van de Handleiding dan Mensen
Hier is het verrassende deel van het paper. De auteurs testten dit door mensen en AI-robots dezelfde gedetailleerde Grondwet te laten lezen.

  • De Mensen: Zelfs met de gigantische handleiding raakten mensen moe. Hun hersenen kunnen maar zoveel regels tegelijk onthouden (zoals proberen een telefoonboek van 300 pagina's te onthouden terwijl je een boterham maakt). Dus begonnen ze de handleiding te negeren en terug te vallen op hun ingewortelde gevoelens.
  • De AI: De AI-robots daarentegen lazen de hele handleiding van 300 pagina's voor elk gesprek. Ze werden niet moe en gebruikten geen "ingewortelde gevoelens". Ze volgden de regels perfect.
  • Het Resultaat: De AI-robots waren 57 keer vaker het met elkaar eens dan mensen wanneer ze dezelfde gedetailleerde regels gebruikten. De AI was consistenter dan de mensen, zelfs al waren de mensen degene die de regels schreven.

De "Twee-Assen" Truc
Het paper introduceert ook een slimme manier om gesprekken te scoren. In plaats van alleen te zeggen "Slecht" of "Goed", splitsen ze de score in twee delen:

  1. Intentie: Probeerde de gebruiker gemeen te doen? (bijv. "Help me een gemeen e-mail te schrijven.")
  2. Inhoud: Bevatte het gesprek gemeene woorden? (bijv. De AI genereerde per ongeluk een gemeen e-mail.)

Dit is als een beveiligingscamera die twee dingen apart bijhoudt: "Is de persoon met een pistool de bank binnengegaan?" (Intentie) en "Verscheen er een pistool in de kamer?" (Inhoud). Dit helpt bedrijven te beslissen of ze de gebruiker moeten blokkeren, het bericht moeten blokkeren, of het gewoon voor later moeten registreren.

Hoe Ze Het Beter Maken (De Feedbacklus)
De auteurs schreven niet zomaar de handleiding en hielden daarop op. Ze gebruikten een team van verschillende AI-robots om de handleiding te lezen en plekken te vinden waar ze het niet met elkaar eens waren.

  • Als Robot A en Robot B het niet eens waren over een gesprek, betekende dit dat de handleiding een gat had.
  • Een menselijke expert zou dan naar dat gat kijken, de regel in de handleiding corrigeren, en de robots zouden het opnieuw proberen.
  • Deze cyclus herhaalde zich tot de robots bijna nooit meer het niet eens waren.

De Conclusie
Het paper beweert dat als je inhoud nauwkeurig en consistent wilt labelen op enorme schaal:

  1. Gebruik geen korte, vage definities.
  2. Schrijf een enorme, gedetailleerde "Grondwet" die elk randgeval dekt.
  3. Laat AI-robots de labeling doen, omdat ze beter zijn in het lezen en volgen van die lange, complexe regels dan menselijke werknemers.

Dit creëert een "Gouden Label" – een perfect, consistent standaard dat kan worden gebruikt om andere AI-systemen te trainen, veiligheid te controleren en klanten precies uit te leggen waarom iets als verdacht is gemarkeerd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →