LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories
Dit artikel onthult dat Large Language Models die worden gebruikt als automatische beoordelaars aanzienlijke inconsistentie en onbetrouwbaarheid vertonen, met name bij het evalueren van gereguleerde domeinen zoals de financiële sector of variërend per taal en criterium, wat het belang benadrukt van zorgvuldige implementatie bij veiligheidsbeoordelingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een panel van zes verschillende kunstcritici hebt ingehuurd om een reeks schilderijen te beoordelen. Je wilt dat ze het eens worden over welke schilderijen "veilig" zijn (goed, gepast) en welke "onveilig" zijn (slecht, schadelijk). Je verwacht dat als je ze hetzelfde schilderij laat zien, of zelfs een iets andere versie ervan (zoals een foto van het schilderij in een andere lijst, of een vertaling van de aantekening van de kunstenaar in een andere taal), ze allemaal ongeveer hetzelfde oordeel geven.
Dit artikel gaat over het testen van precies dat, maar in plaats van kunstcritici zijn de "rechters" Large Language Models (AI), en in plaats van schilderijen beoordelen ze AI-gegenereerde tekst op veiligheid.
Hier is de uitslag van wat de onderzoekers vonden, met behulp van eenvoudige analogieën:
1. Het "Voor de hand liggend vs. Subtiel" Probleem
De onderzoekers testten de AI-rechters op twee zeer verschillende soorten "slechte" inhoud:
- De "Schreeuwende Brand" Test (Geweld): Ze vroegen de AI om tekst te beoordelen over geweld, haatzaaien of illegale handelingen.
- Het resultaat: De AI-rechters waren hier vrij goed in. Als een schilderij duidelijk in brand stond, waren alle zes de critici het eens: "Dit is onveilig."
- De "Financieel Advies" Test (Gereguleerde Domeinen): Ze vrogen de AI om tekst te beoordelen waarin een AI advies geeft over zaken als kredietscores, visumaanvragen of medisch advies.
- Het resultaat: De AI-rechters waren hier verschrikkelijk in het met elkaar eens worden. Het is alsof je zes critici vraagt een schilderij te beoordelen dat bijna een meesterwerk is, maar één klein, subtiel gebrek heeft. De ene criticus zegt: "Het is veilig, slechts een beetje riskant," terwijl een ander zegt: "Het is gevaarlijk, gooi het weg!" Ze konden het in deze complexe, real-world scenario's niet eens worden over wat "veilig" zelfs betekende.
2. Het "Magische Spiegel" Probleem (Zelfconsistentie)
De onderzoekers namen een enkel AI-antwoord en lieten dit aan de rechters zien in verschillende "spiegels":
Vertaling: Ze lieten de tekst zien in het Engels, daarna in het Frans, daarna in het Hindi, enzovoort.
Parafraseren: Ze herschreven de tekst om het formeler of informeler te laten klinken, of om de volgorde van de zinnen te veranderen, zonder de eigenlijke betekenis te veranderen.
Het resultaat: De rechters waren inconsistent. Als een rechter zei: "Deze Engelse zin is veilig," konden ze naar exact dezelfde zin kijken, vertaald naar het Hindi, en zeggen: "Wacht, deze Hindi-versie is onveilig!" Of ze keken naar een geparafraseerde versie en veranderden van gedachten.
De Metafoor: Stel je een beveiligingsbeambte voor die een persoon in een rood shirt tegenhoudt, maar dezelfde persoon in een blauw shirt gewoon doorlaat, ook al is het exact dezelfde persoon. De AI-rechters laten zich gemakkelijk misleiden door hoe de woorden zijn aangekleed, en niet door wat de woorden daadwerkelijk zeggen.
3. Het "Jury" Probleem (Cross-Consistentie)
De onderzoekers vroegen ook: "Als we alle zes de AI-rechters samen in een kamer zetten, zullen ze het dan met elkaar eens zijn?"
- Het resultaat: Nee. Zelfs wanneer ze naar exact dezelfde tekst in exact dezelfde taal kijken, geven de rechters vaak tegenovergestelde antwoorden.
- De Metafoor: Stel je een jury voor waarbij één persoon "Schuldig" stemt, een ander "Onschuldig" en een derde "Misschien". Ze kijken allemaal naar hetzelfde bewijs, maar ze hebben totaal verschillende interne regelboeken voor wat een misdaad vormt. Het paper stelt vast dat voor complexe onderwerpen (zoals financieel advies), de "jury" vaak in totale chaos verkeert.
4. De "Nepovereenstemming" Valstrik
Het paper wijst op een verraderlijke statistische illusie.
- Soms zeggen alle rechters in 99% van de gevallen "Veilig". Als je alleen de "Ja"-stemmen telt, lijkt het alsof ze in perfecte overeenstemming zijn (100% consistentie).
- De Catch: Maar als ze alleen maar "Veilig" zeggen omdat ze lui zijn of bevooroordeeld, en niet echt over de specifieke details nadenken, dan is dat geen echte overeenstemming. De onderzoekers gebruikten speciale wiskunde (zoals een "kans-gecorrigeerde" score) om deze nepovereenstemming weg te filteren.
- De Metafoor: Het is als een groep vrienden die het antwoord op een quizvraag raden. Als het antwoord in 99% van de gevallen "Ja" is, en ze raden allemaal "Ja", dan lijken ze genieën. Maar als de vraag eigenlijk moeilijk is en ze gewoon het meest voorkomende antwoord gokken, dan zijn ze niet echt eens over de redenering. Het paper laat zien dat wanneer je dieper kijkt, de AI-rechters in werkelijkheid veel van elkaar verschillen.
De Conclusie
Het paper concludeert dat hoewel AI-rechters oké zijn in het herkennen van overduidelijke, luidruchtige gevaren (zoals geweld), ze onbetrouwbaar en inconsistent zijn bij het beoordelen van genuanceerd, real-world advies (zoals financiën of recht).
Als je een AI gebruikt om als veiligheidsbewaker te fungeren voor complexe onderwerpen, kun je hem niet vertrouwen om consistent te zijn. Hij kan een gevaarlijk antwoord doorlaten, simpelweg omdat de zinsstructuur licht is veranderd, of hij kan een veilig antwoord afwijzen omdat het in een andere taal is vertaald. De "jury" van AI-modellen is momenteel te verdeeld om zonder menselijk toezicht vertrouwd te worden voor beslissingen met een hoge inzet.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.