Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators
Dit artikel onderzoekt de beperkingen van LLM's als beoordelaars bij veiligheidsevaluaties, waarbij wordt onthuld dat ze weliswaar kunnen leren van nieuwe context, maar vaak rigide vasthouden aan hun interne veiligheidsvooroordelen in plaats van zich aan te passen aan tegenstrijdige informatie of definities.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van superintelligente scheidsrechters hebt ingehuurd (dit zijn de AI-modellen, of "LLM-judges") om een massaal sporttoernooi te observeren en te beslissen welke acties "eerlijk" zijn en welke "valsspelen" zijn.
Het probleem is dat de regels van het spel veranderen afhankelijk van waar je speelt. In het ene land is een specifieke beweging een overtreding, terwijl het in een ander land een briljante actie is. Ook worden er elke dag nieuwe straattaal en nieuwe soorten trucjes uitgevonden.
Dit artikel stelt een simpele maar angstaanjagende vraag: Volgen deze AI-scheidsrechters eigenlijk wel de regels die je ze net hebt gegeven, of spelen ze gewoon volgens hun eigen oude, interne regelboek?
De auteurs ontdekten dat de scheidsrechters verrassend koppig zijn. Hier is de uitslag met eenvoudige analogieën:
1. Het "Koppige Scheidsrechter"-probleem (Stuurbaarheid)
Normaal gesproken, wanneer je een scheidsrechter inhuurt, geef je hem een regelboek. Je zegt: "Als iemand de bal met de handen aanraakt, is dat een overtreding."
- Wat het onderzoek vond: Zelfs als je expliciet een nieuw regelboek voor de AI neerlegt, negeert de AI je vaak. De AI blijft beoordelen op basis van de "veiligheidsregels" die het heeft geleerd tijdens zijn schooltijd (tijdens de training).
- De Analogie: Stel je voor dat je een scheidsrechter inhuurt die opgegroeid is met voetbal. Je zegt tegen hem: "Vandaag spelen we basketbal, dus het gebruik van je handen is prima, maar de bal met de voet raken is een overtreding." De scheidsrechter zal waarschijnlijk toch de fluit slaan voor het gebruik van de handen omdat hij diep van binnen denkt: "Nee, dat is een overtreding! Dat heb ik geleerd bij voetbal!"
- De Twist: Het onderzoek vond dat als je de scheidsrechter een beetje fopt door te zeggen: "Laten we het gewoon 'Categorie A' of 'Categorie B' noemen in plaats van 'Veilig' of 'Onveilig'", de scheidsrechter plotseling veel beter wordt in het volgen van je nieuwe regels. Het is alsof de scheidsrechter alleen in de war raakt wanneer de woorden "Veiligheid" en "Regels" worden gebruikt, wat hun oude training triggert.
2. Het "Afgeleide Student"-probleem (Gevoeligheid)
Soms geef je de scheidsrechter een spiekbriefje of een paar voorbeelden van waar hij op moet letten vlak voordat het spel begint.
- Wat het onderzoek vond:
- Oude Trucjes: Als je de scheidsrechter voorbeelden geeft van "valsspelen", negeren ze die grotendeels. Ze houden vast aan wat ze al weten.
- Nieuwe Kennis: Echter, als je ze informatie geeft over iets heel nieuws dat ze nog niet kennen (zoals een nieuw straattaalwoord of een nieuwsgebeurtenis van volgend jaar), dan zullen ze wél luisteren.
- De Analogie: Stel je een student voor die een toets maakt.
- Als je fluistert: "Onthoud dat het antwoord altijd 42 is," en de student weet al dat het antwoord 42 is, dan negeert hij je.
- Maar als je fluistert: "Het antwoord op deze vraag over een nieuwe planeet is 42," en de student heeft nog nooit van die planeet gehoord, dan zal hij je geloven.
- De Catch: De scheidsrechter luistert alleen naar nieuwe informatie als hij onzeker is over het onderwerp. Als ze zelfverzekerd zijn over hun oude kennis, zullen ze jouw nieuwe instructies negeren, zelfs als je gelijk hebt.
3. De "One-Size-Fits-All" Mythe
Het onderzoek testte 13 verschillende AI-scheidsrechters. Ze kwamen tot de volgende conclusies:
- Een "goede" scheidsrechter zijn (hoge scores halen op standaardtests) betekent niet dat je "flexibel" bent.
- "Flexibel" zijn (luisteren naar nieuwe regels) betekent niet dat je "nauwkeurig" bent.
- Sommige scheidsrechters zijn van nature koppig; anderen zijn van nature suggestief. Er is niet één "beste" scheidsrechter voor elke taak.
De Belangrijkste Conclusie
De auteurs concluderen dat veiligheid contextueel is, maar AI-rechters rigide zijn.
Als je een bedrijf bent dat een AI probeert te gebruiken om te controleren of content veilig is voor een specifieke cultuur of een specifieke nieuwe situatie, kun je er niet vanuit gaan dat de AI je instructies zal volgen. De AI beoordeelt waarschijnlijk op basis van zijn eigen interne "onderbuikgevoel" over wat veilig is, wat totaal anders kan zijn dan het beleid van jouw bedrijf.
Kortom: Je kunt niet simpelweg tegen de AI zeggen: "Volg deze regels." Je moet begrijpen dat de AI zijn eigen diepgewortelde gewoonten heeft die erg moeilijk te veranderen zijn, tenzij je hem fopt door hem te laten denken dat hij een compleet ander spel speelt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.