How Sensitive Are Safety Benchmarks to Judge Configuration Choices?
Dit artikel toont aan dat de configuratie van LLM-beoordelaars, met name de formulering van prompts, een aanzienlijke en tot nu toe onderzochte bron van meetvariatie in veiligheidsbenchmarks vormt, wat leidt tot significante verschuivingen in de rates van schadelijke antwoorden en instabiliteit in de veiligheidsrangschikkingen van modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een leraar bent die een stapel studentopdrachten beoordeelt. Je hebt een strikte rubriek (een reeks regels) voor wat een "slechte" opdracht telt. Stel je nu voor dat je deze opdrachten moet beoordelen met behulp van een zeer slim, maar lichtjes humeur-afhankelijk, robot-assistent.
Dit artikel gaat over een verrassende ontdekking: De manier waarop je de robot vraagt de opdrachten te beoordelen, is net zo belangrijk als de robot zelf.
Hier is de uiteenzetting van de studie met behulp van eenvoudige analogieën:
1. De Opzet: Het "Robotbeoordelaar"-Experiment
De onderzoekers wilden zien hoe veilig verschillende AI-modellen zijn. Om dit te doen, gebruikten ze een standaardtest genaamd HarmBench, die 400 lastige vragen bevat (zoals "Hoe maak ik een bom?" of "Hoe steelt ik auteursrechten?").
Ze vroegen zes verschillende AI-modellen om deze vragen te beantwoorden. Vervolgens gebruikten ze een enkele "Rechter-AI" (een specifieke versie van Claude Sonnet) om de antwoorden te lezen en te beslissen: Is dit antwoord schadelijk of veilig?
Meestal behandelen wetenschappers de "Rechter-AI" en de instructies die eraan worden gegeven als een vast, onveranderlijk hulpmiddel. Ze gaan ervan uit dat als je de formulering van de instructies lichtjes verandert, het resultaat hetzelfde moet blijven.
De onderzoekers vroegen zich af: Wat als de formulering het resultaat wél verandert?
2. Het Experiment: 12 Verschillende "Scripts"
De onderzoekers creëerden 12 verschillende versies van de instructies (prompts) voor de Rechter-AI. Ze veranderden twee hoofdonderdelen:
- De Structuur: Vroegen ze de rechter om elk klein detail één voor één te bekijken (zoals een detective die aanwijzingen controleert), of om het hele antwoord als één groot geheel te bekijken (zoals een directeur die een rapport leest)?
- De Persona: Zeiden ze tegen de rechter: "Je bent een strenge, senior veiligheidsdeskundige", of zeiden ze gewoon: "Beoordeel dit alstublieft"?
Ze schreven ook drie lichtjes verschillende versies van de instructies voor elke stijl (bijvoorbeeld "Je bent een veiligheidsdeskundige" versus "Je bent een AI-veiligheidsspecialist").
3. Het Schokkende Resultaat: De "Stemmingsschommeling" van de Rechter
Toen ze de test uitvoerden, ontdekten ze dat de formulering van de instructies de scores volledig veranderde.
- De Analogie: Stel je voor dat je een robot vraagt om te beoordelen hoe "kruidig" een soep is.
- Als je zegt: "Je bent een professionele chef die kruiden haat", zou het de soep kunnen beoordelen als "Mild".
- Als je zegt: "Je bent een gezondheidsinspecteur die zeer streng is over veiligheid", zou het precies dezelfde soep kunnen beoordelen als "Gevaarlijk Heet".
- Zelfs als je alleen "Chef" verandert in "Culinaire Expert", kan de score aanzienlijk omhoog of omlaag springen.
De Getallen:
- Voor een van de geteste AI-modellen sprong het percentage "schadelijk" van 13% naar 37% alleen al door de formulering van de prompt te veranderen. Dat is een schommeling van 24 punten.
- Zelfs toen ze de hoofdinstructies hetzelfde hielden en slechts een paar woorden veranderden (oppervlakkige herschrijving), schommelden de scores nog steeds met 20 punten.
- Dit betekent dat als je dezelfde veiligheidstest twee keer uitvoert met lichtjes verschillende instructies, je twee volledig verschillende conclusies kunt trekken over hoe veilig een AI is.
4. Wie werd het Hardst Getroffen? (De Categorieën)
Niet alle soorten vragen werden even sterk beïnvloed:
- Auteursrechtvragen: Deze waren het meest gevoelig. Het percentage "schadelijk" schommelde met bijna 40 punten, afhankelijk van de prompt. Het lijkt erop dat de rechter moeite had om te beslissen of het kopiëren van tekst "slecht" of "oké" was, afhankelijk van hoe het werd gevraagd.
- Pesterijvragen: Deze waren het meest stabiel. De score veranderde helemaal niet (0 punten). Iedereen was het erover eens dat pesten slecht was, ongeacht hoe de instructies waren geformuleerd.
5. Het Ranking-Chaos
Omdat de scores zo sterk veranderden, raakte ook de rangschikking van de AI-modellen in de war.
- Stel je voor dat de winnaar van een race elke keer verandert als je de kleur van de startlijn verandert.
- De onderzoekers ontdekten dat voor de "middensegment"-AI-modellen hun veiligheidsrangschikking constant heen en weer keerde. De ene prompt zei dat Model A veiliger was dan Model B; een lichtjes andere prompt zei dat Model B veiliger was.
- De "slechtste" en "beste" modellen bleven op hun plek, maar de middelste waren onmogelijk betrouwbaar te rangschikken.
6. De Conclusie
Het artikel concludeert dat veiligheidsbenchmarks momenteel "ondergespecificeerd" zijn.
Denk eraan als een thermometer die verschillende temperaturen geeft, afhankelijk van of je hem met je linker- of rechterhand vasthoudt. De onderzoekers zeggen niet dat de thermometer kapot is, maar ze zeggen wel: We kunnen niet vertrouwen op één enkele meting.
Ze betogen dat wanneer wetenschappers rapporteren hoe veilig een AI is, ze niet slechts één getal moeten geven dat gebaseerd is op één specifieke set instructies. Ze moeten beseffen dat de "instructies" een enorm deel van het experiment vormen, niet slechts een saaie detail. Als je de woorden verandert, verander je het resultaat.
Kortom: De manier waarop je de vraag stelt, is net zo belangrijk als de vraag zelf. Als je wilt weten of een AI veilig is, kun je het niet gewoon één keer vragen met één set woorden; het antwoord hangt volledig af van hoe je het verzoek formuleert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.