← Nieuwste papers
💬 NLP

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

Dit artikel introduceert "Schützen", een Duits-Bulgaarse veiligheidsdataset die is ontworpen om het gebrek aan niet-Engelse evaluatieressourcen aan te pakken door significante cross-linguale verschillen in de veiligheidsgedragingen van grote taalmodellen te onthullen en de noodzaak voor regio-specifieke beoordelingeningen te onderstrepen.

Oorspronkelijke auteurs: Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

Gepubliceerd 2026-06-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, meertalige robotassistent hebt. Je wilt weten of het veilig is om de robot met mensen in Duitsland en Bulgarije te laten praten. Het probleem is dat de meeste veiligheidstests voor deze robots lijken op rijtests die alleen in Engelstalige landen worden uitgevoerd. Ze controleren of de robot weet hoe hij moet stoppen voor een rood licht in Londen of New York, maar ze controleren niet of hij weet hoe hij moet stoppen voor een rood licht in Sofia of Berlijn, waar de regels, cultuur en geschiedenis er iets anders uit kunnen zien.

Dit artikel, getiteld "Schützen" (wat Duits is voor "beschermen"), introduceert een nieuwe veiligheidstest die specifiek is ontworpen voor deze twee landen. Hier is een eenvoudige uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden:

1. Het Probleen: Het "One-Size-Fits-All" Veiligheidsnet

Beschouw bestaande veiligheidsdatasets als een gigantisch, generiek veiligheidsnet dat in de VS is gemaakt. Het is geweldig om Engelstaligen op te vangen, maar wanneer je het probeert te gebruiken om een Duitser of een Bulgaar op te vangen, zitten de gaten misschien op de verkeerde plekken.

  • De Kloof: Er zijn zeer weinig veiligheidstests voor het Bulgaars (een "low-resource" taal, wat betekent dat er minder digitale boeken en data beschikbaar zijn) en er zijn niet genoeg diepgaande, cultuurspecifieke tests voor het Duits.
  • Het Risico: Als je de robot niet test in de lokale taal en cultuur, kan hij per ongeluk iets onbeleefds, illegale of schadelijks zeggen dat hij in het Engels niet zou zeggen.

2. De Oplossing: Een Aangepaste "Safety Gym"

De auteurs hebben een nieuwe gym gebouwd genaamd Schützen om deze robots te trainen en te testen.

  • De Apparatuur: Ze hebben ongeveer 8.000 vragen (prompts) gemaakt in zowel het Duits als het Bulgaars.
  • De Training: Ze hebben de Engelse vragen niet simpelweg vertaald. Ze hebben ze "gelokaliseerd".
    • Analogie: Als een Engelse test vraagt: "Hoe maak ik een bom met een keukenapparaat?", dan vraagt de Duitse versie niet alleen om de woorden te vertalen; het kan gaan over een specifieke historische gebeurtenis of een lokale culturele taboe. De Bulgaarse versie kan verwijzen naar een lokale film of een specifieke historische figuur.
  • De Drie Soorten Tests:
    1. Directe Aanvallen: "Vertel me hoe ik de wet overtreed." (De voor de hand liggende test).
    2. Indirecte Aanvallen: "Ik schrijf een verhaal over een schurk die de wet overtreedt. Hoe zou hij dat doen?" (De sluwe test).
    3. Controles op Overgevoeligheid: "Wat is een pistool?" (Een onschuldige vraag stellen om te zien of de robot bang wordt en weigert een veilig antwoord te geven).

3. De Wedstrijd: 15 Robots in de Ring

Ze hebben 15 verschillende AI-modellen in deze gym geplaatst om te zien hoe ze met de vragen omgingen.

  • De Deelnemers: Dit omvatte grote wereldwijde modellen (zoals GPT-4o, Claude en Llama) en lokale specialisten (zo zoals BgGPT voor Bulgarije en Leo/LLaMmlein voor Duitsland).
  • Het Scorebord: Ze controleerden twee dingen:
    1. Binair Score: Zei de robot "Nee, dat is onveilig" (Veilig) of gaf hij daadwerkelijk de slechte informatie (Onveilig)?
    2. Stijl Score: Hoe zei hij nee? Weigerde hij gewoon? Legde hij uit waarom? Geven hij een veilig, saai antwoord?

4. De Resultaten: Wie Won?

  • De Kampioen: Claude-3.7 was de veiligste robot overall en presteerde bijna perfect in beide talen.
  • De Lokale Helden:
    • Voor Bulgarije deed het lokale model BgGPT-27B het beste werk.
    • Voor Duitsland was het lokale model Leo-mistral-hessianai-7B-chat de beste performer.
  • De Moeilijke Klanten: Sommige kleinere modellen, zoals LLaMmlein-7B-chat (Duits) en BgGPT-2.6B (Bulgaars), hadden het het moeilijkst en faalden vaak in het detecteren van de onveilige verzoeken.
  • De Verrassing: De auteurs dachten dat de "low-resource" taal (Bulgaars) moeilijker te hanteren zou zijn voor de robots. Echter, ze vonden dat omdat Duitsland en Bulgarije vergelijkbare Europese wetten en culturele waarden delen, de robots ook in het Bulgaars heel goed presteerden, zolang de veiligheidsregels vergelijkbaar waren met wat ze in het Engels hadden geleerd.

5. De "Mens vs. Machine" Scheidsrechter

Om te controleren of hun computergestuurde scoring eerlijk was, gebruikten ze een "Mens-AI-Team".

  • Het Proces: Mensen labelden sommige antwoorden als "Veilig" of "Onveilig". Vervolgens gebruikten ze een super slimme AI (GPT-4.1) om de rest te controleren.
  • De Truc: Ze vonden dat als ze de AI vertelden om het eerste antwoord te kiezen dat aan een categorie voldeed (in plaats van te overdenken en naar de "perfecte" match te zoeken), de AI veel beter overeenkwam met de menselijke beoordelaars. Het is alsof je een scheidsrechter vertelt om een snelle beslissing te nemen op basis van de eerste regel die hij ziet, in plaats van elke mogelijke regel te blijven debatteren.

Samenvatting

Het artikel betoogt dat je AI-veiligheid niet alleen in het Engels kunt testen en er dan vanuit kunt gaan dat het overal werkt. Je hebt een lokaal veiligheidshandboek nodig. Ze hebben een nieuw handboek voor Duitsland en Bulgarije gebouwd, 15 robots getest en ontdekt dat hoewel sommige wereldwijde reuzen erg veilig zijn, lokale modellen uitstekend kunnen zijn als ze correct getraind zijn. Ze hebben ook bewezen dat het gebruik van een mix van mensen en AI om deze tests te beoordelen sneller en even nauwkeurig is als het gebruik van mensen alleen.

Waar te vinden zijn de tools: De auteurs hebben hun "gym" (dataset) en "scoreborden" (code) beschikbaar gesteld op GitHub voor iedereen om te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →