← Nieuwste papers
💻 computer science

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

Dit artikel introduceert SafePyramid, een hiërarchische benchmark bestaande uit 1.000 multi-turn conversaties en 3.000 applicatiespecifieke beleidsregels om in-context policy guardrailing te evalueren, wat onthult dat zelfs state-of-the-art modellen moeite hebben met het nauwkeurig identificeren van veiligheidschendingen en het aanpassen aan nieuwe beleidskaders over verschillende niveaus van complexiteit heen.

Oorspronkelijke auteurs: Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu

Gepubliceerd 2026-06-30
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat jij de hoofd van beveiliging bent van een enorm, hoogtechnologisch gebouw. In het verleden werden je beveiligers (de AI-modellen) getraind met een vast, rigide regelboek: "Geen wapens," "Niet schreeuwen," "Niet rondhangen." Als iemand deze regels overtrad, stopte de bewaker hen. Dit wordt Fixed-Taxonomy Guardrailing genoemd. Het werkt goed voor algemene veiligheid, maar het is te rigide voor het echte leven.

Soms moet een VIP-gast een verboden gebied betreden (een scenario van "gespecialiseerd advies"), of moet een bouwploeg zware machines door een gang verplaatsen (een scenario van "kritieke infrastructuur"). De regels voor deze specifieke situaties veranderen afhankelijk van de dag, de persoon en de context. Je kunt niet elke keer het hele beveiligingshandboek van het gebouw herschrijven; je hebt een bewaker nodig die een nieuw, tijdelijk reglement kan lezen dat hem op het moment van binnenkomst wordt overhandigd, en dat dit perfect kan opvolgen.

Dit is wat het artikel In-Context Policy Guardrailing noemt.

De auteurs van dit artikel, van ByteDance en de University of Melbourne, realiseerden zich dat hoewel we geweldige AI-bewakers hebben, we eigenlijk niet weten of ze goed zijn in het lezen van deze nieuwe, tijdelijke reglementen. Daarom hebben ze een enorme testomgeving gebouwd genaamd SafePyramid.

De SafePyramid-test: Een gebouw met drie verdiepingen

Om deze AI-bewakers te testen, hebben de onderzoekers een benchmark gebouwd die lijkt op een piramide met drie moeilijkheidsgraden. Denk aan het als een videogame met drie steeds moeilijkere levels:

Level 0: Het "Vind de overtreding"-spel (Begrip)
Stel je voor dat een bewaker een lijst met 20 regels krijgt. Sommige regels zijn relevant voor de persoon die binnenkomt (bijv. "Geen honden toegestaan"), en andere zijn afleidingsmanoeuvres (bijv. "Niet zwemmen in de lobby," terwijl er geen zwembad is).

  • De Test: Kan de bewaker naar de persoon en het gesprek kijken en zeggen: "Oké, ze hebben een hond, dus ze overtreden Regel #3. Maar ze zijn niet aan het zwemmen, dus Regel #15 is in orde"?
  • De Uitdaging: Veel AI-bewakers raken in de war door de afleidingsmanoeuvres of missen de subtiele details van de werkelijke overtreding.

Level 1: Het "Regelboek-logica"-spel (Afhankelijkheden)
Nu worden de regels lastig. Stel je voor dat een regel zegt: "Geen honden toegestaan." Maar er is een tweede regel: "Tenzij de hond een gecertificeerd hulphond is."

  • De Test: De bewaker moet begrijpen dat de eerste regel meestal waar is, tenzij de tweede regel kan annuleren als er aan specifieke voorwaarden wordt voldaan. Of een regel kan zeggen: "U mag een hond meenemen," tenzij de hond hard blaft.
  • De Uitdaging: De AI moet meerdere regels tegelijkertijd verwerken. Als hij een hond ziet, kan hij niet simpelweg "Overtreding!" roepen; hij moet controleren of de uitzondering "hulphond" van toepassing is. De AI wordt hier vaak erg in de war gebracht; ze missen vaak de uitzonderingen of passen ze toe wanneer dat niet mag.

Level 2: Het "Vreemde Taal"-spel (Nieuwe kaders)
Dit is het moeilijkste level. Stel je voor dat een bewaker een regelboek krijgt geschreven in een volledig verzonnen taal met verzonnen woorden (zoals "Het OGCP-protocol" of "Containment Verification"). De bewaker heeft deze woorden nog nooit gezien. Hij kan niet vertrouwen op zijn training of algemene kennis; hij moet de definities in het nieuwe regelboek lezen en deze precies zo toepassen als ze geschreven staan.

  • De Test: Kan de bewaker ter plekke een nieuwe set wetten leren en deze zonder fouten handhaven?
  • De Uitdaging: Dit is waar de AI-bewakers echt moeite mee hebben. Zelfs de slimste modellen raken de draad kwijt in de nieuwe terminologie en falen in het correct toepassen van de regels.

De Resultaten: De bewakers moeten nog leren

De onderzoekers testten 10 van de slimste AI-modellen ter wereld (de "frontier LLMs") en 5 gespecialiseerde beveiligingsmodellen tegen deze piramide.

Hier is het slechte nieuws: De bewakers zijn nog niet klaar voor de baan.

  • Op het makkelijke niveau (Level 0): De beste AI (GPT-5.5) kreeg de volledige lijst met overtredingen slechts in ongeveer 54% van de gevallen volledig juist. Dat is nauwelijks beter dan een muntje opgooien voor een complexe taak.
  • Op het middelmatige niveau (Level 1): Het succespercentage daalde naar 35%.
  • Op het moeilijke niveau (Level 2): Het succespercentage stortte in naar 13%.

Het is alsof je een student een wiskundetoets geeft. Ze kunnen misschien de simpele optelsommen goed maken, maar zodra je algebra introduceert (afhankelijkheden) en vervolgens overschakelt naar een volledig nieuw systeem van wiskundige symbolen (nieuwe kaders), beginnen ze hopeloos te falen.

Waarom falen ze?

Het artikel onderzocht waarom de AI faalt en vond drie belangrijke "bugs" in hun denken:

  1. Keyword Sniffing (Trefwoord-snuffelen): De AI ziet een woord als "hond" en denkt onmiddellijk "Overtreding!" zonder te controleren of de regel eigenlijk van toepassing is op deze specifieke hond of of er een uitzondering bestaat. Het is alsof een beveiliger iedereen die een hoed draagt stopt, waarbij de uitzondering "Geen hoeden voor kinderen" wordt genegeerd.
  2. De draad kwijtraken bij uitzonderingen: Wanneer een regel zegt "Geen honden, tenzij het een hulphond is," vergeet de AI vaak het "tenzij"-gedeelte. De AI ziet de hond en stopt de persoon, waarbij de nuance verloren gaat.
  3. Verdwalen in nieuwe woorden: Wanneer de regels zijn geschreven in een nieuw, fictief kader (Level 2), raakt de AI in de war. De AI behandelt de regels zelf als overtredingen in plaats van ze te gebruiken om de situatie te beoordelen. Het is alsof een student, wanneer hij een nieuw woordenboek krijgt, de definities begint te memoriseren als feiten in plaats van ze te gebruiken om het verhaal te begrijpen.

De Oplossing?

Het artikel suggereert dat het niet genoeg is om de AI simpelweg "slimmer" te maken. De huidige aanpak waarbij de AI gevraagd wordt een hele pagina met regels te lezen en vervolgens een lijst met overtredingen uit te spugen, is te moeilijk.

In plaats daarvan ontdekten de onderzoekers dat als je de taak opdeelt—door de AI te vragen om één regel tegelijk te controleren en daarna de antwoorden te combineren—de prestaties veel beter worden. Het is alsof je een beveiligingsbeveiliger een checklist geeft om punt voor punt door te lopen, in plaats van te vragen om het hele beveiligingsbeleid van het gebouw in één keer te onthouden.

Ze ontdekten ook dat het gebruik van "Agent Harnesses" (wat lijkt op het hebben van een team van AI-assistenten die de hoofdbeveiliger helpen bij het controleren van zijn werk) de resultaten aanzienlijk verbetert.

De Kernboodschap

SafePyramid is een wake-up call. Hoewel AI geweldig is in chatten en schrijven, is het momenteel erg slecht in het zijn van een strikte, regelvolgende beveiligingsbewaker die zich ter plekke kan aanpassen aan nieuwe, specifieke beleidsregels. We moeten betere systemen bouwen die complexe regelafhankelijkheden kunnen afhandelen en nieuwe kaders direct kunnen leren, anders kunnen we ze niet vertrouwen om onze digitale ruimtes in real-world toepassingen veilig te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →