← Nieuwste papers
🤖 AI

SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI

Het artikel introduceert SAGE, een veiligheid-eerst, autorisatie-gescheiden architectuur voor generatieve AI met een hoge impact die prioriteit geeft aan het mitigeren van catastrofale risico's door middel van formele verificatie en een uitgebreid defense-in-depth-framework, gevalideerd door een multi-model studie die lage schadelijke-compliancecijfers en specifieke prestatiecontrasten tussen toonaangevende AI-snapshots aantoont.

Oorspronkelijke auteurs: Mahdi Eslamimehr

Gepubliceerd 2026-07-28
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mahdi Eslamimehr

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het vangnet vóór de sprong

Stel je voor dat je een robot bouwt die code kan schrijven, medisch advies kan geven of complexe wetenschap kan uitleggen. Dit is de wereld van Generatieve AI, een technologie die nieuwe inhoud creëert in plaats van alleen naar oude antwoorden te zoeken. Maar hier komt de adder onder het gras: als deze robot een beetje te creatief wordt, kan hij per ongeluk iemand helpen een bom te bouwen, een bank te hacken of gevaarlijke leugens te verspreiden. Dit gaat niet alleen over de robot die "onbeleefd" is; dit gaat over het voorkomen van catastrofale schade.

Om dit te stoppen, gebruiken wetenschappers Guardrails (vangrails). Denk aan deze als de verkeersregels voor de robot. Meestal zijn guardrails als een uitsmijter bij een club die je ID controleert bij de deur. Als je er verdacht uitziet, kom je niet binnen. Maar wat als de uitsmijter iets mist? Wat als de robot een achterdeur vindt? Dit is waar het idee van Defense-in-Depth (verdediging in de diepte) om de hoek komt kijken. In plaats van te vertrouwen op slechts één uitsmijter, heb je een hek, een gracht, een wachter en een tweede uitsmijter binnenin. Je legt je veiligheid in lagen, zodat als er één ding faalt, het volgende het probleem opvangt.

De grote vraag die iedereen stelt is: Welke robot is eigenlijk de veiligste? Is het de robot die het vaakst "Nee" zegt die de beste is, of is het degene die "Nee" zegt tegen slechte dingen maar nog steeds helpt met goede zaken? We hebben een manier nodig om deze robots te testen, niet alleen op hoe goed ze regels volgen, maar ook op hoe ze de hele reis afleggen van het gebouwd worden tot het gebruik ervan, om ervoor te zorgen dat veiligheid het belangrijkste is, zelfs belangrijker dan snelheid of winst.


Het SAGE-systeem: Een structuur met veiligheid voorop

Maak kennis met SAGE (Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control). Zie SAGE niet alleen als een lijst met regels, maar als een hoogtechnologische, onbreekbare veiligheidskluis voor AI. De auteurs, onderzoekers van Quandary Peak Research, betogen dat veiligheid geen gedachte achteraf of een simpel filter moet zijn. In plaats daarvan moet het de baas zijn.

Stel je voor dat je een zeer serieus wetenschappelijk experiment uitvoert. Voordat je de machine zelfs maar aanzet, moet je een Release Manifest ondertekenen. Dit is als een magisch, onvervalst contract dat zegt: "We hebben deze machine gecontroleerd, we hebben hem getest tegen slechte jongens, en we beloven dat hij niet ontploft." Als de machine zelfs maar een klein beetje verandert, verbreekt het contract en schakelt de machine zichzelf uit. SAGE gebruikt deze ondertekende manifesten om er zeker van te zijn dat alleen veilige versies van AI mogen draaien.

Zodra de AI draait, fungeert SAGE als een verkeersregelaar met een superkracht. Het kijkt niet alleen naar de vraag die je stelt; het kijkt naar het risico van het antwoord.

  • De Veiligheidshek (The Safety Gate): Als de AI denkt dat een antwoord iemand zou kunnen helpen bij iets verschrikkelijks doen (zoals een cyberaanval of een chemisch wapen), slaat het de poort dicht. Het maakt niet uit of het antwoord super nuttig of snel zou zijn; als het gevaarlijk is, is het een hard "Nee".
  • Het Veiligheidsnet (The Safety Net): Als de AI onzeker is, raadt hij niet. Hij schakelt over naar een "veilige modus", waarbij hij een saai maar veilig antwoord geeft of eerst om een menselijke controle vraagt.
  • De Tijdmachine (The Time Machine): Als er iets misgaat terwijl de AI werkt, heeft SAGE een Rollback-knop. Het is als een "ongedaan maken"-functie in een videogame die het systeem onmiddellijk terugzet naar een veilige, bekende staat voordat de fout plaatsvond.

De Grote Robotrace: Wat ze vonden

Om te zien hoe goed dit systeem werkt in de echte wereld, zetten de onderzoekers een enorme, bevroren test op. Ze vroegen de robots niet gewoon één vraag; ze stuurden 84 specifieke, lastige gevallen naar 10 verschillende AI-snapshots (versies van modellen van OpenAI, Anthropic en Google). Ze behandelden elke robot precies hetzelfde, als een eerlijke race waarbij iedereen op hetzelfde moment op hetzelfde circuit rent.

Dit is wat zij ontdekten:

  1. Het "Nee" is niet het enige dat telt: Veel mensen denken dat de veiligste AI de AI is die weigert op alles te antwoorden. Maar de studie vond dat de "veiligste" robots eigenlijk de robots waren die "Ne" konden zeggen tegen slechte verzoeken en nog steeds "Ja" konden zeggen tegen behulpzame, onschadelijke verzoeken.
  2. De Winnaars: De top presteerders waren Claude Haiku 4.5, Claude Sonnet 4.6, en twee versies van Gemini. Deze modellen waren ongelooflijk goed in het herkennen en weigeren van gevaar, maar ze waren ook erg goed in het behulpzaam zijn bij normale vragen. Ze behaalden een "Balanced Guardrail Score" (een score die veiligheid en behulpzaamheid combineert) van bijna perfect, rond de 0,99 tot 1,00.
  3. De Moeilijke gevallen: De GPT-5 mini en GPT-5 nano modellen waren nog steeds erg veilig (ze gaven zelden gevaarlijke antwoorden), maar ze waren wat minder behendig. Ze weigerden vaker onschuldige vragen te beantwoorden, en wanneer ze probeerden veilige alternatieven te geven, waren ze er niet zo goed in. Hun scores waren lager, rond de 0,84 tot 0,86.
  4. De Verrassing: Het grootste verschil tussen de winnaars en de verliezers was niet dat de verliezers gevaarlijk waren. De verliezers waren eigenlijk best wel veilig! Het verschil was dat de winnaars nuttiger waren en beter waren in het omleiden van mensen naar veilige onderwerpen.

Wat het paper zegt (en niet zegt)

De onderzoekers zijn zeer voorzichtig om geen totale overwinning te verklaren. Ze vonden dat hoewel sommige robots duidelijk beter waren dan andere in deze specifieke test, de verschillen niet groot waren als het ging om het daadwerkelijk voorkomen van schade. Sterker nog, voor de meest gevaarlijke vragen deden bijna alle robots hun werk door "Nee" te zeggen.

Het paper sluit echter expliciet een aantal zaken uit:

  • Het is geen definitieve ranglijst: Je kunt niet zeggen "OpenAI is de slechtste" of "Anthropic is de beste" voor altijd. Dit zijn slechts snapshots van specifieke versies op een specifieke dag.
  • Het is geen garantie: De studie stelde slechts één vraag per robot. In de echte wereld kunnen kwaadwillenden duizenden trucjes proberen. Het paper geeft toe dat de "harmful compliance" (hoe vaak de robot daadwerkelijk iets slechts deed) erg laag was in hun test, maar dat betekent niet dat het onmogelijk is voor een robot om te falen in een complexer, echt scenario.
  • Het is geen magisch schild: Het SAGE-systeem is een blauwdruk. Het is een set instructies over hoe je een veilige AI bouwt, maar het paper heeft dit systeem niet daadwerkelijk ingezet om een echt bedrijf te draaien. Het is een ontwerp, geen afgewerkt product.

De Kern van de zaak

De belangrijkste les is dat veiligheid niet alleen gaat over een chagrijnige robot die "Nee" zegt tegen alles. Het beste veiligheidssysteem is een gelaagde vesting die de AI controleert voordat hij begint, hem in de gaten houdt terwijl hij werkt, en een plan heeft om dingen te herstellen als hij uitglijdt.

De studie suggereert dat de beste AI-modellen de modellen zijn die slim en behulpzaam kunnen zijn zonder gevaarlijk te zijn. De robots die het hoogst scoorden, waren de robots die het verschil konden zien tussen een slecht verzoek en een goed verzoek, waarbij ze de slechte verzoeken resoluut weigerden maar nog steeds vriendelijk en nuttig waren voor de goede verzoeken. Het paper concludeert dat we moeten blijven testen, onze veiligheidsnetten moeten blijven versterken en nooit moeten aannemen dat alleen omdat een robot één test heeft doorstaan, hij klaar is voor de echte wereld. Veiligheid is een reis, geen bestemming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →