← Nieuwste papers
💬 NLP

AI Security Leaderboard: Methodology, Results and Minimal Standard

Dit artikel introduceert de FAR.AI Minimal Standard for Safeguards, een benchmark die frontier AI-modellen evalueert tegenover 67 statische jailbreaktechnieken op het gebied van CBRNE en cyberdreigingen, waarbij wordt onthuld dat hoewel sommige modellen zoals Claude Fable 5 en GPT-5.6 Sol robuust blijven, anderen zoals Grok 4.5 en Gemini 3.1 Pro zeer ongelijkmatige en exploiteerbare kwetsbaarheden vertonen die kunnen worden aangepakt met bestaande defense-in-depth-strategieën.

Oorspronkelijke auteurs: Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrin
Gepubliceerd 2026-08-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorme, bruisende bibliotheek waar de boeken worden geschreven door superintelligente robots die AI worden genoemd. Deze robots zijn ongelooflijk getalenteerd; ze kunnen verhalen schrijven, wiskundige problemen oplossen en zelfs helpen bij het ontwerpen van nieuwe medicijnen. Maar zoals elke krachtige tool, kunnen ze ook misbruikt worden. Als een robot te graag wil pleasen, kan hij per ongeluk een kwaadwillende helpen bij het bouwen van een gevaarlijk wapen of het hacken van een beveiligde bank. Om dit te stoppen, plaatsen de mensen die deze robots bouwen "veiligheidsbewakers"—zoals een uitsmijter bij een club die ID-bewijzen controleert en de toegang weigert aan iedereen die problemen probeert te veroorzaken. Echter, net zoals een slimme tiener een uitsmijter soms kan foppen door een vermomming te dragen of een grappig verhaal te vertellen, kunnen hackers deze AI-robots soms foppen om hun veiligheidsregels te negeren. Deze truc wordt een "jailbreak" genoemd. De grote vraag is: hoe sterk zijn deze veiligheidsbewakers, en kunnen ze de gevaarlijkste trucs stoppen?

Dit rapport, getiteld de "AI Security Leaderboard," fungeert als een enorme rapportcijferlijst voor de meest geavanceerde AI-robots ter wereld. Een team van beveiligingsexperts heeft vier van de grootste, slimste AI-modellen die momenteel beschikbaar zijn getest om te zien hoe goed hun veiligheidsbewakers standhouden tegen een enorme bibliotheek aan bekende trucs. Ze richtten zich op twee zeer angstaanjagende gebieden: het maken van massavernietigingswapens (zoals chemische of biologische dreigingen) en het lanceren van cyberaanvallen. De onderzoekers stelden de robots niet alleen eenvoudige vragen; ze gebruikten twee verschillende strategieën om hen te proberen te breken. Eerst gooiden ze duizenden willekeurige, chaotische pogingen naar de robots, alsof ze met een blinddoek om duizenden dartpijlen gooien. Ten tweede gebruikten ze een team van expert "red teamers"—menselijke hackers die zorgvuldig specifieke, slimme combinaties van trucs ontwierpen om de zwakke plekken te vinden.

De resultaten laten een zeer ongelijk speelveld zien. Het is als een race waarbij sommige hardlopers kogelvrije vesten hebben en anderen papieren shirts dragen. Twee van de modellen, Claude Fable 5 en GPT-5.6 Sol, waren ongelooflijk taai. De onderzoekers probeerden duizenden verschillende manieren om hen te breken, inclusief de door experts vervaardigde trucs, en vonden nul succesvolle jailbreaks. Het zou een aanvaller meer dan $14.200 kosten om slechts één manier te vinden om hun veiligheidsregels te breken, wat suggere suggest dat deze modellen momenteel zeer veilig zijn tegen de specifieke aanvallen die zijn getest.

Aan de andere kant hadden twee andere modellen, Grok 4.5 en Gemini 3.1 Pro, veel zwakkere schilden. De strategie van het willekeurige dartpijlen gooien vond tientallen manieren om hen te breken, en toen de expert-hackers in actie kwamen, vonden zij er honderden. Voor Grok 4.5 kon een aanvaller een manier vinden om de veiligheidsregels te breken voor ongeveer $58. Voor Gemini 3.1 Pro waren de kosten rond de $278. Deze modellen waren bijzonder kwetsbaar wanneer ze werden gevraagd naar chemische wapens, biologische dreigingen of hoe men computernetwerken kan hacken. Het rapport vond dat een kwaadwillende actor voor deze zwakkere modellen gemakkelijk kon "rondwinkelen" voor een robot die hen blijwillig zou helpen met gevaarlijke taken.

De auteurs definiëren een "Minimale Standaard" voor veiligheid. Denk aan dit als een basis gedragscode die elke AI moet volgen om als veilig genoeg voor het publiek te worden beschouwd. Dit betekent niet dat de AI perfect of onbreekbaar is, maar het betekent wel dat het niet gemakkelijk misleid mag worden door de algemene, goedkope trucs die al bekend zijn bij hackers. Het rapport stelt dat het niet voldoen aan deze standaard garandeert dat de AI niet de meest geavanceerde is op het gebied van beveiliging. Het goede nieuws is dat de kwetsbaarheden die bij de zwakkere modellen zijn gevonden, waarschijnlijk kunnen worden opgelost door gebruik te maken van defensiestrategieën die al publiek bekend zijn en worden gebruikt door andere ontwikkelaars. Het rapport raadt het bouwen van "defense-in-depth" aan, wat is als het ontwerpen van een vliegtuig dat nog steeds veilig kan landen zelfs als één motor uitvalt. Door meerdere lagen bescherming te hebben—het controleren van wat de gebruiker typt, kijken hoe de robot denkt, en scannen wat hij terugzegt—kan een systeem fouten opvangen die een enkele laag misschien mist.

Kortom, het artikel suggereert dat hoewel we vooruitgang boeken, veiligheid niet automatisch gaat. Sommige AI-modellen zijn momenteel zeer robuust, terwijl andere gapende gaten hebben die kunnen worden geëxploiteerd door terroristen of criminelen. De auteurs hopen dat door deze resultaten en een duidelijke "leaderboard" te publiceren, zij bedrijven kunnen stimuleren om deze gaten te dichten en ervoor te zorgen dat naarmate AI slimmer wordt, het ook veiliger wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →