Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors
Dit artikel introduceert een open evaluatietaak gebaseerd op de METR Task Standard die test of frontier AI-agenten autonoom gestructureerde klinische AI-beveiligingsaudits kunnen uitvoeren door aanvallen te implementeren, beveiligingsscores te berekenen en rapporten te genereren, waarbij wordt aangetoond dat modellen zoals Claude Sonnet 4.6 en GPT-4.1 perfecte scores kunnen behalen over meerdere datasets en architecturen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers leren om artsen te worden, waarbij ze helpen bij het diagnosticeren van ziekten en het beslissen over behandelingen. Deze "AI-artsen" zijn ongelooflijk slim, maar ze hebben een geheim zwak punt: ze kunnen worden bedrogen. Net zoals een mens misleid kan worden door een slimme optische illusie, kan een AI in de war worden gebracht door minuscule, bijna onzichtbare veranderingen in de gegevens die hij ontvangt. Als een hacker weet hoe hij deze kleine veranderingen moet aanbrengen, zou hij de AI kunnen misleuren om te zeggen dat een patiënt gezond is terwijl hij eigenlijk ziek is, of andersom. Dit wordt een "adversarial attack" genoemd, en dit is een enorm probleem omdat we deze trucjes niet moeten ontdekken voordat we de AI echte patiënten laten helpen, want dan zouden mensen erbij in de problemen kunnen komen.
Om dit te stoppen, hebben we "security auditors" nodig—specialisten die de AI met opzet proberen te breken om te zien hoe sterk deze is. Maar hier zit de crux: het zijn van een security auditor is moeilijk. Het vereist diepe wiskundige vaardigheden, speciale computerprogramma's en veel tijd. De meeste teams in ziekenhuizen hebben geen experts die dit kunnen doen, en de tools om dit te doen ontbreken vaak of zijn te ingewikkeld. Dus, de grote vraag is: Kan een nieuw soort superintelligent computerprogramma, een "AI agent" genoemd, dit moeilijke werk helemaal zelfstandig doen? Deze agents zijn als digitale stagiairs die instructies kunnen lezen, hun eigen computercode kunnen schrijven, tests kunnen uitvoeren en een rapport kunnen schrijven zonder dat een mens hen bij elke stap de hand houdt.
Dit artikel onderzoekt dat idee. De onderzoekers hebben een uitdagend "examen" gemaakt voor drie van de meest geavanceerde AI-agents ter wereld. Het examen vroeg hen om te fungeren als autonome security auditors voor een klinisch AI-model. De agents kregen een medisch voorspellingsmodel (zoals een model dat borstkanker of sterftecijfers op de IC voorspelt), een dataset met patiëntgegevens en een geschreven set instructies over hoe ze vier verschillende soorten security attacks moeten uitvoeren. De agents moesten hun eigen code vanaf nul schrijven om deze aanvallen uit te voeren, de cijfers te verwerken en een definitief beveiligingsrapport in een specifiek formaat te schrijven, alles binnen een beveiligde digitale container met een strikte tijdslimiet van 40 "turns" (of stappen).
De resultaten waren een mix van verbazingwekkend succes en interessante mislukkingen. Twee van de drie AI-agents, Claude Sonnet 4.6 en GPT-4.1, slaagden voor het examen met vlag en wimpel. Ze voltooiden elke versie van het examen perfect, schreven correcte code en genereerden telkens accurate beveiligingsrapporten bij elke poging. Ze deden dit efficiënt, waarbij ze relatief weinig "tokens" (de eenheden tekst die de AI verwerkt) gebruikten. De derde agent, GPT-4o, had echter moeite. Hij slaagde in slechts ongeveer 61% van de pogingen. Wanneer hij faalde, kwam dat niet omdat hij de wiskunde niet begreep; hij faalde omdat hij het proces kwijtraakte. Soms stopte hij met werken voordat hij het definitieve rapport kon opslaan, soms maakte hij een simpele rekenfout bij het optellen van de eindscores, en soms leverde hij een leeg bestand in. De studie suggereert dat hoewel topniveau AI-agents nu in staat zijn om complexe, meerstaps security auditing zelfstandig uit te voeren, ze niet allemaal even betrouwbaar zijn. Het verschil tussen succes en falen kwam vaak neer op "discipline"—het vermogen om gefocust te blijven, voortgang bij te houden en de klus te klaren zonder afgeleid te raken of slordige fouten te maken. Dit betekent dat voor ziekenhuizen die AI willen gebruiken om hun eigen medische AI te controleren, het kiezen van de juiste "digitale auditor" net zo belangrijk is als het medische model zelf.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.