← Nieuwste papers
💻 computer science

A Multi-Turn Framework for Evaluating AI Misuse in Fraud and Cybercrime Scenarios

Dit onderzoek introduceert een multi-turn evaluatieframework, ontwikkeld in samenwerking met wetshandhavings- en beleidsdeskundigen, dat aantoont dat huidige taalmodellen zonder geavanceerde jailbreak-technieken slechts minimale bruikbare informatie bieden voor fraude en cybercriminaliteit, waarbij het ontleden van verzoeken in ogenschijnlijk onschuldige vragen effectiever bleek dan expliciete kwaadaardige framing.

Oorspronkelijke auteurs: Kimberly T. Mai, Anna Gausen, Magda Dubois, Mona Murad, Bessie O'Dell, Nadine Staes-Polet, Christopher Summerfield, Andrew Strait

Gepubliceerd 2026-03-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kimberly T. Mai, Anna Gausen, Magda Dubois, Mona Murad, Bessie O'Dell, Nadine Staes-Polet, Christopher Summerfield, Andrew Strait

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, superintelligente bibliotheek hebt die alles weet. Maar deze bibliotheek heeft een strenge bibliothecaris die precies weet welke boeken je niet mag lenen, zoals handleidingen voor het plegen van misdaden.

Dit onderzoek van het AI Security Institute in het VK is eigenlijk een grote test om te kijken: "Hoe goed is die bibliothecaris? Kan een crimineel toch nog een bruikbare handleiding voor fraude of hacking uit de bibliotheek krijgen, als hij slim genoeg is om de bibliothecaris te omzeilen?"

Hier is wat ze hebben gedaan en wat ze vonden, vertaald in alledaags taal:

1. De Proef: Een "Gesprek" met de Crimineel

In plaats van de AI gewoon te vragen: "Hoe maak ik een valse identiteit?" (waarop de AI waarschijnlijk direct "Nee" zou zeggen), hebben de onderzoekers een slimme truc gebruikt. Ze hebben het gesprek opgedeeld in kleine, onschuldige stukjes.

  • De Analogie: Stel je voor dat je een kok wilt overtuigen om gif in een maaltijd te doen. Als je direct vraagt: "Geef me gif," zegt hij nee. Maar als je vraagt: "Hoe werkt de chemie van smaak?", dan "Hoe kun je voedsel langer bewaren?", en dan "Hoe ziet een recept eruit voor een maaltijd die niemand wil eten?", dan ben je stap voor stap dichter bij het doel.
  • De onderzoekers deden dit met drie soorten misdaad:
    1. Romance Scams: Iemand die een valse liefde opzoekt om geld te stelen.
    2. CEO Impersonation: Iemand die doet alsof hij de baas is om werknemers geld te laten overmaken.
    3. Identiteitsdiefstal: Iemand die je persoonlijke gegevens steelt.

Ze lieten de AI met deze "schijnbaar onschuldige" vragen praten, alsof ze een echte crimineel waren die probeerde de AI te misleiden.

2. De Resultaten: De Bibliothecaris Wint (meestal)

Wat bleek er na duizenden gesprekken?

  • De AI is niet zo'n makkelijk doelwit: Zonder ingewikkelde, geavanceerde hacks (zogenoemde "jailbreaks") gaf de AI weinig tot niets bruikbare informatie. In 88% van de gevallen gaf de AI gewoon een standaard antwoord of weigerde hij. De informatie die ze wel gaven, was vaak gewoon iets wat je ook op Google kunt vinden.
  • De "Ongecensureerde" AI's zijn gevaarlijker: De onderzoekers testten ook AI-modellen waar de "bibliothecaris" uit was gehaald (modellen die niet veilig zijn ingesteld). Deze gaven wel veel meer bruikbare informatie. Dit bewijst dat de veiligheidsmaatregelen echt werken.
  • De "Onschuldige" Vraag werkt beter: De truc met de kleine, onschuldige vragen (de stap-voor-stap aanpak) werkte beter dan het direct vragen om misdaden. De AI viel hier vaker op in. Maar zelfs toen gaf de AI zelden een volledig werkend plan voor een misdaad.

3. De Belangrijkste Leerpunten

  • AI is geen toverstaf voor criminelen: Op dit moment helpt AI criminelen niet enorm veel om complexe misdaden te plegen, tenzij ze heel veel moeite doen om de beveiliging te kraken. De AI is nog niet slim genoeg om een heel misdrijf van A tot Z te plannen en uit te voeren zonder dat de mens er hard aan moet werken.
  • Veiligheid werkt, maar moet scherper: De huidige beveiliging (de "bibliothecaris") doet zijn werk goed. Maar de onderzoekers zien wel dat als je de vragen slim verpakt, de AI soms toch iets meer helpt. Dit betekent dat we de beveiliging moeten verbeteren om ook die "slimme" gesprekken te herkennen.
  • Het hangt af van het model: Niet alle AI's zijn hetzelfde. Sommige modellen (vooral die zonder strenge regels) zijn veel gevaarlijker dan andere.

Conclusie in het Kort

Deze studie zegt eigenlijk: "Maak je geen zorgen dat AI morgen alle banken leeghaalt, maar blijf wel alert."

De AI is momenteel meer een slimme assistent die weigert mee te werken aan slechte plannen, dan een super-crimineel. Maar omdat criminelen slim zijn en AI steeds slimmer wordt, moeten we blijven testen of die "bibliothecaris" zijn werk blijft doen, zelfs als de crimineel probeert te praten alsof hij een schrijver of onderzoeker is.

Het onderzoek biedt nu een nieuwe manier om dit te blijven testen, zodat we weten of de AI in de toekomst gevaarlijker wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →