← Nieuwste papers
💻 computer science

Measuring and Evaluating the Performance of Generative AI Models for Scam Detection

Dit artikel introduceert een nieuwe benchmark-dataset van real-world scams om negen large language models te evalueren, waarbij wordt aangetoond dat hoewel effectieve prompting kleinere modellen verbetert, vooraf getrainde LLM's over het algemeen beter presteren dan fine-tuned classifiers in het generaliseren naar onbekende scam-scenario's.

Oorspronkelijke auteurs: Cem Topcuoglu, Seyed Ali Akhavani, Harel Berger, Sadia Afroz, Michalis Pachilakis, Vibhor Sehgal, Leyla Bilge, Engin Kirda

Gepubliceerd 2026-07-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Cem Topcuoglu, Seyed Ali Akhavani, Harel Berger, Sadia Afroz, Michalis Pachilakis, Vibhor Sehgal, Leyla Bilge, Engin Kirda

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een enorme, bruisende marktplaats waar iedereen probeert je iets te verkopen, je een verhaal te vertellen of je om een gunst te vragen. In deze chaotische bazaar zijn er ook slimme oplichters—scammers—die zich voordoen als vriendelijke buren of vertrouwde ambtenaren om je geld of geheimen te stelen. Jarenlang hebben beveiligingsexperts geprobeerd digitale uitsmijters te bouwen om deze oplichters te vangen. Traditioneel waren deze uitsmijters als strikte regelvolgers: ze leerden specifieke zinnen uit het hoofd zoals "klik hier voor een prijs" en markeerden alles wat daarmee overeenkwam. Maar oplichters zijn creatief; ze veranderen hun verhalen, waardoor de oude regelvolgers de nieuwe trucjes vaak missen.

Maak kennis met de nieuwe generatie digitale uitsmijters: Large Language Models (LLM's). Zie hen niet als regelvolgers, maar als superlezers die bijna elk boek, elke website en elk gesprek op het internet hebben verslonden. Ze kijken niet alleen naar trefwoorden; ze proberen de intentie en het gevoel achter een bericht te begrijpen. Ze zijn als detectives die tussen de regels door kunnen lezen om te ontdekken of iemand liegt, zelfs als de leugenaar een compleet nieuw script gebruikt. De grote vraag die iedereen stelt is: kunnen deze superlezers daadwerkelijk oplichters in het wild vangen, of zijn het slechts chique chatbots die in de war raken door echte levenspraktische trucs?

Dit artikel is een diepe duik in dat exacte vraagstuk. De auteurs, een team van onderzoekers van universiteiten en beveiligingsbedrijven, besloten negen verschillende "superlezers" op de proef te stellen. Ze vroegen hen niet alleen om te gokken; ze creëerden een enorme, unieke "scam-examen" met meer dan 2.700 praktijkvoorbeelden van scam-berichten, schone berichten en verwarrende berichten waar zelfs experts moeite mee hadden om ze te labelen. Ze testten alles, van kleine, efficiënte modellen tot gigantische, krachtige modellen, waarbij ze verschillende manieren gebruikten om vragen te stellen (zoals het geven van voorbeelden of het vragen om stap voor stap na te denken).

Dit is wat zij vonden: De grootste, meest krachtige modellen (zoals de gigantische Llama 3.1 met 70 miljard parameters en de nieuwste ChatGPT-versies) zijn inderdaad de beste detectives en vangen ongeveer 65% van de lastige gevallen correct op. Echter, grootte is niet alles. Het artikel suggereert dat de manier waarop je de vraag stelt een enorm verschil maakt. Voor kleinere modellen kan het geven van een kleine "hint" of een lijst met veelvoorkomende kenmerken van scams (zoals "te mooi om waar te zijn" of "urgente druk") hun prestaties aanzienlijk verbeteren, waardoor ze bijna zo goed worden als de grote modellen. Maar er is een addertje onder het gras: deze superlezers zijn geen magische zilveren kogel. Ze zijn niet perfect, en soms raken ze net zo in de war als mensen.

Interessant genoeg vergeleken de onderzoekers deze chique nieuwe modellen ook met een ouder, eenvoudiger type AI genaamd BERT. In een gecontroleerde test deed het oudere model het verrassend goed, maar wanneer de oplichters hun tactieken veranderden (door gebruik te maken van data die het model nog nooit had gezien), struikelde het oudere model. De gigantische LLM's waren echter veel beter in het afhandelen van deze nieuwe, onbekende trucs, wat suggereert dat hun enorme wereldkennis hen helpt om beter te generaliseren. Het artikel concludeert dat, hoewel deze AI-modellen krachtige instrumenten zijn, de beste aanpak niet is om op slechts één groot brein te vertrouwen, maar om een hybride team te bouwen dat het diepe begrip van de grote modellen combineert met de snelheid en betrouwbaarheid van simpelere, traditionele tools. Ze hebben ook hun "examenvragen" (de dataset) aan het publiek vrijgegeven, in de hoop anderen te helpen bij het bouwen van betere verdedigingen tegen de voortdurend evoluerende kunst van de scam.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →