Evaluating Transformer Models for Suicide Risk Detection on Social Media
Dit artikel presenteert een studie door het kubapok-team voor de IEEE BigData 2024 Cup, die aantoont dat een gefinetuned GPT-4o-model beter presteert dan DeBERTa en GPT-4o met prompting-configuraties om de tweede plaats te behalen in de taak van detectie van suïciderisico in vier klassen op sociale media.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elk jaar beëindigen honderdduizenden mensen het leven, een tragedie die vaak een spoor van ongerapporteerde pogingen en blijvende pijn achterlaat voor families en gemeenschappen. In het digitale tijdperk wordt het verhaal van hoe mensen tot dit punt komen steeds vaker geschreven op het publieke plein van sociale media. Platforms zoals Reddit huisvesten duizenden berichten waarin individuen hun donkerste gedachten delen, soms door expliciet plannen te beschrijven om hun leven te beëindigen, andere keren door te hinten op een stille strijd. Voor professionals in de geestelijke gezondheidszorg is de uitdaging immens: hoe kunnen zij deze kreten om hulp vinden tussen de miljarden dagelijkse berichten, en hoe kunnen zij het verschil zien tussen iemand die aan zelfmoord denkt en iemand die actief een plan smeedt? Hier komt het vakgebied van natuurlijke taalverwerking kijken, waarbij computerprogramma's worden gebruikt die getraind zijn om menselijke tekst te lezen en te begrijpen. Deze instrumenten vervangen de menselijke oordeelsvorming niet, maar bieden een manier om grote hoeveelheden informatie snel te scannen, op zoek naar specifieke patronen die gevaar signaleren. Het doel is niet om de toekomst met zekerheid te voorspellen, maar om risico vroegtijdig te identificeren om hulp te bieden aan hen die anders over het hoofd zouden worden gezien.
Een team van onderzoekers uit Polen, werkend onder de naam kubapok, heeft dit idee onlangs op de proef gesteld in een wereldwijde wedstrijd die ontworpen is om de detectie van zelfmoordrisico door machines te verbeteren. Zij namen deel aan de IEEE BigData 2024 Cup, een uitdaging die deelnemers vroeg om een systeem te bous dat in staat is om sociale mediaberichten te lezen en ze in vier afzonderlijke categorieën te sorteren. De eerste categorie, genaamd 'indicator', omvat berichten die zelfmoord vermelden maar geen onmiddellijk risico vertonen, zoals iemand die praat over de strijd van een vriend. De tweede, 'ideation' (ideatie), vangt berichten op waarbij een persoon aan zelfmoord denkt maar geen specifief plan heeft. De derde, 'behavior' (gedrag), beschrijft berichten waarbij de persoon een plan heeft of betrokken is bij zelfbeschadigende handelingen. De laatste categorie, 'attempt' (poging), is gereserveerd voor berichten die eerdere zelfmoordpogingen beschrijven die niet tot de dood hebben geleid. De onderzoekers kregen een dataset van duizenden echte berichten van Reddit, waarvan sommige gelabeld waren met deze categorieën en andere ongelabeld waren, en zij moesten een computer leren om deze onderscheiden nauwkeurig te maken.
Om dit probleem op te lossen, experimenteerde het team met drie verschillende benaderingen met behulp van geavanceerde computermodellen die bekend staan als 'transformers'. Dit zijn grote systemen die enorme hoeveelheden tekst hebben gelezen en hebben geleerd hoe taal werkt. De eerste benadering gebruikte een model genaamd DeBERTa, dat fungeert als een lezer die tekst analyseert om de betekenis ervan te begrijpen. Het team trainde dit model op de gelabelde berichten om te zien of het de verschillen tussen de vier risiconiveaus kon leren. De tweede benadering gebruikte een veel groter en krachtiger model genoemd GPT-4o, maar deze keer trainden zij het model niet op de specifieke data. In plaats daarvan gaven zij het model een reeks voorbeelden en vroegen het het model om stapsgewijs over de taak na te denken, een methode die bekend staat als 'chain-of-thought prompting', in de hoop dat de bestaande kennis van het model voldoende zou zijn. De derde benadering gebruikte ook het GPT-4o-model, maar deze keer trainden zij het daadwerkelijk op de specifieke dataset van de wedstrijd, waardoor het model zijn interne instellingen kon aanpassen om beter bij de taak aan te sluiten.
De resultaten van hun experimenten toonden een duidelijke winnaar aan. Hoewel het getrainde DeBERTa-model goed presteerde, en het ongetrainde GPT-4o-model moeite had met het maken van nauwkeurige onderscheiden, zelfs met veel voorbeelden, bleek de versie van GPT-4o die specifiek op de wedstrijddata was getraind het meest effectief te zijn. Dit verfijnde model bereikte de hoogste nauwkeurigheid bij het identificeren van de juiste risicocategorie voor elk bericht. Toen de definitieve resultaten werden opgeteld, behaalde het team met hun oplossing, gebaseerd op dit getrainde model, de tweede plaats van dertien teams die de finale evaluatie bereikten, net achter het winnende team. De onderzoekers vonden dat het getrainde model consistent en betrouwbaar was, terwijl hun andere pogingen meer variatie in prestaties lieten zien. Deze uitkomst suggereert dat zelfs een algemeen computermodel, wanneer het een specifieke set voorbeelden krijgt om van te leren, een zeer effectief hulpmiddel kan worden om de subtiele verschillen te ontdekken tussen iemand die aan zelfmoord denkt en iemand die in onmiddellijk gevaar is.
Ondanks dit succes wijzen de onderzoekers er voorzichtig op wat de beperkingen zijn van wat hun systeem kan doen. De data die zij gebruikten, kwamen volledig van openbare berichten op Reddit, verzameld tijdens een specifieke periode die de wereldwijde pandemie omvatte. Dit betekent dat het systeem mogelijk minder goed werkt op andere platforms of bij mensen die sociale media niet op dezelfde manier gebruiken. Bovendien miste de wedstrijddata de rijke context die een menselijke arts zou gebruiken, zoals de volledige medische geschiedenis van een patiënt of een gesprek van oog in oog. Het systeem zag alleen de tekst van een enkel bericht, zonder de omliggende reacties of de eerdere activiteit van de gebruiker die cruciale aanwijzingen hadden kunnen bieden. De auteurs stellen dat voor deze instrumenten echt effectief te zijn in het redden van levens, toekomstige datasets moeten worden opgebouwd met strengere standaarden, bijvoorbeeld door directe samenwerking met professionals in de geestelijke gezondheidszorg om de risiconiveaus van de mensen die posten te verifiëren. Tot die tijd dienen deze modellen als krachtige assistenten, in staat om de digitale ruis te scannen om de signalen te vinden die er toe doen, maar ze zijn geen vervanging voor de genuanceerde zorg die door menselijke experts wordt geboden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.