FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts
Dit artikel beschrijft hoe het team FMI@SU met succes GPT-4.1 in een few-shot prompting-setup gebruikte om in Spaanse klinische teksten verslavingsgedrag te detecteren en te classificeren, wat resulteerde in een F1-score van 0,65 voor de ToxHabits-deeltaak.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Samenvatting van het onderzoek: "FMI@SU ToxHabits"
Stel je voor dat je een enorme berg medische dossiers hebt, geschreven in het Spaans. In deze dossiers vertellen artsen over hun patiënten. Maar er zit een groot probleem in: deze verhalen staan niet in nette tabellen of lijsten. Ze zijn als een rommelige schatkist vol met losse zinnen, waaruit je moet halen wie er rookt, drinkt of drugs gebruikt. Dit noemen we "ongestructureerde data".
Het team van de universiteit in Sofia (Bulgarije) wilde een slimme computer helpen om deze schatkist te doorzoeken. Hun missie: automatisch vinden waar in die Spaanse teksten sprake is van schadelijke gewoontes (zoals roken, alcohol, cannabis of andere drugs) en deze precies markeren.
Hier is hoe ze dat aanpakken, vertaald in alledaagse taal:
1. De Uitdaging: Een naald in een hooiberg
De artsen schrijven hun verslagen in een natuurlijke, soms chaotische stijl. Een computer die niet goed is getraind, ziet misschien alleen woorden als "rook" of "drank", maar mist de context. Is de patiënt nu een roker, of rookte hij vroeger maar is hij gestopt? Is het een recept voor medicijnen of een verslaving?
Het team deed mee aan een wedstrijd (de ToxHabits Shared Task) om te zien wie het beste deze "naalden" (de gewoontes) uit het "hooi" (de teksten) kon halen.
2. De Oplossing: De Slimme Vertaler (LLM)
In plaats van de computer te dwingen om duizenden regels te leren (wat veel tijd kost), gebruikten ze een Grote Taalmodel (LLM), zoals een zeer slimme, digitale vertaler die al miljoenen boeken heeft gelezen.
Ze gebruikten een trucje genaamd "Few-Shot Learning" (weinig voorbeelden).
- De Analogie: Stel je voor dat je een kind wilt leren wat een "appel" is. Je hoeft niet duizenden appels te laten zien. Je pakt er gewoon 5 voorbeelden van, zegt: "Kijk, dit is een appel," en vraagt dan: "Welk van deze andere dingen is ook een appel?"
- In de praktijk: Het team gaf de computer 5 voorbeeldzinnen uit de medische dossiers waarin duidelijk was wat een "rookverslaving" was. Vervolgens vroeg de computer aan de rest van de tekst: "Zoek hier ook naar dingen die op deze voorbeelden lijken."
3. Wat deden ze precies?
Het team probeerde verschillende methoden:
- De Woordenlijst-methode: Een simpele lijst met woorden zoeken (zoals een woordenboek). Dit werkt goed om veel dingen te vinden, maar vaak ook dingen die niet belangrijk zijn (veel "valse alarmen").
- De Slimme Computer (GPT-4.1): Ze gaven de slimme computer een paar voorbeelden en lieten hem de rest van de tekst lezen.
Het resultaat:
De slimme computer met de "weinig voorbeelden"-truc (GPT-4.1) deed het het beste. Hij haalde een score van 0.65 (op een schaal van 0 tot 1). Dat is een heel goed resultaat, zeker voor een taal als het Spaans, waar er minder digitale hulpmiddelen zijn dan in het Engels.
4. De Problemen: De "Te Grijze" Randen
Hoewel de computer slim was, had hij nog een klein mankement.
- Het Probleem: De computer vond vaak het juiste woord, maar pakte er ook een beetje te veel "randzaken" bij.
- De Analogie: Stel, de patiënt zegt: "Hij rookte veel sigaretten."
- Het juiste antwoord is: "rookte" (of "sigaretten", afhankelijk van de vraag).
- De computer schreef soms: "Hij rookte veel sigaretten".
De computer was te enthousiast en pakte de hele zin mee in plaats van alleen het stukje waar het om ging. Dit is als iemand die vraagt om een foto van een hond, en jij geeft hem de hele foto van de tuin inclusief de hond. De hond is er wel, maar de randen zijn niet precies.
5. Conclusie: Een Belofte voor de Toekomst
Dit onderzoek toont aan dat je met moderne AI (zoals GPT-4) heel goed medische informatie uit Spaanse teksten kunt halen, zelfs als je maar weinig voorbeelden hebt.
- Waarom is dit belangrijk? Omdat we zo sneller kunnen zien hoeveel mensen verslaafd zijn aan drugs of alcohol. Dit helpt artsen en onderzoekers om betere behandelingen te bedenken en de volksgezondheid te verbeteren.
- De volgende stap: De computer moet leren om zijn "randen" scherper te maken, zodat hij niet de hele zin meeneemt, maar alleen het exacte woord dat belangrijk is.
Kortom: Het team heeft een slimme digitale assistent getraind die Spaanse medische dossiers kan "lezen" en daaruit de gevaarlijke gewoontes van patiënten kan filteren. Het werkt nog niet perfect, maar het is een enorme stap vooruit in het gebruik van AI voor gezondheidszorg in het Spaans.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.