A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models
Dit artikel introduceert een benchmark voor het evalueren van end-to-end zero-shot biomedische relatie-extractie met behulp van OpenAI-modellen, waarbij wordt aangetoond dat hoewel deze grote taalmodellen de prestaties van supervised learning benaderen op bepaalde datasets, ze nog steeds moeite hebben met complexe inputs die meerdere relaties bevatten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van medisch onderzoek voor als een enorme, steeds groeiende bibliotheek. Elke dag worden er duizenden nieuwe boeken (wetenschappelijke artikelen) aan de schappen toegevoegd. In deze boeken staan cruciale feiten: welke medicijnen samenwerken, welke genen ziektes veroorzaken en hoe chemicaliën interageren met eiwitten.
Het probleem is dat deze bibliotheek te groot is voor mensen om handmatig te lezen en te organiseren. We hebben een manier nodig om deze feiten automatisch eruit te halen en in overzichtelijke, gestructureerde lijsten te plaatsen (zoals een spreadsheet), zodat computers ze kunnen gebruiken. Dit proces wordt Relation Extraction (RE) genoemd.
Traditioneel moesten we, om een computer dit te leren, experts inhuren om duizenden artikelen te lezen, de feiten te markeren en ze te labelen. Dit is als het inhuren van een team van bijlesdocenten om een student voor elk nieuw onderwerp les te geven. Het is traag, duur en uitputtend.
De Grote Vraag: Kunnen we de bijlesdocent overslaan?
Met de opkomst van "Large Language Models" (LLM's)—superintelligente AI-chatbots zoals diegene die je misschien hebt gebruikt—vroegen onderzoekers zich af: Kunnen we de AI gewoon vragen het werk te doen zonder het eerst te onderwijzen? Dit wordt Zero-Shot learning genoemd. In plaats van de AI te trainen met voorbeelden, geven we het simpelweg een prompt (een instructie) en kijken we of het de opdracht ter plekke kan begrijpen.
Dit artikel is een benchmarktest. De auteurs hebben een "sportschool" opgezet met zeven verschillende soorten medische puzzels om te zien of deze AI-modellen ze kunnen oplossen zonder enige voorafgaande training.
Het Experiment: De AI versus de Bibliotheek
De onderzoekers testten drie verschillende AI-modellen (GPT-4, OpenAI's "o1", en een open-source model genaamd GPT-OSS) op zeven verschillende datasets. Denk aan deze datasets als verschillende moeilijkheidsgraden in een videogame:
- De Makkelijke Niveaus: Sommige puzzels waren eenvoudig. Ze bestonden uit korte zinnen met slechts één of twee soorten feiten om te vinden (zoals "Medicijn A veroorzaakt Bijwerking B").
- De Moeilijke Niveaus: Andere puzzels waren chaotisch. Ze bevatten lange paragrafen met tientallen feiten, complexe wetenschappelijke namen en veel verschillende soorten relaties die door elkaar liepen.
De taak van de AI was om de tekst te lezen en een gestructureerde lijst met feiten te produceren, zoals: {Medicijn: Aspirine, Effect: Vermindert pijn}.
Wat ze vonden
De resultaten waren een mix van "niet slecht" en "moet nog beter worden".
- De Simpele Zaken: Wanneer de tekst kort was en de feiten voor de hand lagen, presteerden de AI-modellen verrassend goed. Ze waren bijna net zo goed als de traditionele, intensief getrainde systemen. Het is alsoal de AI gemakkelijk een rode appel in een schaal met fruit kan herkagen.
- De Complexe Zaken: Wanneer de tekst lang en rommelig werd, begon de AI te struikelen.
- Ontbrekende Stukken: Als een paragraaf 10 feiten bevatte, vond de AI er vaak slechts 3 of 4. Het is als het lezen van een lang verhaal waarbij je alleen het begin en het einde onthoudt en het midden vergeet.
- Verkeerde Grenzen: Soms begreep de AI de essentie wel, maar gebruikte het de verkeerde woorden. Als de tekst "ernstige hoofdpijn" zei, kon de AI alleen "hoofdpijn" extraheren. In de medische wetenschap maakt dat kleine verschil uit.
- Verwarring: Op de moeilijkste datasets (met 8 verschillende soorten relaties) raakte de AI erg in de war en haalde vaak door elkaar welk medicijn wat deed bij welke ziekte.
Het "Gold Standard"-probleem
Een van de meest interessante punten van het artikel gaat over hoe we de AI beoordelen.
- De Strenge Beoordelaar: Als de AI "hypertensie" schrijft maar het tekstboek zegt "hoge bloeddruk", zegt een strenge computer "Fout!" ook al zou een mens zeggen "Dat is hetzelfde".
- De Menselijke Realiteit: De auteurs ontdekten dat de AI soms feiten vond die de menselijke experts in het originele tekstboek over het hoofd hadden gezien. Dit suggereert dat de "correcte" antwoorden in deze tests ook niet perfect zijn.
Het Oordeel
Het artikel concludeert dat Zero-Shot AI dichter bij bruikbaarheid komt, maar het is nog niet klaar om menselijke experts te vervangen.
- Voor eenvoudige taken: Het is een geweldig hulpmiddel. Je kunt het vragen om feiten uit korte zinnen te halen, en het zal het waarschijnlijk goed doen.
- Voor complexe taken: Het heeft nog steeds moeite. Het heeft de neiging om feiten in lange documenten te missen en raakt in de war door complex wetenschappelijk jargon.
De auteurs waarschuwen ook dat we niet precies weten op welke data deze AI-modellen zijn getraind. Het is mogelijk dat ze sommige antwoorden hebben "uit het hoofd geleerd" omdat deze artikelen online staan. Echter, aangezien de AI zo slecht presteerde op de moeilijkste datasets, is het onwaarschijnlijk dat het simpelweg de antwoorden heeft uit het hoofd geleerd; het probeert daadwerkelijk de tekst te begrijpen.
In een Notendop
Beschouw deze AI-modellen als briljante maar onervaren stagiairs.
- Als je ze een kort, duidelijk memo geeft, kunnen ze het perfect samenvatten.
- Als je ze een complex rapport van 50 pagina's geeft met tegenstrijdige details, missen ze misschien de belangrijkste punten of krijgen ze de details er net naast.
Het artikel zegt niet dat we moeten stoppen met het gebruik van deze tools, maar het stelt wel dat we voorzichtig moeten zijn. We kunnen ze nog niet zomaar de hele medische database alleen laten beheren; we moeten hun werk nog steeds controleren, vooral wanneer de informatie complex is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.