Mapping social determinants of health in NIH research funding with large language models
Deze studie toont aan dat gefinetunede grote taalmodellen, met name ModernBERT-base, traditionele trefwoordmethoden en zero-shot benaderingen aanzienlijk overtreffen bij het classificeren van sociale determinanten van gezondheid binnen NIH-beursnarratieven, waarbij het identificeren van drempelkalibratie als een cruciale strategie wordt aangewezen voor het aanpakken van labelonbalans.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elke dag wordt de gezondheid van een persoon gevormd door veel meer dan alleen de medicijnen die zij ontvangen of de artsen die zij bezoeken. Het wordt beïnvloed door de lucht die zij inademen, de veiligheid van hun buurt, hun vermogen om voedsel te betalen en of zij toegang hebben tot kwaliteitsonderwijs. Wetenschappers noemen deze factoren de sociale determinanten van gezondheid. Het zijn de onzichtbare krachten die bepalen waarom sommige gemeenschappen floreren terwijl anderen worstelen, en ze zijn verantwoordelijk voor het overgrote deel van de gezondheidsuitkomsten. Om deze diepgewortelde problemen op te lossen, moeten overheden weten waar hun onderzoeksgeld naartoe gaat. In de Verenigde Staten fungeert de National Institutes of Health als de grootste publieke financier van gezondheidsonderzoek ter wereld, waarbij miljarden dollars naar specifieke projecten worden geleid. Als deze financiering consequent bepaalde sociale problemen negeert, wordt de wetenschappelijke bewijslast die nodig is om die problemen op te lossen, nooit opgebouwd.
Jarenlang werden onderzoekers die probeerden bij te houden hoeveel geld de overheid aan deze sociale kwesties uitgeeft, geconfronteerd met een moeilijke hindernis. Ze moesten duizenden subsidieaanvragen doorlezen, wat lange, complexe documenten zijn geschreven door wetenschappers. Om de relevante projecten te vinden, vertrouwden ze voorheen op eenvoudige computerzoekopdrachten die zochten naar specifieke trefwoorden. Als een subsidievoorstel de exacte juiste woorden gebruikte, werd het meegeteld. Als het hetzelfde probleem met andere taal beschreef of het idee verweefde in een breder verhaal, miste de computer het. Deze methode was te rigide, zoals proberen een naald in een hooiberg te vinden door alleen te zoeken naar naalden die exact dezelfde kleur hebben. Als gevolg hiervan bleef het ware beeld van waar het onderzoeksgeld naartoe stroomde wazig, en gingen hiaten in de financiering voor kritieke sociale kwesties onopgemerkt voorbij.
Een team van onderzoekers besloot onlangs een andere aanpak te proberen, gebruikmakend van een nieuwe generatie kunstmatige intelligentie die bekend staat als large language models. Dit zijn computersystemen die getraind zijn op enorme hoeveelheden tekst en die context en nuance kunnen begrijpen, net als een menselijke lezer. In plaats van alleen op zoek te gaan naar trefwoorden, kunnen deze modellen een subsidievoorstel lezen en de onderliggende intentie begrijpen, zelfs wanneer de auteur geen standaardterminologie gebruikt. De onderzoekers testten elf verschillende versies van deze modellen om te zien welke het beste de vermeldingen van sociale determinanten in de subsidieaanvragen kon identificeren. Ze wilden weten of deze slimme modellen het beter konden doen dan de oude trefwoordmethoden, en of ze de rommelige realiteit van hoe wetenschappers daadwerkelijk over sociale problemen schrijven, konden aan.
De studie richtte zich op de secties "Public Health Relevance" in een dataset van meer dan 2.000 subsidieaanvragen uit het fiscale jaar 2023. De onderzoekers leerden een model eerst om vijf specifieke categorieën van sociale determinanten te herkennen: economische stabiliteit, toegang tot onderwijs, toegang tot gezondheidszorg, omgevingsfactoren in de buurt en de sociale gemeenschapscontext. Dit deden ze door menselijke experts een deel van de tekst zorgvuldig te laten labelen, waardoor een reeks juiste antwoorden ontstond waar het model van kon leren. Vervolgens testten ze de modellen om te zien hoe goed ze deze categorieën in de resterende tekst konden vinden. De uitdaging was aanzienlijk omdat de meeste subsidies deze sociale factoren helemaal niet vermelden, en wanneer ze dat wel doen, zijn de vermeldingen vaak zeldzaam en diep in de tekst begraven.
De resultaten onthulden een verrassende waarheid over hoe deze systemen van kunstmatige intelligentie werken. De onderzoekers ontdekten dat kleinere modellen die specifiek waren afgestemd (fine-tuned) op de downstream-taak de enorme, algemene modellen die de krantenkoppen domineren, overtroffen, en dat ModernBERT-base in het bijzonder de hoogste performance behaalde wanneer het direct werd getraind op de classificatietaak van het onderzoek. Het identificeerde de sociale factoren in de tekst vaker correct dan de grootste modellen, die duizenden malen groter waren en vertrouwden op hun algemene kennis om de antwoorden te raden. De kleinere modellen waren ook stabieler en consistenter, terwijl de grotere modellen soms moeite hadden met het leren van de specifieke regels van de taak.
De studie onthulde echter ook een cruciale les over hoe deze hulpmiddelen te gebruiken. De onderzoekers ontdekten dat het simpelweg trainen van het model niet genoeg was; ze moesten ook aanpassen hoe het model haar uiteindelijke beslissingen nam. Omdat de sociale factoren zo zelden in de tekst voorkwamen, had het model de neiging om ze te negeren, uitgaande van de aanname dat ze er niet waren. Door de gevoeligheid van het model voor elke specifieke categorie aan te passen, slaagden de onderzoekers erin een enorme hoeveelheid gemiste informatie terug te winnen. Deze aanpassing veranderde een systeem dat nauwelijks functioneerde in een systeem dat met hoge performance presteerde. Zonder deze stap zouden zelfs de meest geavanceerde modellen gefaald hebben in het vastleggen van de gegevens die ze ontworpen waren om te vinden.
Wanneer de onderzoekers nauwkeurig naar de verschillende soorten sociale factoren keken, ontdekten ze dat de modellen anders reageerden afhankelijk van de categorie. Voor duidelijke, goed gedefinieerde onderwerpen zoals economische stabiliteit of omgevingsfactoren in de buurt, waren de kleinere, gespecialiseerde modellen uitstekend. Ze konden deze factoren met hoge precisie opsporen. Maar voor meer vage en complexe onderwerpen, zoals de sociale en gemeenschapscontext, toonden de grotere, algemene modellen een voordeel. Deze onderwerpen worden vaak op subtiele manieren beschreven die een brede kennis van menselijke relaties en de samenleving vereisen, een kracht die de enorme modellen bezaten. Dit suggereert dat hoewel kleinere modellen over het algemeen beter en efficiënter zijn, de grootste modellen nog steeds een uniek vermogen hebben om de meest abstracte sociale concepten te begrijpen.
De implicaties van dit werk zijn aanzienlijk voor hoe wetenschap wordt gefinancierd en begrepen. De onderzoekers hebben aangetoond dat het mogelijk is om een systeem te bouwen dat decennia aan subsidiegegevens kan scannen om precies te zien welke sociale problemen worden bestudeerd en welke worden genegeerd. Ze lieten zien dat dit kan met relatief kleine, efficiënte computers die geen dure, enorme hardware of geheime, propriëtaire software vereisen. Dit maakt het voor functionarissen op het gebied van de volksgezondheid en onderzoekers mogelijk om financieringstrends in realtime te volgen, zodat geld naar de gebieden kan worden geleid waar het het hardst nodig is. Door deze instrumenten te gebruiken, kunnen instanties eindelijk het volledige landschap van hun onderzoeksbeleggingen in kaart brengen, waarbij ze blinde vlekken identificeren waar sociale determinanten ondergefinancierd zijn en toekomstige beslissingen sturen om een rechtvaardiger gezondheidszorgsysteem te creëren.
De studie benadrukte ook een hardnekkige kloof in het huidige onderzoekslandschap. Zelfs met de beste beschikbare hulpmiddelen toonde de analyse aan dat bepaalde gebieden, met name toegang tot en kwaliteit van onderwijs, aanzienlijk ondervertegenwoordigd blijven in de subsidies die financiering ontvangen. Dit is niet slechts een datafout; het is een reflectie van waar de wetenschappelijke gemeenschap haar aandacht op heeft gericht. Wanneer een sociale factor consequent wordt over het hoofd gezien in onderzoeksvoorstellen, blijft de bewijslast die nodig is om dat probleem op te lossen, dun. Het vermogen om deze trends nauwkeurig in kaart te brengen betekent dat beleidsmakers deze hiaten nu duidelijk kunnen zien en geïnformeerde keuzes kunnen maken om de portefeuille van het onderzoek in evenwicht te brengen, zodat de drijfveren van gezondheidsverschillen met dezelfde strengheid worden aangepakt als de ziekten die zij veroorzaken.
Uiteindelijk biedt dit onderzoek een nieuwe lens om naar de machinerie van wetenschappelijke ontdekking te kijken. Het gaat verder dan eenvoudige woordtellingen om de werkelijke intentie van het voorgestelde onderzoek te begrijpen. Door de precisie van gespecialiseerde modellen te combineren met het brede begrip van grote modellen, en door deze systemen zorgvuldig aan te passen in hoe zij beslissingen nemen, hebben wetenschappers een krachtig instrument voor transparantie gecreëerd. Dit instrument telt niet alleen subsidies; het onthult de prioriteiten van de gezondheidsonderzoek van een natie, en biedt een helder pad naar een toekomst waarin financieringsbeslissingen worden gedreven door een volledige en nauwkeurige kennis van de sociale krachten die onze gezondheid vormen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.