← Nieuwste papers
📊 statistics

Bayesian Variable Selection for High-Dimensional Predictors with Missing Psychometric Outcomes

Dit artikel introduceert SHIM, een nieuw Bayesiaans raamwerk dat hiërarchische horseshoe-shrinkage integreert met een behandeling van ontbrekende gegevens om gestructureerde variabele selectie uit te voeren voor hoogdimensionale predictoren en multivariate uitkomsten, waarbij de effectiviteit ervan wordt aangetoond door middel van simulaties en een toepassing op neuroimaging-data van de ziekte van Alzheimer.

Oorspronkelijke auteurs: Zongyue Teng, Shujie Ma, Timothy J. Hohman, Angela L. Jefferson, Panpan Zhang

Gepubliceerd 2026-09-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zongyue Teng, Shujie Ma, Timothy J. Hohman, Angela L. Jefferson, Panpan Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne studie van de menselijke geest zijn onderzoekers niet langer tevreden met het kijken naar een enkele aanwijzing. In plaats daarvan verzamelen ze tegelijkertijd een enorme hoeveelheid informatie: gedetailleerde kaarten van de hersenstructuur, metingen van de bloeddoorstroming, genetische markers en scores van tientallen geheugen- en denktesten. Deze benadering, bekend als multimodale research, biedt een rijker beeld van hoe biologie het gedrag vormgeeft. Deze overvloed aan gegevens creëert echter een aanzienlijke statistische puzzel. Wanneer wetenschappers proberen honderden of duizenden hersenmetingen te verbinden met een paar denkscores, kan het enorme aantal mogelijkheden de standaard wiskundige instrumenten overweldigen, wat leidt tot verwarring in plaats van helderheid. De zaak wordt verder bemoeilijkt door het feit dat mensen afspraken missen of bepaalde tests niet voltooien, waardoor er gaten in de gegevens ontstaan. Traditionele methoden worstelen met het opvullen van deze gaten zonder fouten te introduceren, en ze falen vaak in het herkennen dat hersenmetingen geen onafhankelijke feiten zijn, maar georganiseerd zijn in natuurlijke groepen, zoals regio's binnen de hersenen of typen biologische signalen.

Om dit op te lossen, heeft een team van onderzoekers een nieuw statistisch kader ontwikkeld genaamd SHIM. Denk aan dit kader als een zeer georganiseerd archiefsysteem dat ontworpen is om door een chaotische kamer met door elkaar gehusselde aanwijzingen te sorteren. De onderzoekers bouwden dit systeem om drie specifieke uitdagingen tegelijkertijd aan te pakken: de hiërarchische structuur van hersendata, het feit dat verschillende denktests met elkaar gerelateerd zijn, en de realiteit dat sommige testresultaten ontbreken. In hun werk testten ze deze nieuwe methode tegen oudere, gevestigde technieken met behulp van gesimuleerde data die de werkelijkheid nabootsten. De resultaten toonden aan dat SHIM veel beter was in het vinden van de ware verbanden tussen hersenregio's en denkvaardigheden, terwijl het valse alarm voorkwam. Het identificeerde succesvol welke specifieke hersengebieden er wel en niet toe deden, zelfs wanneer tot zestig procent van de testscores ontbrak. Bovendien bood de methode een manier om die ontbrekende scores op een statistisch verantwoorde wijze in te vullen, waardoor onderzoekers de volledige gegevens kunnen gebruiken voor toekomstige studies zonder de nuance van de oorspronkelijke metingen te verliezen.

De onderzoekers pasten dit nieuwe instrument toe op data van het Vanderbilt Memory and Aging Project, een langdurige studie naar oudere volwassenen die bedoeld is om te begrijpen hoe vasculaire gezondheid en hersenveroudering cognitieve achteruitgang beïnvloeden. In deze praktijktest onderzochten zij hoe twee verschillende soorten hersenimagerings — het meten van het volume van grijze stof en het meten van de bloeddoorstroming — gerelateerd waren aan twee afzonderlijke maar verbonden gebieden van het denken: episodisch geheugen en executieve functies. Episodisch geheugen houdt het herinneren van gebeurtenissen uit het verleden in, terwijl executieve functies vaardigheden omvatten zoals plannen en schakelen tussen taken. De analyse onthulde dat de nieuwe methode specifieke hersengebieden kon aanwijzen die verbonden zijn met deze vermogens. Zo identificeerde het een verband tussen het volume van de grijze stof in de linker parahippocampale gyrus en geheugenprestaties, en een link tussen de linker inferieure frontale gyrus en executieve functies. Opvallend genoeg vond de nieuwe methode de verbinding met executieve functies die oudere methoden misten, wat suggereert dat het gezamenlijk bekijken van geheugen en executieve functies, in plaats van ze afzonderlijk te behandelen, helpt om verborgen patronen in de data te onthullen.

De studie pakte ook een veelvoorkomend probleem in medisch onderzoek aan: ontbrekende gegevens. In het tweede deel van hun toepassing keken de onderzoekers naar een specifieke biomarker die wordt gevonden in cerebrospinale vloeistof, een substantie die de hersenen en het ruggenmerg omringt. Deze biomarker staat bekend als geassocieerd met de ziekte van Alzheimer, maar was bij meer dan de helft van de deelnemers ontbrekend. Met behulp van hun nieuwe kader genereerden de onderzoekers meerdere plausibele versies van de ontbrekende gegevens op basis van de patronen die zij observeerden in de hersenscans en andere beschikbare informatie. Wanneer zij deze ingevulde datasets gebruikten om de relatie tussen geheugen en de biomarker te analyseren, vonden zij een duidelijk, positief verband: hogere niveaus van de biomarker waren gekoppeld aan betere geheugenprestaties. Dit resultaat kwam overeen met gevestigde biologische kennis, terwijl een standaardanalyse die de ontbrekende deelnemers simpelweg negeerde, geen statistisch significant verband vond. De nieuwe aanpak herstelde niet alleen het signaal, maar deed dit ook met grotere precisie, wat aantoont dat het effectief met onvolledige gegevens kan omgaan zonder waardevolle deelnemers weg te gooien.

Het succes van dit kader rust op de manier waarop het de gegevens behandelt. In tegen tegenstelling tot oudere methoden die elke hersenmeting als een geïsoleerd feit kunnen behandelen, respecteert deze nieuwe aanpak de natuurlijke organisatie van de hersenen. Het begrijpt dat metingen uit dezelfde hersenregio gerelateerd zijn, en dat metingen van verschillende regio's binnen hetzelfde type beeldvorming ook gerelateerd zijn. Door deze metingen samen te groeperen, kan de methode profiteren van de kracht van gerelateerde datapunten om nauwkeurigere beslissingen te nemen over welke verbanden echt zijn. Het beschouwt de ontbrekende testscores ook niet als verloren informatie, maar als verborgen variabelen die afgeleid kunnen worden uit de rest van de gegevens. Dit stelt het model in staat om te leren van de gehele groep deelnemers, in plaats van alleen van de subset die elke enkele test heeft voltooid. De onderzoekers bevestigden via uitgebreide computersimulaties dat deze aanpak een balans vindt tussen sensitiviteit en nauwkeurigheid, wat betekent dat het de ware verbanden vindt zonder willekeurige ruis als significante bevindingen te markeren.

Hoewel de resultaten veelbelovend zijn, zijn de onderzoekers voorzichtig in het benoemen van de grenzen van hun werk. De methode vereist momenteel dat de hersenimagerings en andere achtergrondinformatie volledig beschikbaar zijn voor elke deelnemer, wat in de praktijk niet altijd het geval kan zijn. Het gaat er ook vanuit dat de ontbrekende gegevens ontbreken om redenen die niet gerelateerd zijn aan de niet-geobserveerde waarden zelf, een voorwaarde die, indien geschonden, de nauwkeurigheid van de resultaten zou kunnen beïnvloeden. Daarnaast is het kader momenteel ontworpen voor continue metingen, zoals scores op een schaal, en moet het mogelijk worden aangepast voor andere soorten gegevens, zoals ja-of-nee antwoorden. Ondanks deze beperkingen biedt de studie een robuust nieuw instrument voor neurowetenschappers en psychologen. Het biedt een manier om complexe, rommelige en onvolledige datasets begrijpelijk te maken, waardoor een chaotische verzameling hersenscans en testscores wordt omgezet in een samenhangend verhaal over hoe de verouderende hersenen functioneren. Door een betrouwbare manier te bieden om met ontbrekende gegevens om te gaan en de structuur van biologische informatie te respecteren, helpt dit kader onderzoekers om duidelijkere conclusies te trekken over de biologische wortels van het menselijk cognitief vermogen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →