Pretrained gene representations transfer mean expression more broadly than spatial patterns in virtual spatial transcriptomics
Deze studie toont aan dat in virtuele ruimtelijke transcriptomica voorgetrainde genrepresentaties primair de voorspelling van de gemiddelde genexpressie over weefsels verbeteren in plaats van de ruimtelijke variatie, wat onthult dat cross-gen generalisatie meer wordt gedreven door brede expressieoverdracht dan door het herstel van specifieke ruimtelijke patronen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je een stad voor waar elk gebouw een geheime bibliotheek herbergt, en binnenin elke bibliotheek liggen duizenden boeken open op verschillende pagina's. In het menselijk lichaam zijn deze gebouwen cellen, en de boeken zijn genen. Decennialang hebben wetenschappers kunnen lezen welke boeken er openliggen in een enkele cel, maar ze hadden moeite om te zien waar die cellen zich bevinden binnen de complexe weefsels van een orgaan. Om een volledige kaart van genactiviteit te krijgen, moeten onderzoekers traditioneel een fysiek weefselsnede nemen en daar dure, tijdrovende tests op uitvoeren. Dit beperkt hoeveel van het lichaam ze tegelijkertijd kunnen bestuderen. Een nieuwere aanpak, genaamd virtuele ruimtelijke transcriptomica, probeert dit op te lossen door gebruik te maken van kunstmatige intelligentie. In plaats van voor elk gen een nieuwe test uit te voeren, kijkt de computer naar een standaardfoto van het weefsel en voorspelt welke genen actief zijn en waar. De hoop is dat, door de computer te leren patronen in de weefselafbeelding te herkennen, deze de locatie van genen kan raden die hij nog nooit eerder heeft gezien, waardoor de kaart effectief wordt uitgebreid naar nieuwe gebieden zonder nieuw laboratoriumwerk.
De kernvraag die onderzoekers stelden, was of deze computermodellen werkelijk de complexe, verschuivende patronen van genactiviteit over een weefsel heen leren begrijpen, of dat ze simpelweg heel goed zijn geworden in het raden van de gemiddelde hoeveelheid van een gen die aanwezig is. Wanneer een model de locatie van een gen voorspelt, doet het twee dingen tegelijk: het schat het algemene niveau van dat gen in het weefsel in, en het bepaalt hoe dat niveau van de ene plek naar de andere verandert. Een model zou succesvol kunnen lijken door simpelweg de gemiddelde waarde aan elke locatie toe te wijzen, wat zou lijken op een goede voorspelling van de totale hoeveelheid, maar zou falen in het vastleggen van de ingewikkelde details van waar het gen daadwerkelijk geconcentreerd is. Om de waarheid te achterhalen, bouwden de onderzoekers een systeem dat deze twee vermogens van elkaar kon scheiden. Ze testten de modellen op genen die de computer nog nooit tijdens zijn training had gezien, waarbij ze vroegen of het model nog steeds het gemiddelde niveau van het gen en zijn specifieke ruimtelijke patroon in nieuwe patiënten kon voorspellen.
De onderzoekers testten hun ideeën op vier verschillende groepen menselijke weefselmonsters, waaronder drie verschillende regio's van de hersenen en een type borstkanker. Ze trainden hun modellen op een grote set genen en daagden ze vervolgens uit om het gedrag van honderden genen te voorspellen die volledig nieuw waren voor het systeem. Ze gebruikten twee verschillende soorten vooraf getrainde gen-representaties, wat in essentie digitale samenvattingen zijn van de identiteit van een gen, afgeleid uit enorme hoeveelheden biologische data. Eén type samenvatting komt voort uit de DNA-sequentie rondom het gen, terwijl de andere komt uit hoe het gen zich gedraagt in enkelvoudige cellen. Wanneer de modellen de nieuwe genen probeerden te voorspellen, lieten de resultaten een duidelijke splitsing in prestaties zien. De modellen waren opmerkelijk succesvol in het voorspellen van het gemiddelde expressieniveau van deze ongeziene genen. Sterker nog, wanneer de modellen hun algehele nauwkeurigheid verbeterden, kwam meer dan 90 procent van die verbetering simpelweg voort uit het correct voorspellen van de gemiddelde hoeveelheid van het gen.
De mogelijkheid om de specifieke ruimtelijke patronen te herstellen — het "waar" van de genactiviteit — was echter veel beperkter. De onderzoekers ontdekten dat de modellen alleen hun ruimtelijke voorspellingen verbeterden voor genen die al een hoge variatie vertoonden in de trainingsdata. Voor de meeste genen kon de computer je wel vertellen hoeveel van het gen er gemiddeld aanwezig was, maar kon het niet betrouwbaar aangeven waar dat gen in het weefsel geconcentreerd was. Om te bewijzen dat de modellen de weefselafbeeldingen niet daadwerkelijk gebruikten om deze patronen te vinden, voerden de onderzoekers een tweede test uit. Ze bouwden een vereenvoudigde versie van het model die alleen naar de digitale samenvatting van het gen keek en de weefselfoto volledig negeerde. Verrassend genoeg behield dit beeldvrije model bijna alle verbetering in het voorspellen van de gemiddelde genniveaus die het volledige model had bereikt. Dit toonde aan dat de vooraf getrainde gen-samenvattingen de informatie over het gemiddelde niveau van het gen met zich meedroegen, maar dat de weefselafbeeldingen niet veel nieuwe informatie toevoegden over de specifieke locatie van deze nieuwe doelwitten.
De studie onthulde ook dat het type gen-representatie ertoe deed voor de ruimtelijke patronen. Hoewel beide soorten samenvattingen hielpen bij het voorspellen van de gemiddelde niveaus, verschilden ze in welke specifieke genen de ruimtelijke nauwkeurigheid verbeterden. Sommige genen profiteerden van het ene type samenvatting, terwijl andere profiteerden van het andere. Dit suggereert dat het vermogen om kennis van bekende genen over te dragen naar nieuwe genen geen enkele, uniforme vaardigheid is. In plaats daarvan is het een combinatie van twee afzonderlijke vermogens: een brede vaardigheid om in te schatten hoeveel van een gen aanwezig is, en een selectieve, moeilijke vaardigheid om de precieze locatie ervan in kaart te brengen. De onderzoekers concludeerden dat hoewel deze virtuele instrumenten krachtig zijn voor het uitbreiden van de lijst met genen die we kunnen bestuderen, ze nog niet volledig in staat zijn om de complexe ruimtelijke architectuur van het weefsel voor elk gen vast te leggen. Het succes van deze modellen in het voorspellen van gemiddelde niveaus is een belangrijke stap voorwaarts, maar de uitdaging om de gedetailleerde ruimtelijke patronen van nieuwe genen nauwkeurig te reconstrueren blijft een werk in uitvoering.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.