Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts
Deze studie toont aan dat deep-learning genomische orakels er niet in slagen om sequentie-effecten te generaliseren over verschillende gastheercontexten, aangezien hun voorspellingen voor de activiteit van regulatoire elementen sterk afhankelijk zijn van de specifieke genomische locatie en niet betrouwbaar kunnen worden voorspeld door enkel op sequentiekenmerken gebaseerd te zijn.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het uitgestrekte landschap van het menselijk genoom fungeren bepaalde stukken DNA als schakelaars, die genen aan- of uitzetten om te controleren hoe cellen functioneren. Wetenschappers proberen al lang de precieze code te begrijpen die deze schakelaars vertelt waar ze moeten werken en wanneer ze geactiveerd moeten worden. In de afgelopen jaren zijn krachtige computerprogramma's opgekomen om te helpen deze taal te ontcijferen. Deze programma's, vaak "genomische orakels" genoemd, kunnen naar een reeks DNA-letters kijken en voorspellen hoe deze zich in een levende cel zal gedragen, waarbij ze inschatten of het zal openen om genactiviteit toe te laten of gesloten zal blijven. Omdat deze digitale instrumenten snel en goedkoop zijn in vergelijking met laboratoriumexperimenten, gebruiken onderzoekers ze steeds vaker om nieuwe DNA-sequenties te ontwerpen, in de hoop aangepaste schakelaars te creëren die precies werken zoals bedoeld. De onderliggende hoop is dat als een computerprogramma zegt dat een specifieke DNA-sequentie een goede schakelaar is in één deel van het genoom, deze ook een goede schakelaar blijft als deze naar een andere locatie wordt verplaatst.
Een nieuwe studie daagt deze fundamentele aanname uit door te testen of deze digitale voorspellingen standhouden wanneer dezelfde DNA-sequentie in verschillende buurten van het genoom wordt geplaatst. De onderzoekers richtten zich op multiple sclerose, een ziekte waarbij het immuunsysteem het zenuwstelsel aanvalt, en keken naar de specifieke genetische regio's die de kans op het ontwikkelen van de aandoening vergroten. Ze gebruikten een kunstmatige intelligentie-model om duizenden kandidaat-DNA-sequenties te genereren die eruit zagen alsof ze als regulatoire schakelaars in immuuncellen zouden kunnen functioneren. Vervolgens gebruikten ze een genomisch orakel om deze kandidaten te scoren, waarbij ze de kandidaten selecteerden die de computer als het meest actief voorspelde. Het team voerde vervolgens een rigoureuze test uit: ze namen exact dezelfde geselecteerde sequenties en plaatsten deze in vierentwintig verschillende locaties binnen het genoom om te zien of de voorspelling van de computer consistent bleef.
De resultaten onthulden een verbijsterend gebrek aan consistentie. Hoewel het computerprogramma sequenties goed kon rangschikken binnen één enkele locatie, faalden zijn voorspellingen in generalisatie wanneer de sequenties werden verplaatst. Het effect van een specifieke verandering in de DNA-sequentie was geen vaste eigenschap van de sequentie zelf; in plaats daarvan hing het er volledig vanaf waar in het genoom de sequentie zich bevond. In sommige locaties maakte een specifieke aanpassing aan het DNA de sequentie actiever, terwijl in andere locaties precies dezelfde aanpassing de sequentie minder actief maakte of geen effect had. De onderzoekers ontdekten dat het gedrag van de sequentie zo afhankelijk was van de omgeving dat de variatie tussen verschillende locaties enorm was, waarbij het effect in bijna de helft van de geteste locaties van richting veranderde.
Om te begrijpen wat de computer eigenlijk "zag", voerde het team directe interventies uit op de DNA-sequenties. Ze testten of de voorkeur van de computer werd gedreven door de aanwezigheid van specifieke bindingsplaatsen voor eiwitten die genen controleren, of door de dichtheid van deze plaatsen. Het antwoord was nee; het verwijderen van deze plaatsen of het veranderen van hun aantal veranderde de score van de computer niet op een voorspelbare manier. In plaats daarvan was de factor die er echt toe deed de inhoud van een specifieke chemische structuur genaamd CpG, wat een koppeling van twee DNA-letters betreft. Echter, zelfs deze factor trad niet alleen op. Het verhogen van de hoeveelheid van deze structuur in het DNA verbeterde de score in sommige genomische locaties, maar verslechterde de score in andere. De richting van het effect werd bepaald door de gastlocatie, en niet door de aanpassing zelf.
De studie testte ook of een tweede, onafhankelijk getraind computerprogramma dezelfde resultaten zou produceren. Dit nieuwe model, gebouwd met een andere architectuur en getraind op andere gegevens, bevestigde de belangrijkste bevinding: het effect van de DNA-aanpassing was zeer instabiel en varieerde sterk afhankelijk van de genomische locatie. De twee programma's waren echter niet het eens over exact welke locaties een positief of negatief effect zouden vertonen, wat suggereert dat hoewel de instabiliteit een echt fenomeen is, de specifieke details van hoe een model een locatie interpreteert uniek zijn voor dat model.
Misschien wel het meest cruciaal was dat de onderzoekers controleerden of de door de computer geselecteerde sequenties ook echt beter werkten in een experiment in de echte wereld. Ze vergeleken de scores van de computer met de gemeten activiteit uit een grootschalige laboratoriumassay die duizenden DNA-elementen omvatte. De selectiecriteria van de computer slaagden er niet in te voorspellen welke sequenties werkelijk actief waren in de cellen. Sterker nog, de sequenties die de computer als de beste presteerders beoordeelde, vertoonden vaak het tegenovergestelde gedrag in het laboratorium, waarbij de meest specifieke en actieve elementen de laagste scores van het orakel ontvingen. Deze discrepantie suggereert dat het specifieke doel waar de computer voor optimaliseert, de werkelijke biologische activiteit van het DNA niet weerspiegelt.
De onderzoekers ontdekten ook dat een veel eenvoudigere wiskundige methode, gebaseerd op het tellen van patronen van letters in het DNA, net zo goede sequenties kon genereren als de complexe, deep-learning kunstmatige intelligentiemodellen. Deze eenvoudige methode, die geen krachtige computers vereist en binnen seconden kan worden aangepast, kwam op elke geteste maatstaf overeen met de prestaties van de geavanceerde neurale netwerken. Deze bevinding impliceert dat de complexiteit van de deep-learningmodellen niet noodzakelijk was om de essentiële patronen van de DNA-sequenties in deze context te vatten.
Uiteindelijk concludeert de studie dat een effect op sequentieniveau dat wordt geleerd of gemeten door een genomisch orakel, geen eigenschap is van de sequentie alleen. Het is een eigenschap van de sequentie in combinatie met de specifieke genomische context waarin deze zich bevindt. Deze afhankelijkheid van locatie is niet voorspelbaar vanuit eenvoudige, goedkope kenmerken van het omliggende DNA. Voor wetenschappers die nieuwe genetische elementen ontwerpen, betekent dit dat een ontwerp dat op één locatie in een computersimulatie is gekozen en gevalideerd, geen enkele garantie biedt over hoe het zich zal gedragen zodien het naar een andere locatie wordt verplaatst of ingevoegd. De bevindingen dienen als een waarschuwing dat deze krachtige digitale instrumenten, hoewel nuttig, nog niet kunnen worden vertrouwd om het gedrag van ontworpen sequenties over het diverse landschap van het menselijk genoom te voorspellen zonder directe experimentele verificatie op meerdere locaties.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.