Ancestral Sequences Cannot be Accurately Reconstructed via Interpolation in a Variational Autoencoder's Latent Space
Deze studie toont aan dat, ondanks het potentieel van variationele autoencoders om epistatische interacties te modelleren, hun inherente informatieverlies tijdens het decodeerproces voorkomt dat zij ancestrale sequenties nauwkeurig reconstrueren, aangezien zij consistent worden overtroffen door standaard likelihood-gebaseerde en parsimonie-methoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Diep in de geschiedenis van het leven draagt elk levend wezen een moleculair verslag van zijn voorouders. Wetenschappers proberen dit verslag al lang te lezen, een proces dat bekend staat als ancestrale sequentie-reconstructie. Stel je voor dat je probeert de exacte woorden te raden van een brief die door een overgrootouder is geschreven, gebaseerd op alleen de kopieën die door hun vele achterkleinkinderen worden bewaard. In de biologie zijn deze "letters" de ketens van aminozuren die de eiwitten vormen, de werkpaarden van elke cel. Decennialang hebben onderzoekers statistische modellen gebruikt om de ontbrekende woorden in te vullen, uitgaande van de veronderstelling dat elke letter in de keten onafhankelijk van de andere verandert, zoals een enkel woord in een zin dat wordt vervangen zonder de betekenis van het geheel te beïnvloeden. Deze aanpak is de standaardtool geweest voor het begrijpen van hoe eiwitten gedurende miljoens jaren zijn geëvolueerd.
De biologie is echter zelden zo eenvoudig. In werkelijkheid zijn de letters in een eiwitketen vaak van elkaar afhankelijk; het veranderen van één aminozuur is misschien alleen veilig als er in de buurt ook een specifieke verandering plaatsvindt. Deze complexe onderlinge afhankelijkheid, bekend als epistase, is moeilijk te vangen met traditionele statistische instrumenten. Onlangs heeft een nieuwe generatie kunstmatige intelligentie-tools, specifits een type deep learning-model genaamd een variational autoencoder, een ander pad geboden. Deze modellen zijn uitstekend in het vinden van verborgen patronen in enorme hoeveelheden data. Ze kunnen een lange eiwitsequentie comprimeren tot een compacte, wiskundige samenvatting, of "embedding", en vervolgens proberen de oorspronkelijke sequentie vanuit die samenvatting te reconstrueren. Omdat deze modellen direct van de data leren zonder te worden verteld de verbindingen tussen letters te negeren, hoopten veel wetenschappers dat ze het probleem van epistase konden oplossen en eeuwenoude eiwitten met ongekende nauwkeurigheid konden reconstrueren.
Een team van onderzoekers zette zich sch de hoop direct toe te testen. Ze bouwden een pijplijn die deze AI-modellen gebruikte om de sequenties van oude eiwitten te raden. Het idee was recht door zee: neem de moderne eiwitten die we vandaag de dag hebben, comprimeer ze tot deze wiskundige samenvattingen, en gebruik vervolgens de bekende stamboom van de eiwitten om te interpoleren, of te raden, hoe de samenvattingen van de oude voorouders eruit zagen. Zodra ze deze geraden samenvattingen hadden, zouden ze deze terugvoeren in de AI om de werkelijke aminozuursequenties te genereren. Als dit zou werken, zou dit betekenen dat deep learning de beperkingen van de traditionele statistiek zou kunnen omzeilen en de ware geschiedenis van eiwitten zou kunnen onthullen, zelfs wanneer die geschiedenissen gevormd waren door complexe interacties tussen verschillende delen van het molecuul.
De onderzoekers onderwierpen dit idee aan de test met behulp van computersimulaties. Ze creëerden duizenden nep-eiwitfamilies die in de loop van de tijd evolueerden, eerst volgens de eenvoudige, onafhankelijke regels die traditionele modellen veronderstellen, en daarna volgens complexe regels die de onderling afhankelijke veranderingen bevatten die in de natuur voorkomen. Ze probeerden vervolgens de voorouders van deze nepfamilies te reconstrueren met zowel de nieuwe AI-methode als de gevestigde statistische methoden. De resultaten waren duidelijk en consistent. In elk scenario, of de eiwitten nu simpel evolueerden of met complexe afhankelijkheden, de traditionele statistische methoden presteerden beter dan de AI-aanpak. Het deep learning-model slaagde er niet in om nauwkeurige ancestrale sequenties te produceren, zelfs niet in de situaties waar het juist voor ontworpen was.
De studie ging dieper om te begrijpen waarom de AI faalde. Het bleek dat het probleem niet was dat de AI de stamboomstructuur miste. Wanneer de onderzoekers naar de wiskundige samenvattingen keken, zagen ze dat de AI inderdaad had geleerd om de eiwitten op een manier te organiseren die hun evolutionaire relaties weerspiegelde. De fout lag in de reconstructiestap zelf. Het AI-model, in zijn inspanning om de data te comprimeren tot een kleine samenvatting, verloor onvermijdelijk enkele fijne details van de oorspronkelijke sequentie. Wanneer de onderzoekers probeerden de oude eiwitten vanuit deze samenvattingen te herbouwen, was de informatie te wazig. Het model kon geen sequentie genereren met genoeg precisie om overeen te komen met de ware geschiedenis. Zelfs toen de onderzoekers de omvang van de wiskundige samenvatting vergrootten om meer informatie te behouden, waren de winsten klein, en begon het model simpelweg de moderne eiwitten te memoriseren in plaats van de algemene regels van evolutie te leren.
De onderzoekers testten ook een geavanceerdere versie van de AI die expliciet tijdens de training werd onderwezen over de stamboom. Ze hoopten dat deze extra begeleiding zou helpen, maar het verbeterde de resultaten niet. De fundamentele flessenhals bleef hetzelfde: het proces van het comprimeren van de sequentie tot een samenvatting en het vervolgens weer uitbreiden ervan was te verlieslatend voor de delicate taak van het raden van het verleden. De studie concludeert dat hoewel deze AI-embeddings krachtige instrumenten zijn voor het visualiseren van eiwitfamilies en het voorspellen van hoe moderne eiwitten zich kunnen gedragen, ze nog niet klaar zijn om de gevestigde statistische methoden te vervangen bij het reconstrueren van het verleden. De hoop dat deep learning moeiteloos het probleem van complexe evolutionaire interacties zou oplossen, was in deze specifieke toepassing een doodlopende weg. De traditionele methoden, ondanks hun eenvoudigere aannames, blijven de meer betrouwbare manier om de moleculaire geschiedenis van het leven te lezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.