Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins
Het artikel introduceert MutFormer, een transformer-gebaseerd model dat self-attention en convolutionele lagen combineert om schadelijke missense-mutaties in menselijke eiwitten te voorspellen, waarbij het prestaties vergelijkbaar met of beter dan bestaande tools demonstreert door effectief zowel kortetermijn- als langetermijn sequentieafhankelijkheden te vangen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je voor dat je lichaam een enorme, bruisende stad is, gebouwd vanuit een gigantische instructiehandleiding. Deze handleiding, geschreven in een vierletterige code (A, C, T, G), vertelt je cellen hoe ze de machines moeten bouwen die jou in leven houden. Soms zit er in zo'n handleiding een enkele typefout. Meestal zijn deze typefouten onschadelijk, zoals een spelfout in een recept waarbij het gerecht nog steeds prima smaakt. Maar af en toe verandert een typefout een cruciaal ingrediënt, waardoor een heerlijke taart verandert in een baksteen. Deze "typefouten" in de delen van de handleiding die eiwitten bouwen, worden missense-mutaties genoemd. Wetenschappers proberen al lang digitale detectives te bouwen om de gevaarlijke typefouten van de onschadelijke te onderscheiden, maar dat is een lastige klus omdat de instructies zo complex en contextafhankelijk zijn.
Om het nieuwe instrument dat in dit artikel wordt beschreven te begrijpen, moet je twee dingen weten. Ten eerste zijn eiwitten lange ketens van bouwstenen die aminozuren worden genoemd. De volgorde van deze blokken bepaalt hoe het eiwit vouwt en wat het doet. Ten tweede is er in de wereld van computers een type kunstmatige intelligentie genaamd een "transformer". Je kent ze misschien als de hersenen achter slimme chatbots of vertaal-apps die begrijpen hoe woorden met elkaar samenhangen in een zin, zelfs als ze ver uit elkaar staan. Wetenschappers zijn onlangs begonnen met het gebruiken van deze "taal"-hersenen om de "taal" van de biologie te lezen, waarbij ze eiwitketens behandelen als zinnen en aminozuren als woorden. De grote vraag is: kan een computer die leerde menselijke taal te lezen, ook de taal van het leven goed genoeg leren lezen om te voorspellen welke genetische typefouten ziekte veroorzaken?
Maak kennis met MutFormer, een nieuwe digitale detective gecreëerd door onderzoekers Theodore T. Jiang, Li Fang en Kai Wang. Ze besloten een transformer-model te bouwen dat specifiek getraind is om de "grammatica" van eiwitten te begrijpen. In plaats van alleen naar een enkele mutatie in isolatie te kijken, leest MutFormer de volledige eiwitsequentie en let daarbij op hoe elk aminozuur met elk ander aminozuur interageert, zowel dichtbij als veraf.
De onderzoekers begonnen door MutFormer een uitgebreid lesplan aan te leren. Ze voerden het meer dan 128.000 menselijke eiwitsequenties, inclusief zowel de "correcte" versies als versies met veelvoorkomende, onschadelijke mutaties die in de algemene populatie worden gevonden. Zie dit als het laten zien van miljoenen zinnen aan de AI om de regels van de eiwitgrammatica te leren, zonder te zeggen welke "fout" zijn. Tijdens deze training leerde MutFormer ontbrekende of door elkaar gehusselde delen van de sequentie te voorspellen, waardoor het effectief de "syntaxis" van het leven leerde.
Zodra het model was voorgetraind, gaven de onderzoekers het een specifieke test: het identificeren van welke mutaties gevaarlijk zijn. Ze verfijnden MutFormer met een dataset van bekende ziekteverwekkende mutaties en onschadelijke mutaties. Ze experimenteerden met drie verschillende manieren om het model zijn taak te laten uitvoeren:
- Per residu: Het model vragen om elk enkel aminozuur in de keten te labelen als "veilig" of "onveilig".
- Enkele sequentie: Het model alleen het gemuteerde eiwit laten zien en vragen: "Is dit hele ding kapot?"
- Gepaarde sequentie: Het originele eiwit en de gemuteerde versie naast elkaar aan het model laten zien, en het vragen de twee te vergelijken en te beslissen of de verandering schadelijk is.
De resultaten waren duidelijk: de Gepaarde Sequentie-methode werkte het best. Het was alsof je de detective zowel het originele blauwdruk als de aangepaste versie gaf om het verschil te ontdekken.
Maar hier wordt MutFormer echt slim. De meeste eerdere AI-modellen voor deze taak gebruikten een vaste woordenlijst (aminozuurpatronen) die niet kon veranderen. MutFormer gebruikt echter een speciale truc waarbij convolutie-lagen worden gebruikt. Stel je deze voor als een set verstelbare lenzen die het model gebruikt om het eiwit te scannen. In plaats van te vertrouwen op een kant-en-klare woordenlijst, gebruikt MutFormer deze lenzen om tijdens de training zijn eigen vocabulaire van belangrijke patronen te leren. Het is alsof de detective niet alleen een woordenboek heeft uit het hoofd geleerd, maar heeft geleerd om het unieke handschrift en de stijl van het eiwit zelf te herkennen.
Toen de onderzoekers MutFormer testten tegen een menigte bestaande tools (de huidige "detectives" in het veld), hield hij stand. Op algemene datasets die sterk leken op de trainingsdata, presteerde MutFormer even goed als of zelfs beter dan de beste bestaande methoden. Zelfs op datasets die heel anders waren — specifiek kijkend naar mutaties in bepaalde genen waar het model weinig data van had gezien — slaagde het er nog steeds in om de prestaties van andere top-tools te evenaren.
Het artikel suggereert ook dat MutFormer niet simpelweg de uitspraken van andere tools herhaalt. Wanneer ze de voorspellingen van MutFormer vergeleken met een tool genaamd EVE, die vertrouwt op evolutionaire geschiedenis (kijken naar hoe soorten gedurende miljoenen jaren zijn veranderd), ontdekten ze dat de twee tools niet altijd het eens waren. Dit suggereert dat MutFormer andere aanwijzingen oppikt — specifweg de directe "grammatica" van de eiwitsequentie — die evolutionaire tools mogelijk missen.
De onderzoekers zijn voorzichtig om te vermelden dat hoewel MutFormer een sterke nieuwe speler is, het geen toverstaf is die alles oplost. Het model is getraind op een specifieke set gegevens en, net als elke student, kan het moeite hebben met vragen die het nog niet eerder heeft gezien. Ze wijzen er ook op dat het model momenteel voornamelijk leunt op de sequentie van letters en nog niet volledig 3D-vormen of andere biologische factoren zoals methylering incorporeert, wat het in de toekomst nog slimmer zou kunnen maken.
Kortom, MutFormer suggereert dat door eiwitten als een taal te behandelen en een geavanceerd "taalmodel" te gebruiken dat zijn eigen vocabulaire kan leren, we een fris en krachtig perspectief kunnen krijgen op welke genetische typefouten gevaarlijk zijn. Het is een veelbelovende stap naar het helpen van artsen en wetenschappers om de genetische varianten te prioriteren die de meeste aandacht nodig hebben, wat potentieel bestaande tools kan aanvullen om een duidelijker beeld van de menselijke gezondheid te geven. De code en modellen zijn nu beschikbaar voor anderen om te gebruiken en verder op voort te bouren, wat de deur opent voor meer experimenten om te zien hoe goed deze "taal van de natuur" ontcijferd kan worden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.