Entropy-Driven Alignment-Free Phylogenetic Analysis via K-mer Encoding, DNA Physicochemical Properties, and Rough Set Feature Selection
Deze studie stelt een alignment-vrij fylogenetisch analyseframework voor dat k-mer statistieken integreert met DNA-fysisch-chemische eigenschappen en strengsymmetrie in een featurevector, die vervolgens wordt geoptimaliseerd met behulp van een verbeterde rough set-gebaseerde selectiemethode om efficiënte en interpreteerbare evolutionaire inferentie van het hele genoom te bereiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Om de geschiedenis van het leven te begrijpen, kijken wetenschappers vaak naar de moleculaire instructies die in elke levende cel zijn geschreven: de DNA-sequentie. Decennialang was de standaardmanier om deze instructies tussen verschillende soorten te vergelijken het naast elkaar leggen, letter voor letter, vergelijkbaar met het uitlijnen van twee lange paragrafen tekst om te zien waar ze overeenkomen en waar ze verschillen. Deze methode, bekend als multiple sequence alignment (meervoudige sequentie-uitlijning), werkt goed wanneer de sequenties kort en zeer vergelijkbaar zijn. Echter, naarmate de technologie is gevorderd, kunnen onderzoekers nu volledige genomen lezen, die miljoenen letters lang zijn. Wanneer deze enorme sequenties worden vergeleken, vooral bij organismen die hun genetisch materiaal hebben gehusseld of snel zijn geëvolueerd, wordt de traditionele uitlijndingsmethode traag, computationeel zwaar en soms zelfs onmogelijk accuraat uit te voeren. Dit heeft geleid tot de zoektocht naar "alignment-free" (uitlijning-vrije) methoden, die proberen evolutionaire relaties te vinden zonder de sequenties in een rigide rij te dwingen. In plaats van elke letter te matchen, kijken deze nieuwere benaderingen naar de algemene patronen en frequenties van kleine stukjes DNA om te achterhalen hoe nauw twee organismen aan elkaar verwant zijn.
In een recente studie stelde een team onderzoekers uit China een nieuwe manier voor om deze alignment-free technieken te verfijnen, zodat ze zowel sneller als nauwkeuriger worden. Ze erkenden dat hoewel veel bestaande methoden simpelweg tellen hoe vaak bepaalde korte DNA-patronen voorkomen, ze vaak twee cruciale stukken informatie missen: de specifieke chemische eigenschappen van de DNA-bouwstenen en de volgorde waarin die patronen verschijnen. Om dit op te lossen, ontwikkelden de onderzoekers een systeem dat een DNA-sequentie vertaalt naar een set van zeven verschillende "kaarten". Elke kaart belicht een andere fysieke eigenschap van het DNA, zoals of een letter deel uitmaakt van een sterke of zwakke chemische binding, of dat het tot een specifieke chemische familie behoort. Door de oorspronkelijke DNA-sequentie om te zetten in deze zeven verschillende binaire patronen, konden ze vervolgens de frequentie van korte, woordachtige segmenten binnen elke kaart tellen. Dit proces creëerde een gedetailleerd, meerlagig profiel van het genoom dat zowel de chemische aard van het DNA als de specifieke volgorde van de onderdelen behield.
Deze gedetailleerde profiel creëerde echter een enorme hoeveelheid data, bevattende duizenden potentiële patronen, waarvan er velen redundant of niet nuttig waren voor het bepalen van de evolutionaire geschiedenis. Om deze ruis weg te filteren, paste het team een wiskundige strategie toe die bekend staat als rough set theory (ruwe verzammingstheorie). Zie dit proces als een zeer efficiënt filter dat door een grote stapel aanwijzingen zoekt om alleen de aanwijzingen te vinden die daadwerkelijk helpen om onderscheid te maken tussen verschillende groepen. De onderzoekers testten dit filteringssysteem met behulp van een trainingsset van elf hantavirusstammen, een type virus dat in Oost-Azië wordt aangetroffen. Door te analyseren hoe goed verschillende patronen de virussen konden scheiden in hun bekende typen, identificeerde het systeem een specifieke set van 3.005 patronen uit de oorspronkelijke 14.336 mogelijkheden. Deze geselecteerde patronen vormden de kern "vingerafdruk" die werd gebruikt om de virussen te analyseren.
Het team onderwierp hun methode vervolgens aan een test op drie volkomen verschillende groepen virussen om te zien of het correct hun stambomen kon reconstrueren. Eerst analyseerden ze dertig-drie coronavirussen-genomen, inclusclusief de stammen die verantwoordelijk zijn voor SARS en de recentere SARS-CoV-2. De methode groepeerde de virussen succesvol in vier duidelijke takken die overeenkwamen met de bekende wetenschappelijke classificatie, waarbij de SARS-gerelateerde virussen duidelijk werden gescheiden van de anderen en zelfs onderscheid maakte tussen het oorspronkelijke SARS-virus en de nieuwere SARS-CoV-2. Vervolgens onderzochten ze negenendertig stammen van het Japans encefalitisvirus. Opnieuw sorteerde de methode de virussen correct in hun vier bekende genetische groepen, wat de resultaten weerspiegelde die werden verkregen met traditionele, veel tragere uitlijndingsmethoden. Ten slotte analyseerden ze vijfentwintig stammen van het H7N9-avian influenza virus. De resulterende boom toonde twee belangrijke lineages, één uit Noord-Amerika en één uit Eurazië, en groepeerde correct de virussen die in dezelfde geografische regio's en perioden waren geïsoleerd.
Gedurende al deze tests bewees de nieuwe aanpak opmerkelijk snel te zijn. Terwijl andere grafische methoden voor het analyseren van lange DNA-sequenties enkele minuten in beslag kunnen nemen, verwerkte deze methode de langste sequenties in de studie, die meer dan 31.000 letters lang waren, in slechts vier seconden. De onderzoekers merkten op dat hun aanpak de complexe en tijdrovende stap van het uitlijnen van sequenties niet vereist, maar toch de essentiële biologische signalen vastlegt die nodig zijn om accurate stambomen te bouwen. Hoewel de methode krachtig is, erkennen de auteurs dat het geen visueel beeld biedt van de verschillen tussen sequenties zoals sommige andere tools dat doen, en dat het complexe genetische herschikkingsevenementen niet expliciet modelleert. Desalniettemin laat de studie zien dat door chemische eigenschappen te combineren met slimme datafiltering, wetenschappers een instrument kunnen creëren dat zowel efficiënt als betrouwbaar is voor het traceren van de evolutionaire geschiedenis van virussen en andere organismen over volledige genomen heen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.