A strategy for ionic current analysis of nanopore protein readouts
Dit artikel presenteert een geïntegreerde computationele strategie voor het analyseren van nanopore eiwit-ionenstroomsignalen die ruisonderdrukking, segmentatie en machine learning-technieken combineert om een hoge nauwkeurigheid te bereiken in lading-gebaseerde binaire classificatie en om peptide-translocatie te modelleren, ondanks de uitdagingen bij het onderscheiden van alle 20 aminozuren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Eiwitten zijn de werkpaarden van het leven en voeren de overgrote meerderheid van de taken uit die ons lichaam functioneel houden. Hoewel onze genetische code de blauwdruk levert voor het bouwen van deze moleculen, is het eindproduct vaak complexer dan de instructies doen vermoeden. Eiwitten kunnen na hun vorming chemisch worden aangepast, worden gevouwen in ingewikkelde driedimensionale vormen, of op verschillende manieren worden gecombineerd om een duizelingwekkende reeks verschillende vormen te creëren. Om gezondheid en ziekte echt te begrijpen, moeten wetenschappers deze individuele eiwitmoleculen direct kunnen lezen, in plaats van alleen hun bestaan af te leiden uit genetische gegevens. Decennialang heeft een technologie genaamd nanopore-sequencing onderzoekers in staat gesteld om DNA en RNA met hoge precisie te lezen door ze door een microscopisch klein gaatje te laten trekken. Het toepassen van dezezelfde techniek op eiwitten is echter veel moeilijker gebleken. In tegen tegenstelling tot het vierletterige alfabet van DNA, zijn eiwitten opgebouwd uit twintig verschillende bouwstenen die aminozuren worden genoemd, elk met unieke fysieke eigenschappen. Bovendien zijn eiwitten vaak gevouwen en dragen ze een ongelijkmatige elektrische lading, wat een verstrengeld signaal creëert dat moeilijk te ontwarren is.
Een team van onderzoekers heeft nu een nieuwe computationele strategie ontwikkeld om de elektrische signalen te begrijpen die worden gegenereerd wanneer eiwitten door een nanopore passeren. Hun werk richt zich op een specifieke methode waarbij een moleculaire motor, die fungeert als een kleine motor, een eiwitstreng stap voor stap door de pore trekt. Terwijl het eiwit beweegt, verstoort het de elektrische stroom op een manier die afhangt van welke aminozuren zich op dat moment in het gat bevinden. De uitdaging ligt in het decoderen van deze ruisende, fluctuerende stroom om de sequentie van aminozuren te identificeren. De onderzoekers hebben een pijplijn ontwikkeld om de ruwe gegevens op te schonen, deze in betekenisvolle stukken op te delen en vervolgens computermodellen te gebruiken om de specifieke aminozuren te identificeren die verantwoordelijk zijn voor het signaal. Ze ontdekten dat hoewel het onderscheiden van elk afzonderlijk aminozuur een moeilijke taak blijft, de methode zeer effectief is in het onderscheiden van groepen aminozuren op basis van hun elektrische lading.
De studie begon met een reeks synthetische eiwitstranden die specifiek zijn ontworft om deze technologie te testen. Deze strengen zijn zo ontworogen dat ze herhalende secties bevatten, waarbij elke sectie in het midden één enkel, uniek aminozuur bevat, gescheiden door markeringen die een duidelijke dip in het elektrische signaal creëren. Dit ontwerp stelde de onderzoekers in staat om het signaal van individuele aminozuren te isoleren. Eerst moesten ze de ruwe elektrische gegevens opschonen, die vol zaten met willekeurige ruis die het ware biologische signaal kon verbergen. Ze gebruikten een proces met meerdere stappen om deze artefacten te verwijderen, terwijl de scherpe overgangen die de beweging van het eiwit markeren, behouden bleven. Zodra de gegevens schoon waren, moesten ze achterhalen waar het signaal van het ene aminozuur eindigde en het volgende begon. Ze testten twee verschillende wiskundige benaderingen om deze grenzen te vinden. De ene methode detecteerde automatisch veranderingen in het signaal, terwijl de andere de gegevens in een vast aantal segmenten dwong om consistentie te garanderen. Beide methoden leverden betrouwbare resultaten op en verdeelden de reis van het eiwit in ongeveer vijfendertig afzonderlijke stappen, een aantal dat overeenkomt met de bekende snelheid van de moleculaire motor die het eiwit erdoorheen trekt.
Nadat de signalen waren gesegmenteerd, richtten de onderzoekers zich op de taak van identificatie. Ze gebruikten twee verschillende soorten computermodellen om de elektrische patronen te analyseren. De eerste benadering hield in dat een deep learning-netwerk werd getraind om statistische kenmerken binnen elk segment te herkennen, zoals de gemiddelde stroom, het bereik van fluctuaties en de vorm van de signaalcurve. Wanneer het model werd gevraagd om alle twintig aminozuren tegelijk te identificeren, ondervond het problemen en behaalde een nauwkeurigheid van slechts ongeveer eenentwintig procent. Dit resultaat suggereert dat de elektrische handtekeningen van veel aminozuren te vergelijkbaar zijn om te onderscheiden wanneer alle twintig met elkaar concurreren. De methode presteerde echter veel beter wanneer het werd gevraagd om te kiezen tussen slechts twee aminozuren tegelijk. In deze directe vergelijkingen steeg de gemiddelde nauwkeurigheid naar ongeveer vijfenzeventig procent. Bepaalde aminozuren, met name die met een negatieve elektrische lading, vielen duidelijk op, terwijl anderen met vergelijkbare fysieke eigenschappen, zoals grootte of een gebrek aan lading, vaak met elkaar werden verward.
De tweede benadering gebruikte een ander type model dat de beweging van het eiwit behandelt als een reeks stappen, vergelijkbaar met een verborgen kaart die de computer probeert te volgen. Dit model was bijzonder goed in het vastleggen van het algemene patroon van de reis van het eiwit, inclusief momenten waarop de motor misschien achteruit glijdt of pauzeert. Net als het deep learning-model blonk deze benadering uit in het onderscheiden van positief en negatief geladen aminozuren, waarbij een nauwkeurigheid van meer dan drieënnegentig procent werd behaald in binaire tests. Het presteerde ook goed bij het scheiden van aminozuren op basis van algemene grootte, hoewel het moeite had met de middelgrote groepen. De onderzoekers kwamen tot de conclusie dat de meest betrouwbare manier om deze eiwitten te lezen niet was om te proberen elke letter in de sequentie te benoemen, maar om ze te groeperen op basis van hun meest voor de hand liggende fysieke kenmerken. De elektrische lading van een aminozuur bleek het sterkste signaal te zijn, wat een duidelijk vingerafdruk creëerde dat de computer met een hoog vertrouwen kon herkennen.
De studie concludeert dat hoewel het lezen van een volledige eiwitsequentie vanaf nul nog geen opgelost probleem is, de technologie klaar is voor meer gerichte toepassingen. Het vermogen om betrouwbaar tussen geladen en ongeladen regio's te onderscheiden, of om specifieke mutaties te identificeren die de lading van een eiwit veranderen, biedt een praktisch pad voorwaarts. De onderzoekers suggereren dat toekomstige verbeteringen zullen komen van het gebruik van grotere datasets en het ontwerpen van eiwitstranden die aminozuren in meer gevarieerde contexten blootstellen. Voor nu biedt dit werk een solide fundament voor het begrijpen van hoe eiwitten met nanopores interageren. Het laat zien dat het zelfs met complexe, ruisige gegevens mogelijk is om betekenisvolle biologische informatie te extraheren door zorgvuldige signaalverwerking te combineren met slimme computationele modellen. De weg naar volledige eiwitsequencing is lang, maar deze strategie biedt een duidelijke, stap-voor-stap methode om door het elektrische landschap van het proteoom te navigeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.