Cryptic binding sites are detected but not ranked: coverage, conversion, and detector consensus
Dit artikel toont aan dat de detectie van cryptische bindingsplaatsen momenteel niet wordt beperkt door het vermogen om kandidaten voor te stellen, maar door gebrekkige rangschikking en een gebrek aan consensus, waarbij wordt onthuld dat het scheiden van dekking van conversiemetrieken significante prestatiekloven blootlegt en aantoont dat het combineren van geometrische en op taalmodellen gebaseerde detectoren binnen een strikt kandidaatatbudget de meest praktische verbeteringen oplevert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Eiwitten zijn de moleculaire machines die het leven draaiende houden, waarbij ze zichzelf vouwen in complexe driedimensionale vormen om specifieke taken uit te voeren. Vaak bevatten deze vormen kleine holtes of zakjes waar andere moleculen, zoals potentiële medicijnen, aan kunnen hechten. Decennialang hebben wetenschappers geprobeerd te voorspellen waar deze zakjes zich op een eiwit bevinden. Veel van de meest interessante zakjes zijn echter "cryptisch", wat betekent dat ze verborgen of gesloten zijn wanneer het eiwit stilzit. Deze locaties gaan pas open wanneer een molecuul aan hen bindt of wanneer het eiwit beweegt door natuurlijke warmte. Het vinden van deze verborgen locaties is cruciaal omdat ze vaak nieuwe mogelijkheden bieden voor de behandeling van ziekten, maar ze zijn berucht moeilijk te ontdekken omdat het eiwit er solide en glad uitziet tot het moment dat het met een medicijn interageert.
Jarenlang heeft het vakgebied van de eiwitwetenschap succes gemeten aan de hand van één enkele, eenvoudige metriek: hoe vaak een computerprogramma de juiste zak vindt binnen zijn top vijf suggesties. Deze benadering verbergt echter een kritiek gebrek. Het behandelt twee volkomen verschillende vaardigheden alsof het dezelfde zijn: het vermogen om daadwerkelijk een verborgen zak te vinden, en het vermogen om die vondst hoog genoeg te rangschikken om opgemerkt te worden. Een programma kan uitstekend zijn in het opsporen van een verborgen locatie, maar erg slecht in het beseffen dat deze belangrijk is, waardoor het juiste antwoord diep in een lange lijst met suggesties wordt begraven. Omgekeerd kan een ander programma de locatie zelden vinden, maar toevallig zijn weinige gokken perfect rangschikken. Tot nu toe zijn deze verschillende vaardigheden met elkaar verward, waardoor het moeilijk is om te weten welke hulpmiddelen echt verbeteren en waar de echte uitdagingen liggen.
Een recente studie door Clayton W. Moore aan de Texas A&M University ontrafelt deze twee vaardigheden door naar de volledige lijst met suggesties van vier verschillende computerprogramma's te kijken, in plaats van alleen naar de top vijf. De onderzoekers testten deze tools op een standaardset van 178 eiwitstructuren die bekend staan om hun verborgen bindingsplaatsen. Ze ontdekten dat de programma's eigenlijk best goed waren in het vinden van de locaties; het hoofpprobleem was simpelweg dat ze vaak niet in staat waren om die bevindingen bovenaan de lijst te plaatsen. Een ouder, op geometrie gebaseerd hulpmiddel uit 2009 slaagde erin een correcte kandidaat voor te stellen voor 74,2 procent van de eiwitten, de hoogste ratio van alle geteste tools. Toch, omdat het zijn bevindingen slecht rangschikte, bracht het slechts in 43,8 procent van de gevallen een correct antwoord naar voren in de top vijf. In contrast hiermee vond een nieuwer hulpmiddel uit 2018 minder locaties in totaal, maar rangschikte deze zo goed dat het in 63,5 procent van de gevallen een correct antwoord naar voren bracht. De studie laat zien dat de kloof tussen het vinden van een locatie en het correct rangschikken ervan enorm is, waarbij de "conversie"-ratio — hoeveel gevonden locaties de top vijf bereiken — sterk varieert van 59 procent tot 96 procent tussen de verschillende tools.
De onderzoekers ontdekten ook dat de verborgen locaties niet zo ongrijpbaar zijn als voorheen werd gedacht. Wanneer zij de suggesties van alle vier de tools combineerden, vonden zij dat 92,1 procent van de cryptische locaties door ten minste één van hen werd gedetecteerd. Dit betekent dat slechts een fractie van deze locaties werkelijk onzichtbaar is voor de huidige technologie. De echte flessenhals is niet het vinden van meer zakjes, maar het sorteren ervan. Als de tools de bestaande bevindingen simpelweg perfect zouden kunnen rangschikken, zou het succespercentage aanzienlijk stijgen zonder dat er nieuwe locaties ontdekt hoeven te worden. De studie suggereert dat het potentieel voor verbetering in het vakgebied vooral ligt in het beter rangschikken en combineren van de sterke punten van verschillende tools, in plaats van in het uitvinden van geheel nieuwe manieren om zakjes te detecteren.
Het combineren van tools is echter geen magische oplossing. De studie toonde aan dat er een limiet is aan hoeveel suggesties een onderzoeker redelijkerwijs kan beoordelen. Als een gebruiker bereid is om minder dan ongeveer vijftien suggesties per eiwit te bekijken, biedt het combineren van meerdere tools weinig voordeel ten opzichte van het gebruik van de beste enkele tool. De extra inspanning om meer kandidaten te controleren betaalt zich pas uit wanneer de lijst lang genoeg is om de locaties te vangen die de beste enkele tool heeft gemist. Dit verklaart waarom sommige eerdere pogingen om detectie te verbeteren door enorme aantallen kandidaten te genereren, geen betere resultaten lieten zien; ze voegden te veel kwalitatief slechte gokken toe die de nuttige verdunnen.
Het artikel biedt een praktisch pad vooruit door te laten zien hoe men een beperkt aantal gokken wijzer kan besteden. In plaats van uitsluitend te vertrouwen op de vorm van het eiwit, die vaak een verborgen zak niet ziet, testten de onderzoekers het toevoegen van suggesties op basis van de genetische sequentie van het eiwit. Door een taalmodel dat getraind is op eiwitsequenties te gebruiken om te voorspellen waar een zakje zou kunnen openen, konden zij kandidaten voorstellen in gebieden waar de vorm plat en oninteressant leek. Deze aanpak verbeterde het succespercentage met 8,5 procent op de testdata. Bemerkenswaardig genoeg maakte het gebruik van deze sequentiegebaseerde hint een kleine groep van vijf eiwitvormen even effectief als een veel grotere groep van twintig vormen, waardoor de benodigde rekentijd met twee derde werd verkort. De studie concludeert dat de toekomst van het vinden van deze verborgen locaties minder afhangt van het vinden van meer kandidaten en meer van slimmere manieren om de kandidaten die we al hebben te rangschikken, zodat de beste gokken ook daadwerkelijk worden gezien.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.