Additive-input encoding fails operator-level target-held-out prediction on current Perturb-seq screens
Deze studie toont aan dat additive-input coderingsmodellen die in huidige Perturb-seq schermen worden gebruikt, er niet in slagen te generaliseren naar nieuwe, uitgesloten perturbatiedoelen, wat onthult dat geïnferreerde regulatoire operatoren niet zijn gevalideerd voor het voorspellen van responsen op ongeziene genen, ondanks hun wiskundige identificeerbaarheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
Stel je een wereld voor waarin wetenschappers individuele genen in een cel kunnen uitschakelen en tegelijkertijd kunnen zien wat er gebeurt. Dat is de belofte van een technologie genaamd Perturb-seq. Door een moleculair hulpmiddel te gebruiken om specifieke genen te verzwijgen en vervolgens de volledige genetische respons van de cel af te lezen, hopen onderzoekers een kaart te bouwen van hoe genen met elkaar communiceren. Het uiteindelijke doel is om de verborgen regels van het leven te begrijpen: als je aan één draad trekt, welke andere draden trekken dan strak, en welke worden juist slap? Jarenlang was de standaardmanier om deze enorme experimenten te interpreteren de aanname dat de respons van de cel een eenvoudige som van onderdelen is. Het idee is dat als je Gen A uitzet, het een specifieke hoeveelheid verandering toevoegt; als je Gen B uitzet, voegt het een andere specifieke hoeveelheid toe. Als je beide uitzet, zou het resultaat simpelweg de som van die twee veranderingen moeten zijn. Dit "additieve" wereldbeeld is aantrekkelijk omdat het wiskundig helder en eenvoudig te berekenen is, waardoor wetenschappers een meestercontrolekaart van de interne bedrading van de cel kunnen afleiden.
Echter, een nieuwe studie van onderzoekers aan de Brigham Young University suggereert dat deze eenvoudige optelregel fundamenteel defect is wanneer deze wordt toegepast op echte biologische data. Het team, geleid door Kyler Fullmer, Dalton Kutzen en Tommy W. Terooatea, nam drie van de grootste en meest gerespecteerde gen-silencing experimenten ooit uitgevoerd en testte of het additieve model daadwerkelijk kon voorspellen wat er zou gebeuren met een gen dat de onderzoekers nog nooit eerder hadden gezien. Ze keken niet alleen naar de data; ze bouwden een rigoureuze testomgeving om te zien of het model kon generaliseren. Ze stelden een eenvoudige vraag: als een computer de regels van het spel leert van een set bekende genen, kan hij dan de uitkomst van een gloednieuw gen correct raden dat hij nog nooit eerder is tegengekomen?
Het antwoord, zo ontdekten zij, was een luid en duidelijk nee. Toen de onderzoekers probeerden het gedrag van onbekende genen te voorspellen met behulp van het additieve model, faalde het model volledig. Sterker nog, het model presteerde niet beter dan iemand die simpelweg gokte dat er helemaal niets zou veranderen. Om er zeker van te zijn dat deze mislukking niet slechts een toevalstreffer of het gevolg was van rommelige data, creëerde het team een perfecte simulatie. Ze genereerden nepdata waarbij de regels perfect additief waren, precies zoals de theorie beweert. Wanneer ze hun model op deze nepdata draaiden, werkte het prachtig en herstelden ze de verborgen regels met hoge nauwkeurigheid. Dit bewees dat hun testmethode solide was en dat de computer in staat was om te leren. Het probleem lag dus niet bij de wiskunde of de ruis in de data, maar bij de aanname dat echte cellen zich gedragen als eenvoudige sommen.
De onderzoekers testten dit op drie verschillende datasets: twee grote schermen met menselijke cellen die in een schaal werden gekweekt, en één die verschillende doses gen-silencing testte. In elk geval was de conclusie dat het model dat ervan uitgaat dat genen simpelweg hun effecten bij elkaar optellen, de uitkomst van een nieuw gen niet kon voorspellen. De foutmarge was zo hoog dat de voorspellingen van het model niet te onderscheiden waren van willekeurig gokken. Het team sloot verschillende redenen voor deze mislukking uit. Ze controleerden of het probleem werd veroorzaakt door het kiezen van de "makkelijkste" genen om te bestuderen, en ontdekten dat het model nog steeds faalde, zelfs toen ze willekeurige genen selecteerden. Ze controleerden of het probleem te maken had met het aantal bestudeerde genen of de specifieke manier waarop de genen werden gemeten, en vonden dat de mislukking standhield, ongeacht deze factoren. Zelfs toen ze de details over de sterkte van de gen-silencing weghaalden en alleen naar de richting van de verandering keken, kon het model de uitkomst nog steeds niet voorspellen.
Er was één kleine uitzondering die een sprankje hoop bood, maar die was bescheiden. Op één specifieke set cellen kon het model de uitkomst van nieuwe genen iets beter voorspellen dan simpelweg het gemiddelde resultaat raden. Echter, zelfs in dit best-case scenario herstelde het model slechts ongeveer zeven procent van de informatie die een perfect, goed functionerend systeem zou hebben geleverd. Het was een kleine overwinning in een zee van falen. De onderzoekers testten ook meer geavanceerde manieren om de geninformatie te coderen, inclusief methoden die keken naar hoe genen in hun natuurlijke staat met elkaar verbonden zijn of gebruikmaakten van machine learning om de "vingerafdruk" van het gen uit de data te leren. Geen van deze geavanceerde methoden kon het fundamentele probleem overwinnen. Ze faalden bij het voorspellen van nieuwe genen in twee van de drie geteste celtypen, en in het derde geval bereikten ze slechts een kleine verbetering die ver tekortschoot in vergelijking met wat de theorie beloofde.
De studie concludeert dat de huidige manier van het interpreteren van deze enorme gen-silencing schermen waarschijnlijk gebrekkig is. De aanname dat genen werken als onafhankelijke schakelaars die simpelweg hun effecten optellen, houdt geen stand wanneer dit wordt getest tegen onbekende doelwitten. De onderzoekers suggereren twee hoofdmogelijkheden voor waarom dit gebeurt. Ten eerste kan de manier waarop ze de identiteit van een gen vertalen naar een wiskundige input de meeste belangrijke informatie weggooien, vergelijkbaar met het proberen te beschrijven van een complex landschap door alleen naar één wazige foto te kijken. Ten tweede kan de biologische realiteit zijn dat genen niet op een eenvoudige, lineaire manier werken; in plaats daarvan kunnen hun effecten verzadigen of een drempelwaarde bereiken, wat betekent dat het uitschakelen van een gen niet een constante, voorspelbare verandering teweegbrengt.
Dit werk betekent niet dat gen-silencing schermen nutteloos zijn, maar het betekent wel dat de kaarten die we tot nu toe uit hen hebben opgesteld, mogelijk geen betrouwbare gidsen zijn voor het voorspellen van wat er gebeurt wanneer we nieuwe genen targeten. De onderzoekers hebben een nieuwe toolkit uitgebracht om andere wetenschappers te helpen hun eigen modellen tegen deze strikte standaarden te toetsen, om ervoor te zorgen dat toekomstige ontdekkingen gebouwd worden op een solide fundament. De les is duidelijk: biologie is vaak complexer dan onze eenvoudigste vergelijkingen toelaten, en totdat we een manier vinden om die complexiteit te vangen, zullen onze voorspellingen over hoe cellen zullen reageren op nieuwe interventies onzeker blijven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.