RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design
RNASeek ist ein generatives Foundation-Modell mit 1,6 Milliarden Parametern, das Reinforcement Learning nutzt, um die RNA-Sequenzrepräsentation, die funktionelle Vorhersage und das De-novo-Design zu vereinheitlichen, wobei es erfolgreich experimentell validierte Ribozyme und 3'-UTRs mit gesteigerter Leistung generiert.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In jeder lebenden Zelle findet ein gewaltiges und komplexes Gespräch statt, nicht mit Worten, sondern mit Molekülen. Im Zentrum dieses Dialogs steht die RNA, ein vielseitiges Molekül, das sowohl als Bote als auch als Regulator fungiert, indem es Anweisungen vom genetischen Bauplan überträgt und entscheidet, wie diese Anweisungen ausgeführt werden. Jahrzehntelang wussten Wissenschaftler, dass die spezifische Abfolge von Buchstaben in einem RNA-Strang seine Form und Funktion bestimmt, ganz so, wie die Anordnung von Buchstaben in einem Satz seine Bedeutung bestimmt. Es war jedoch eine enorme Herausforderung, genau vorherzusagen, wie sich eine neue Sequenz von Buchstaben verhalten wird. Die Regeln sind komplex und beinhalten weitreichende Wechselwirkungen sowie subtile strukturelle Nuancen, die nur schwer manuell zu erfassen sind. Nun haben Forscher ein neues Werkzeug entwickelt, das diese Regeln lernt, indem es die biologische Literatur des Lebens selbst liest, was es ihnen ermöglicht, nicht nur vorherzusagen, wie sich RNA verhalten wird, sondern auch völlig neue Moleküle mit spezifischen, gewünschten Eigenschaften zu entwerfen.
Das Team hinter dieser Arbeit, angeführt von Forschern der University of California, Riverside und der Columbia University, entwickelte ein massives Computerprogramm, das sie RNASeek nennen. Stellen Sie sich dieses Programm wie einen Schüler vor, der jedes Buch in einer Bibliothek gelesen hat, die die genetischen Anweisungen von über einhundert verschiedenen Arten enthält, von Pflanzen und Tieren bis hin zu Pilzen und Viren. Im Gegensatz zu früheren Werkzeugen, die darauf ausgelegt waren, nur ein spezifisches Rätsel zu lösen, wurde RNASeek gebaut, um die allgemeine Sprache der RNA zu verstehen. Es wurde auf einem Datensatz trainiert, der etwa 150 Milliarden genetische Informationen umfasst, wobei es lernte, Muster darin zu erkennen, wie verschiedene Organismen ihre RNA konstruieren. Das Programm lernte auch, natürliche Sprachanweisungen zu lesen, was bedeutet, dass ein Wissenschaftler ihm einfach sagen kann, was er möchte, wie zum Beispiel „erstelle eine stabile RNA-Sequenz“ oder „entwirf ein Molekül, das sich selbst schneidet“, und das Modell wird versuchen, eine Lösung zu generieren.
Um zu testen, ob dieser digitale Schüler die Sprache wirklich gelernt hatte, baten die Forscher es zuerst, das Verhalten von Ribozymen vorherzusagen. Dies sind RNA-Moleküle, die als Enzyme fungieren und in der Lage sind, sich selbst oder andere Moleküle zu schneiden. Das Team versorgte das Modell mit tausenden bekannten Ribozym-Sequenzen und deren gemessenen Schneegeschwindigkeiten. RNASeek lernte erfolgreich vorherzusagen, welche Sequenzen schnell und welche langsam schneiden würden, indem es subtile Merkmale identifizierte, die zur Geschwindigkeit beitragen, wie etwa die Flexibilität bestimmter Schleifen in der Struktur des Moleküls. Das Modell schnitt so gut oder sogar besser ab als viele spezialisierte Werkzeuge, die speziell für diese Aufgabe entwickelt wurden, was bewies, dass es die zugrunde liegenden Prinzipien davon verstanden hatte, wie die RNA-Struktur die Funktion bestimmt.
Ermutigt durch diesen Erfolg trieben die Forscher das Modell weiter und baten es, neue RNA-Sequenzen von Grund auf neu zu entwerfen. Sie konzentrierten sich auf eine andere Art von RNA, die in der 3'-untranslatierten Region zu finden ist, einem Abschnitt des Moleküls, der hilft zu bestimmen, wie lange die RNA in einer Zelle überlebt. Eine längere Lebensdauer bedeutet, dass die Zelle mehr von dem Protein produziert, für das die RNA kodiert, was für Therapien wie mRNA-Impfstoffe entscheidend ist. Die Forscher nutzten eine Technik namens Reinforcement Learning (bestärkendes Lernen), eine Methode, bei der das Computerprogramm ein Spiel aus Versuch und Irrtum spielt. Es generierte tausende Kandidaten-Sequenzen, und ein separater Teil des Modells fungierte als Richter, der sie danach bewertete, wie stabil sie vorhergesagt wurden. Das Programm passte dann seine Strategie an, um bessere Kandidaten zu generieren, und lernte schrittweise, Sequenzen zu produzieren, die hochgradig stabil sind.
Die Ergebnisse waren beeindruckend. Die von RNASeek entworfenen Sequenzen waren nicht bloß zufällige Kombinationen von Buchstaben; sie enthielten spezifische Muster, wie etwa einen Überfluss an Adenin und Uracil, von denen bekannt ist, dass sie helfen, RNA zu stabilisieren. Als die Forscher diese computergenerierten Designs in einer Laborumgebung testeten, stellten sie fest, dass die neuen Sequenzen außergewöhnlich gut funktionierten. Einige der entworfenen Moleküle waren sogar stabiler als die besten Sequenzen, die in der Natur vorkommen oder durch andere Werkzeuge der Künstlichen Intelligenz erstellt wurden. Entscheidend war, dass, als die Forscher die Buchstaben dieser erfolgreichen Designs vertauschten – also ihre Reihenfolge änderten, während sie die gleichen Bestandteile beibehielten –, die Stabilität verschwand. Dies bestätigte, dass der Erfolg aus der spezifischen Anordnung der Buchstaben resultierte und nicht nur aus der chemischen Zusammensetzung, was bewies, dass das Modell die wahre Syntax der Sprache gelernt hatte.
Die Studie demonstrierte auch, dass das Modell komplexen Anweisungen folgen kann. Wissenschaftler konnten das Programm bitten, eine stabile RNA-Sequenz zu generieren, die ein spezifisches Motiv für das Klonen enthält oder ein bestimmtes Muster ausschließt, das Probleme verursachen könnte. Das Modell konnte diese Einschränkungen erfolgreich einhalten und gleichzeitig die Stabilität optimieren. Diese Fähigkeit, natürlichen Sprachbefehlen zu folgen und funktionale biologische Teile zu produzieren, deutet auf eine neue Art des Engineerings des Lebens hin. Anstatt sich auf langsame, teure Zyklen von Versuch und Irrtum im Labor zu verlassen, können Wissenschaftler nun ein einheitliches System nutzen, um vorherzusagen, wie sich RNA verhalten wird, und um neue Moleküle zu entwerfen, die präzisen Bedürfnissen entsprechen. Die Arbeit etabliert, dass ein einziges, groß angelegtes Modell die Lücke zwischen dem Verständnis biologischer Daten und der Erstellung neuer, funktioneller biologischer Werkzeuge schließen kann, was die Tür für ein effizienteres Design von Therapien und Forschungswerkzeugen öffnet.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.