← Neueste Arbeiten
📄 molecular biology

An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites

Die Autoren führen Albatross ein, ein ausschließlich auf Sequenzdaten trainiertes RNA-Sprachmodell, das bestehende Methoden bei der Vorhersage von Strukturen interner Ribosomenbindungsstellen (Internal Ribosome Entry Sites) signifikant übertrifft, was die Entdeckung neuartiger funktioneller Unterklassen ermöglicht und die Identifizierung antiviraler Zielstrukturen beschleunigt.

Ursprüngliche Autoren: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

Veröffentlicht 2026-09-24
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Viren sind Meister der Tarnung, doch ihre kritischsten Geheimnisse sind oft direkt vor unseren Augen in ihrem genetischen Code verborgen. Für viele Viren, einschließlich der Picornaviren, die alles von der gewöhnlichen Erkältung bis hin zu verheerenden neurologischen Erkrankungen verursend, sind die Anweisungen zur Herstellung neuer Viruspartikel nicht nur eine einfache Liste von Buchstaben. Sie sind in komplexe dreidimensionale Formen gefaltet. Diese Formen fungieren als Schalter und Griffe, die es dem Virus ermöglichen, die Protein-produzierende Maschinerie der Zelle zu kapern. Eine der wichtigsten dieser Formen wird als Interne Ribosom-Bindestelle oder IRES bezeichnet. Im Gegensatz zu menschlichen Zellen, die normalerweise eine spezifische Kappe am Anfang ihrer genetischen Anweisungen benötigen, um mit dem Lesen zu beginnen, fungieren diese viralen IRES wie eine direkte Einladung, die es dem Virus ermöglichen, sofort und unabhängig Proteine aufzubauen. Genau zu verstehen, wie sich diese IRES falten, ist entscheidend für die Frage, warum manche Viren bestimmte Gewebe infizieren, warum manche schwere Krankheiten verursachen, während andere dies nicht tun, und wie wir Medikamente entwickeln können, um sie zu stoppen. Diese Strukturen sind jedoch notorisch schwer zu kartieren. Sie sind lang, hochvariabel und verändern ihre Form je nach Umgebung, was traditionelle Methoden der Vorhersage langsam und oft ungenau macht.

Ein Forschungsteam hat nun einen neuen Weg entwickelt, diese verborgenen Formen zu sehen, indem es die Notwendigkeit teurer, zeitaufwendiger Experimente umgeht. Sie entwickelten ein System der künstlichen Intelligenz, das sie Albatross nannten, welches ausschließlich auf den rohen Gensequenzen von tausenden dieser viralen Elemente trainiert wurde. Das System erhielt keine Informationen darüber, wie RNA faltet, über die Regeln der Chemie oder die Physik der Stabilität. Es wurde einfach mit Millionen von Sequenzen gefüttert und sollte die Muster innerhalb dieser Sequenzen lernen. Bemerkenswerwertweise lernte das Modell, die dreidimensionale Struktur dieser viralen Elemente mit hoher Präzision vorherzusagen, indem es lediglich die statistischen Beziehungen zwischen den Buchstaben in der Sequenz erkannte. Als die Forscher Albatross gegen eine Bibliothek von 96 verschiedenen, vollständigen viralen IRES-Sequenzen testeten, war die Genauigkeit der Vorhersagen des Modells weitaus höher als die der besten existierenden Methoden. Während andere Werkzeuge weniger als die Hälfte der tatsächlichen strukturellen Verbindungen korrekt identifizierten, lag Albatross in 80 Prozent der Fälle richtig.

Die Kraft dieses Ansatzes liegt darin, was das Modell tatsächlich gelernt hat. Es hat nicht nur die Formen auswendig gelernt; es hat die Logik des Virus gelernt. Durch die Analyse, wie eine Änderung in einem Teil der Sequenz die Vorhersage eines anderen Teils beeinflusste, identifizierte das Modell, welche RNA-Stücke nah beieinander liegen müssen, um zu funktionieren. Dies ermöglichte es den Forschern, zwischen Formen zu unterscheiden, die lediglich stabil sind, und solchen, die für die Funktion des Virus essenziell sind. Tatsächlich war das Modell so gut darin, funktionelle Strukturen aufzuspüren, dass es vorhersagen konnte, welche Teile der RNA am wahrscheinlichsten an der Einleitung des Infektionsprozesses beteiligt sind. Diese Fähigkeit ermöglichte es dem Team, einen massiven Atlas von über 75.000 vorhergesagten Strukturen zu erstellen, der eine enorme Vielfalt an Viren abdeckt, die zuvor nie in dieser Detailtiefe untersucht worden waren.

Mit dieser neuen Karte entdeckten die Forscher etwas völlig Neues. Sie fanden eine bisher unbekannte Untergruppe viraler Strukturen, die einen verlängerten Stamm enthielt – ein spezifisches Faltungsmuster, das in dieser Klasse von Viren zuvor nicht gesehen worden war. Sie testeten diese Entdeckung im Labor und bestätigten, dass der verlängerte Stamm real war und eine entscheidende Rolle für die Funktionsfähigkeit des Virus spielte. Dieser Befund legt nahe, dass das Modell biologische Wahrheiten aufdecken kann, die zuvor für Wissenschaftler unsichtbar waren. Darüber hinaus zeigten die Forscher, dass diese Methode nicht nur auf einen Typ von Virus beschränkt ist. Als sie dieselbe Trainingsstrategie auf das genetische Material von Hantaviren und bakteriellen Sensoren anwandten, identifizierte das Modell erfolgreich komplexe, langreichweitige Interaktionen und sogar die Fähigkeit eines einzelnen RNA-Moleküls, je nach Umgebung zwischen zwei verschiedenen Formen zu wechseln.

Die Auswirkungen dieser Arbeit reichen weit über die Kartierung von Viren hinaus. Seit Jahrzehnten kämpfen Wissenschaftler damit, die Struktur von RNA vorherzusagen, da die Moleküle so flexibel sind und die sie steuernden Regeln so komplex sind. Traditionelle Methoden verlassen sich oft darauf, die Energie jeder möglichen Form zu berechnen, ein Prozess, der für lange Sequenzen unmöglich wird. Andere Methoden erfordern den Vergleich vieler ähnlicher Viren, um Muster zu finden, was fehlschlägt, wenn die Viren zu verschieden sind. Albatross umgeht diese Probleme, indem es direkt aus den Sequenzdaten lernt. Die Forscher fanden heraus, dass sich die Genauigkeit des Modells verbesserte, wenn sie die Größe der Trainingsdaten und die Größe des Modells erhöhten, was darauf hindeutet, dass dieser Ansatz mit mehr Daten immer besser werden kann.

Diese Studie stellt eine bedeutende Verschiebung in der Art und Weise dar, wie wir der RNA-Biologie begegnen. Anstatt diese Moleküle als statische Rätsel zu behandeln, die mit physikalischen Gleichungen gelöst werden müssen, behandelten die Forscher sie als eine Sprache, die gelernt werden muss. Die Ergebnisse zeigen, dass die Evolutionsgeschichte eines Virus in seiner Sequenz kodiert ist, auf eine Weise, die eine künstliche Intelligenz dekodieren kann. Indem sie die strukturelle Logik dieser viralen Elemente offenlegen, bietet die Arbeit ein leistungsfähiges neues Werkzeug, um zu verstehen, wie Viren operieren und wie man sie stoppen kann. Die Fähigkeit, diese Strukturen in großem Maßstab vorherzusagen, bedeutet, dass Wissenschaftler nun in der Lage sind, das funktionelle Potenzial von Tausenden von viralen Sequenzen zu erforschen, die zuvor zu schwierig zu untersuchen waren, was die Tür zu neuen Entdeckungen in der Virologie und Medizin öffnet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →