← Neueste Arbeiten
🧠 neurology

Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts

Diese Studie zeigt, dass Deep-Learning-Genom-Orakel daran scheitern, Sequenzeffekte über verschiedene Wirtskontexte hinweg zu generalisieren, da ihre Vorhersagen für die Aktivität regulatorischer Elemente stark von der spezifischen genomischen Lage abhängen und nicht zuverlässig allein durch Sequenzmerkmale vorhergesagt werden können.

Ursprüngliche Autoren: Selahattin Alperen Uysal

Veröffentlicht 2026-09-21✓ Author reviewed ⓘ
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Selahattin Alperen Uysal

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der weiten Landschaft des menschlichen Genoms fungieren bestimmte DNA-Abschnitte als Schalter, die Gene ein- oder ausschalten, um zu steuern, wie Zellen funktionieren. Wissenschaftler versuchen schon lange zu verstehen, welcher präzise Code festlegt, wo diese Schalter arbeiten und wann sie aktiviert werden. In den letzten Jahren sind leistungsfähige Computerprogramme entstanden, die dabei helfen, diese Sprache zu entschlüsseln. Diese Programme, die oft als „genomische Orakel“ bezeichnet werden, können eine Kette von DNA-Buchstaben analysieren und vorhersagen, wie sie sich in einer lebenden Zelle verhalten wird – sie schätzen ab, ob sie sich öffnen wird, um Genaktivität zu ermöglichen, oder geschlossen bleiben wird. Da diese digitalen Werkzeuge im Vergleich zu Laborexperimenten schnell und kostengünstig sind, nutzen Forscher sie zunehmend, um neue DNA-Sequenzen zu entwerfen, in der Hoffnung, maßgeschneiderte Schalter zu kreieren, die exakt wie beabsichtigt funktionieren. Die zugrunde liegende Hoffnung ist, dass, wenn ein Computerprogramm sagt, dass eine bestimmte DNA-Sequenz ein guter Schalter in einem Teil des Genoms ist, sie auch dann ein guter Schalter bleibt, wenn sie an einen anderen Ort verschoben wird.

Eine neue Studie stellt diese grundlegende Annahme infrage, indem sie testet, ob diese digitalen Vorhersagen Bestand haben, wenn dieselbe DNA-Sequenz in verschiedenen Nachbarschaften des Genoms platziert wird. Die Forscher konzentrierten sich auf Multiple Sklerose, eine Krankheit, bei der das Immunsystem das Nervensystem angreift, und untersuchten die spezifischen genetischen Regionen, die das Risiko bekanntlich erhöhen, an diese Erkrankung zu erkranken. Sie verwendeten ein Modell der künstlichen Intelligenz, um tausende von Kandidatensequenzen zu generieren, die wie regulatorische Schalter in Immunzellen aussehen könnten. Anschließend setzten sie ein genomisches Orakel ein, um diese Kandidaten zu bewerten, wobei sie jene auswählten, die der Computer als am aktivsten vorhersagte. Das Team führte einen strengen Test durch: Sie nahmen genau dieselben ausgewählten Sequenzen und platzierten sie an vierundzwanzig verschiedenen Positionen innerhalb des Genoms, um zu sehen, ob die Vorhersage des Computers konsistent blieb.

Die Ergebnisse zeigten einen erschreckenden Mangel an Konsistenz. Während das Computerprogramm Sequenzen innerhalb eines einzelnen Standorts gut ranken konnte, versagten seine Vorhersagen, wenn die Sequenzen verschoben wurden. Der Effekt einer spezifischen Änderung an der DNA-Sequenz war keine feste Eigenschaft der Sequenz selbst; stattdessen hing er vollständig davon ab, wo im Genom die Sequenz platziert war. In einigen Positionen machte eine spezifische Editierung der DNA die Sequenz aktiver, während dieselbe Editierung in anderen Positionen sie weniger aktiv machte oder gar keinen Effekt hatte. Die Forscher fanden heraus, dass das Verhalten der Sequenz so stark von ihrer Umgebung abhängig war, dass die Variation zwischen verschiedenen Standorten massiv war, wobei sich die Richtung des Effekts an fast der Hälfte der getesteten Stellen umkehrte.

Um zu verstehen, was der Computer tatsächlich „sah“, führten das Team direkte Interventionen an den DNA-Sequenzen durch. Sie testeten, ob die Präferenz des Computers durch das Vorhandensein spezifischer Bindungsstellen für Proteine getrieben wurde, die Gene steuern, oder durch die Dichte dieser Bindungsstellen. Die Antwort lautete nein; das Entfernen dieser Stellen oder das Ändern ihrer Anzahl änderte den Score des Computers nicht auf eine vorhersehbare Weise. Stattdessen war der Faktor, der wirklich entscheidend war, der Gehalt einer spezifischen chemischen Struktur namens CpG, die eine Paarung von zwei DNA-Buchstaben beinhaltet. Jedoch wirkte sich dieser Faktor nicht allein aus. Die Erhöhung der Menge dieser Struktur in der DNA verbesserte den Score in einigen genomischen Lagen, verschlechterte ihn jedoch in anderen. Die Richtung des Effekts wurde durch den Wirtsstandort bestimmt, nicht durch die Editierung selbst.

Die Studie testete auch, ob ein zweites, unabhängig trainiertes Computerprogramm dieselben Ergebnisse liefern würde. Dieses neue Modell, das mit einer anderen Architektur gebaut und mit anderen Daten trainiert wurde, bestätigte den Hauptbefund: Der Effekt der DNA-Editierung war hochgradig instabil und variierte stark je nach genomischer Lage. Die beiden Programme stimmten jedoch nicht darin überein, welche Standorte einen positiven oder negativen Effekt zeigen würden, was darauf hindeutet, dass die Instabilität zwar ein reales Phänomen ist, die spezifischen Details, wie ein Modell einen Standort interpretiert, jedoch einzigartig für dieses Modell sind.

Vielleicht am kritischsten war, dass die Forscher überprüften, ob die vom Computer ausgewählten Sequenzen in einem realen Experiment tatsächlich besser funktionierten. Sie verglichen die Scores des Computers mit der gemessenen Aktivität aus einem groß angelegten Laborassay, der tausende von DNA-Elementen umfasste. Die Auswahlkriterien des Computers konnten nicht vorhersagen, welche Sequenzen in den Zellen tatsächlich aktiv waren. Tatsächlich zeigten die Sequenzen, die der Computer als die besten Performer einstufte, oft das gegenteilige Verhalten im Labor; die spezifischsten und aktivsten Elemente erhielten von dem Orakel die niedrigsten Scores. Diese Diskrepanz deutet darauf hin, dass das spezifische Ziel, das der Computer optimiert, nicht die tatsächliche biologische Aktivität der DNA widerspiegelt.

Die Forscher entdeckten auch, dass eine viel einfachere mathematische Methode, die auf dem Zählen von Buchstabenmustern in der DNA basiert, ebenso gute Sequenzen generieren konnte wie die komplexen Deep-Learning-Modelle der künstlichen Intelligenz. Diese einfache Methode, die keine leistungsstarken Computer benötigt und in Sekunden angepasst werden kann, erreichte in jeder getesteten Messung die Leistung der fortgeschrittenen neuronalen Netze. Dieser Befund impliziert, dass die Komplexität der Deep-Learning-Modelle nicht notwendig war, um die wesentlichen Muster der DNA-Sequenzen in diesem Kontext zu erfassen.

Letztlich kommt die Studie zu dem Schluss, dass ein auf Sequenzebene gemessener oder gelernter Effekt eines genomischen Orakels keine Eigenschaft der Sequenz allein ist. Es ist eine Eigenschaft der Sequenz in Kombination mit dem spezifischen genomischen Kontext, in dem sie sich befindet. Diese Abhängigkeit vom Standort ist nicht aus einfachen, kostengünstigen Merkmalen der umgebenden DNA vorhersagbar. Für Wissenschaftler, die neue genetische Elemente entwerfen, bedeutet dies, dass ein Design, das in einer Computersimulation an einem Ort ausgewählt und validiert wurde, keine Garantie dafür bietet, wie es sich verhalten wird, wenn es an einen anderen Ort verschoben oder dort eingefügt wird. Die Ergebnisse dienen als Warnung, dass diese leistungsstarken digitalen Werkzeuge, obwohl sie nützlich sind, noch nicht darauf vertraut werden können, das Verhalten designter Sequenzen über die vielfältige Landschaft des menschlichen Genoms hinweg vorherzusagen, ohne eine direkte experimentelle Verifizierung an mehreren Standorten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →