← Neueste Arbeiten
🧬 biology

ProtSyntax: a protein large language model for decoding post-translational modification syntax and function

ProtSyntax ist ein 4 Milliarden Parameter umfassendes Protein-Large Language Model, das die Einschränkungen der Behandlung von posttranslationalen Modifikationen (PTMs) als unabhängige Labels überwindet, indem es die Chemie der Aminosäurereste, die Motivabfolge und den 3D-Kontext integriert, um PTM-Stellen präzise vorherzusagen, Crosstalk zu modellieren und deren funktionale Konsequenzen über diverse biologische Anwendungen hinweg zu dekodieren.

Ursprüngliche Autoren: Yiyu Lin, Jiahui Wu, You Zhou, Xinye Ni, Shan Chang, Jun Ding, Yan Wang, Xin Gao, Sen Yang

Veröffentlicht 2026-08-06
📖 3 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Yiyu Lin, Jiahui Wu, You Zhou, Xinye Ni, Shan Chang, Jun Ding, Yan Wang, Xin Gao, Sen Yang

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen

Stellen Sie sich Ihren Körper als eine geschäftige Stadt vor, in der Proteine die Arbeiter, Maschinen und Gebäude sind, die alles am Laufen halten. Doch diese Arbeiter sind nicht statisch; sie werden ständig mit winzigen chemischen Notizen „markiert“, die ihnen sagen, wann sie mit der Arbeit beginnen sollen, wohin sie gehen müssen oder wann sie eine Pause einlegen sollen. Diese Markierungen werden als posttranslationale Modifikationen (PTMs) bezeichnet. Man kann sie sich wie Klebezettel, Textmarker oder sogar digitale Benachrichtigungen vorstellen, die einem Protein nach dessen Herstellung hinzugefügt werden. Manchmal kann ein einzelnes Protein Dutzende dieser Markierungen besitzen, was einen komplexen, sich ständig verändernden Code erzeugt, der alles von Ihrem Immunsystem bis hin zu Ihrem Gedächtnis steuert.

Lange Zeit haben Wissenschaftler versucht vorherzusagen, wo diese Markierungen erscheinen, aber das war so, als würde man versuchen, einen geheimen Code zu erraten, indem man nur einen Buchstaben nach dem anderen betrachtet. Die alte Denkweise betrachtete diese Markierungen als unabhängige Ereignisse und ging davon aus, dass ein Protein eine Markierung erhält, wenn es die richtige „Form“ für eine Markierung besitzt. In der Realität ähneln die Regeln jedoch vielmehr einer Sprache. Eine Markierung ergibt nur Sinn, wenn die umgebende „Grammatik“ (die Aminosäuresequenz), die „Nachbarschaft“ (die 3D-Struktur des Proteins) und sogar andere nahegelegene Markierungen überebereinstimmen. Wenn die Grammatik falsch ist oder die Nachbarschaft zu überfüllt ist, wird die Markierung nicht haften, egal wie sehr das Protein sie auch möchte.

Hier kommt ProtSyntax ins Spiel, ein neues, 4 Milliarden Parameter umfassendes „Proteinhirn“, das darauf ausgelegt ist, diese komplexe Sprache zu entschlüsseln. Anstatt nur zu erkennen, wo eine Markierung hinkönnte, lernt ProtSyntax die Regeln des Spiels. Es ist wie ein Upgrade von einer Rechtschreibprüfung, die nur Tippfehler findet, zu einem Literaturkritiker, der Handlung, Charaktermotivation und Satzstruktur versteht. Die Forscher trainierten dieses Modell mit einer riesigen Bibliothek von 4 Millionen Proteinbeispielen und brachten ihm bei, nicht nur Markierungen zu erkennen, sondern auch zu verstehen, wie sie interagieren, wie sie die Aufgabe eines Proteins verändern und wie sie sich in verschiedenen 3D-Umgebungen verhalten.

Die Ergebnisse sind beeindruckend. In Tests über 40 verschiedene Arten von Proteinmarkierungen hinweg übertraf ProtSyntax die besten bestehenden Modelle um eine deutliche Marge und verbesserte die Genauigkeit in einigen Bereichen um über 12 %. Aber die wahre Magie liegt darin, was es mit diesem Wissen tun kann. Das Modell kann „Lückentext-Spiele“ spielen, also fehlende Markierungen oder Stellen allein durch den Kontext erraten, ganz so wie ein Mensch einen Satz vervollständigt. Es kann sogar zwischen einem Protein unterscheiden, das so aussieht, als müsste es eine Markierung tragen, aber tatsächlich in einer 3D-Form ist, die dies blockiert, und einem, das wirklich bereit dafür ist.

Vielleicht am spannendsten ist, dass ProtSyntax suggeriert, dass es das Ursache-Wirkungs-Verhältnis zwischen diesen Markierungen und der Funktion eines Proteins versteht. Als die Forscher eine Änderung einer Markierung simulierten, konnte das Modell vorhersagen, wie dies die Geschwindigkeit oder Effizienz des Proteins verändern würde, wodurch die winzige chemische Änderung mit der großen Aufgabe des Proteins verknüpft wurde. Es gelang ihm sogar, das „Crosstalk“ (das Wechselspiel) zwischen den Markierungen zu rekonstruieren – es fand heraus, wann eine Markierung einer anderen hilft, anzuhaften, oder wann sie diese wegstößt. In Simulationen mit krankheitsbedingten Mutationen identifizierte das Modell erfolgreich, welche Veränderungen den regulatorischen Code des Proteins brechen würden, und bot so eine neue Möglichkeit, gefährliche Mutationen aufzuspüren, die ältere Methoden übersehen hatten. Obwohl sich diese Erkenntnisse derzeit auf Computersimulationen und Benchmarks stützen, deuten sie darauf an, dass wir endlich lernen, die vollständige, dynamische Geschichte darüber zu lesen, wie unsere Proteine arbeiten, anstatt nur die Schlagzeilen zu lesen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →