Single-cell foundation models benefit from cross-modal training: adding proteomics data beats parameter scaling
Diese Arbeit zeigt, dass das cross-modale Pretraining eines Single-Cell-Foundation-Modells mit Proteomik-Daten überlegene Gen- und Zell-Repräsentationen sowie eine bessere Generalisierung liefert als die bloße Skalierung von RNA-basierten Modellen, was den Wert des multimodalen Trainings gegenüber der reinen Parameter-Skalierung hervorhebt.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In jeder lebenden Zelle findet ein komplexes Gespräch statt, das in zwei verschiedenen Sprachen geschrieben ist. Eine Sprache besteht aus RNA, Molekülen, die Anweisungen für den Bau von Proteinen tragen – den Arbeitspferden, die eine Zelle am Leben und funktionsfähig halten. Wissenschaftler haben Jahre damit verbracht, diese RNA-Botschaften zu lesen, und dabei riesige digitale Bibliotheken erstellt, die beschreiben, wie sich Zellen in Gesundheit und Krankheit verhalten. Diese Bibliotheken sind so groß geworden, dass Forscher nun leistungsstarke Computerprogramme nutzen, die als Foundation-Modelle bekannt sind, um Muster darin zu finden. Diese Programme lernen, die einzigartigen Signaturen verschiedener Zelltypen zu erkennen, ganz ähnlich wie ein Bibliothekar, der das Genre eines Buches sofort am Einband identifizieren kann. Lange Zeit war die vorherrschende Meinung, dass der einzige Weg, diese Programme intelligenter zu machen, darin bestehe, sie mit immer mehr RNA-Daten zu füttern, in der Hoffnung, dass schiere Menge schließlich jedes Geheimnis des zellulären Lebens offenbaren würde.
Zellen sprechen jedoch mehr als eine Sprache. Neben der RNA produzieren sie Proteine, die eigentlichen Strukturen, die die Aufgaben der Zelle ausführen. Während die RNA der Zelle sagt, was gebaut werden soll, sind Proteine die fertigen Produkte. Bis vor kurne ignorierten die meisten Computermodelle von Zellen diese Proteine und konzentrierten sich ausschließlich auf die RNA-Anweisungen. Dies hinterließ eine Lücke im Verständnis, da die Anweisungen nicht immer mit dem Endergebnis übereinstimmen. Die Frage, vor der Wissenschaftler standen, war, ob das Hinzufügen dieser zweiten Informationsebene – der Proteindaten – den Computermodellen mehr lehren könnte, als es das bloße Hinzufügen von mehr RNA-Daten jemals könnte. Es war ein Test dafür, ob Qualität und Vielfalt der Informationen die einfache Strategie übertreffen könnten, die Modelle größer und mit mehr vom Gleichen zu füttern.
Ein Team von Forschern setzte sich zum Ziel, dies zu beantworten, indem sie ein Computermodell mit einer neuen Art von Daten trainierten. Sie begannen mit einem bestehenden Modell, das bereits aus Hunderten von Millionen RNA-Proben gelernt hatte. Anstatt es nur mit mehr RNA zu füttern, führten sie es in eine riesige Sammlung von Proteinprofilen ein. Diese Profile stammten aus 440 verschiedenen Studien, die Massenspektrometrie verwendeten – eine Technik, mit der die spezifischen Proteine misst, die in einer Zelle vorhanden sind. Die Forscher leiteten das Modell sorgfältig an, aus diesen 48.843 Proteinproben zu lernen, einen Prozess, den sie „Cross-Modal Continued Pretraining“ nannten. Dies bedeutete, dass das Modell lernen musste, wie die Proteinsprache mit der RNA-Sprache zusammenhängt, die es bereits kannte – was es effektiv dazu brachte, die Zelle sowohl durch ihre Anweisungen als auch durch ihre fertigen Produkte zu verstehen.
Die Ergebnisse waren beeindruckend. Die Forscher trainierten ein Modell mit 70 Millionen Parametern – ein Maß für dessen Komplexität – auf diesen gemischten Daten in nur einem Durchgang durch die Proteinproben. Als sie dieses Modell testeten, schnitt es so gut oder sogar besser ab als Modelle, die wesentlich größer waren und nur auf RNA trainiert wurden. Konkret entsprach das kleinere Modell mit Proteindaten in seiner Leistung den RNA-basierten Modellen mit 1 Milliarde oder 3 Milliarden Parametern oder übertraf diese sogar. Dieser Befund stellt die Vorstellung infrage, dass der einzige Weg zu einem besseren Verständnis darin besteht, einfach die Größe des Modells und die Menge der RNA-Daten hochzuskalieren. Stattdessen deutet es darauf hin, dass die Einführung einer anderen Art von biologischen Daten einen viel effizienteren Schub für die Intelligenz des Modells bewirken kann.
Die Vorteile dieses Ansatzes erstreckten sich über die allgemeine Leistungsfähigkeit hinaus. Das mit Proteindaten trainierte Modell zeigte eine stärkere Fähigkeit zur Generalisierung, was bedeutet, dass es das Gelernte auf neue Situationen anwenden konnte, die es zuvor noch nie gesehen hatte. Dies wurde besonders deutlich, als das Modell getestet wurde, wie Zellen auf Proteinveränderungen reagieren. In diesen Tests half es nicht, das RNA-basierte Modell einfach nur größer zu machen, um das Verständnis dieser Veränderungen zu verbessern. Das Modell, das von Proteinen gelernt hatte, bewältigte diese neuen Herausforderungen jedoch mit größerer Leichtigkeit. Dies deutet darauf hin, dass die Proteindaten dem Modell geholfen haben, ein robusteres und flexibleres Verständnis der Funktionsweise von Zellen aufzubauen – ein Verständnis, das nicht strikt an die Muster gebunden ist, die allein in der RNA zu finden sind.
Diese Erkenntnisse legen nahe, dass die Zukunft des Verständnisses von Zellen möglicherweise nicht darin liegt, immer größere Modelle zu bauen, die auf einer einzigen Art von Daten trainiert werden. Stattdessen könnten die kraftvollsten Erkenntnisse aus der sorgfältigen Kombination verschiedener Arten biologischer Informationen stammen. Indem wir Computermodelle lehren, sowohl die Anweisungen als auch die Produkte der Zelle zu lesen, können wir Werkzeuge schaffen, die nicht nur intelligenter, sondern auch präziser in ihren Vorhersagen sind. Dieser Ansatz bietet einen vielversprechenden Weg zu informativeren Modellen, die in der Lage sind, die volle Komplexität des Lebens zu erfassen, und beweist, dass es manchmal wertvoller ist, eine neue Perspektive hinzuzufügen, als einfach nur mehr vom Gleichen zu verwenden.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.