Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis
Diese empirische Studie zeigt auf, dass biologische große Sprachmodelle (SCFMs) zwar eine reale, niedrigdimensionale und teilweise linearisierte geometrische Struktur für biologisches Wissen kodieren, diese Struktur jedoch bescheiden, oft nichtlinear verschränkt und weitgehend deckungsgleich mit dem ist, was klassische, auf der Genexpression basierende Methoden wie die PCA bereits erfassen können, wodurch sie hinter der klaren, regelmäßigen Geometrie zurückbleibt, die in Modellen der natürlichen Sprache beobachtet wird.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie hätten eine riesige, magische Bibliothek, in der jedes Buch eine einzige lebende Zelle aus dem menschlichen Körper ist. Jahrelang haben Wissenschaftler versucht, diese Bücher zu lesen, um zu verstehen, wie unser Körper funktioniert, aber der Text ist chaotisch und schwer zu entziffern. Vor kurzem wurde eine neue Art von „Super-Leser“ namens Biological Large Language Model (oder Biological LLM) erfunden. Dies sind Computerprogramme, die mit Millionen von Zell-„Büchern“ trainiert wurden, um Muster zu erkennen, ganz so, wie Ihr Handy-Keyboard lernt, das nächste Wort vorherzusagen, das Sie tippen werden.
Die große Frage, die sich Wissenschaftler gestellt haben, laß: Organisieren diese Super-Leser ihr Wissen auf eine ordentliche, geradlinige Weise? In regulären Sprachmodellen (denen, die Aufsätze schreiben oder mit Ihnen chatten) fanden Forscher heraus, dass Ideen wie „König“ und „Königin“ auf einer geraden Linie liegen, und Gegensätze sind nur einen einfachen Schritt voneinander entfernt. Es ist wie eine perfekt organisierte Landkarte, auf der jedes Konzept seine eigene klare Straße hat. Wissenschaftler hofften, dass diese biologischen Super-Leser dieselbe ordentliche, geradlinige Karte für Dinge wie „gesund vs. krank“ oder „wachsend vs. ruhend“ besitzen würden. Wenn dies der Fall wäre, könnten wir das Denken des Computers leicht anpassen, um Krankheiten oder die Entwicklung zu verstehen. Aber, wie wir gleich sehen werden, ist die Karte innerhalb dieser biologischen Modelle eher wie ein gewundener, hügeliger Waldpfad als eine gerade Stadtstraße.
Die Karte im Inneren der Maschine: Ein Wald, kein Highway
In dieser Studie beschloss eine Forscherin namens Olivia Denvis, tief in vier dieser biologischen Super-Leser (genannt scBERT, Geneformer, scGPT und UCE) einzutauchen, um zu sehen, ob sie wirklich über diese ordentliche, geradlinige Organisation verfügen. Sie behandelte sie wie Entdecker und schickte sie in einen massiven Datensatz von 420.000 Zellen mit detaillierten Notizen darüber, was sie sind, wo sie leben und was sie tun. Sie verglich dann die internen „Karten“ der Modelle mit den altbewährten, zuverlässigen Werkzeugen, die Wissenschaftler seit Jahrzehnten nutzen, wie zum Beispiel einfache mathematische Tricks namens PCA.
Hier ist, was sie fand: Die Modelle haben zwar eine Karte, aber es ist nicht der klare, gerade Highway, auf den alle gehofft hatten.
1. Die Karte ist kompakt, aber überfüllt
Zuerst prüften die Forscher, wie viel Platz die Modelle nutzen, um Informationen zu speichern. Stellen Sie sich ein riesiges Lagerhaus (die volle Größe des Modells) vor, das 1.280 Regale halten könnte. Die Studie ergab, dass die Modelle tatsächlich nur etwa 12 bis 26 Regale nutzen, um ihr Wissen zu speichern. Das ist ein sehr niedrigdimensionaler Raum, was gut ist, da es bedeutet, dass die Modelle effizient sind. Der Raum ist jedoch „anisotrop“, was eine schicke Art zu sagen ist, dass er geformt ist wie ein langer, schmaler Kegel statt eines runden Balls. Die kleineren Modelle waren noch stärker in diesen engen Kegel gepresst, was darauf hindeutet, dass sie in ihrem Denken etwas „eingeengt“ sein könnten.
2. Das Einfache ist gerade, das Schwierige ist kurvig
Als die Forscherin die Modelle bat, einfache Dinge zu identifizieren, wie zum Beispiel „Ist diese Zelle von einem männlichen oder weiblichen Individuum?“ oder „Gehört sie zum Immunsystem?“, waren die Modelle fantastisch. Sie konnten eine gerade Linie ziehen, um diese Gruppen zu trennen, genau wie die Sprachmodelle. Tatsächlich waren die Modelle für diese einfachen Kategorien fast perfekt.
Aber hier kommt die Wendung: Als sie sie nach den interessanten Dingen fragte – wie zum Beispiel „Ist diese Zelle krank?“ oder „Welcher spezifischen Untergruppe gehört sie an?“ oder „Wie weit ist sie in ihrer Entwicklung fortgeschritten?“ – funktionierten die geraden Linien nicht mehr. Das Wissen war immer noch da, aber es war in Kurven verheddert.
- Der Beweis: Als die Forscherin versuchte, eine einfache gerade Linie zu verwenden, um die Entwicklungszeit einer Zelle vorherzusagen, lieferte sie nur etwa 61 % der Antwort richtig. Aber als sie den Computer den natürlichen, kurvigen Pfaden der Daten folgen ließ (wie das Wandern auf einem gewundenen Pfad anstatt das Durchqueren eines Feldes), sprang die Genauigkeit auf 80 %.
- Das Fazit: Die Modelle kennen die komplexen Dinge, aber sie speichern sie auf eine gekrümmte, nicht-lineare Weise, die einfache gerade Linien nicht leicht erreichen können. Dies unterscheidet sie von Sprachmodellen, bei denen selbst komplexe Ideen oft auf geraden Linien liegen.
3. Das „Lenkrad“ ist ein wenig wackelig
In Sprachmodellen kann man, wenn man die Bedeutung eines Wortes ändern möchte (wie von „glücklich“ zu „traurig“), einfach einen spezifischen Vektor (eine Richtung) hinzufügen, und es funktioniert perfekt. Die Forscherin versuchte dies auch bei den biologischen Modellen. Sie versuchte, die Identität einer Zelle durch das Hinzufügen eines Richtungsvektors zu „steuern“.
- Das Ergebnis: Es funktionierte, aber nur etwa 54 % bis 66 % der Zeit. Es war besser als ein Münzwurf, aber weit entfernt von der perfekten Kontrolle, die man bei Sprachmodellen sieht. Manchmal änderte der Versuch, eine Sache zu verändern, versehentlich etwas anderes. Die Richtungen für verschiedene Ideen waren teilweise parallel, aber nicht perfekt so, und sie waren nur schwach ausgerichtet.
4. Die Modelle stimmen untereinander überein, nicht mit der „Wahrheit“
Die Forscherin prüfte auch, ob alle vier Modelle auf die gleiche Weise denken. Sie waren moderat ähnlich zueinander (etwa 55 % bis 74 % ähnlich), was schön ist. Aber als sie sie mit dem „Goldstandard“ des biologischen Wissens (einer detaillierten Karte, wie Zelltypen im echten Leben miteinander verwandt sind) verglich, waren die Modelle nur etwa 36 % bis 45 % ähnlich.
- Die Überraschung: Die Modelle ähnelten tatsächlich eher den alten mathematischen Werkzeugen (PCA) als der echten biologischen Wahrheit. Sie konvergierten auf eine gemeinsame, vereinfachte Sicht auf die Daten, die näher an der einfachen Mathematik als an der komplexen biologischen Realität lag.
5. Das „tiefe“ Wissen liegt in der Mitte
Schließlich untersuchte sie, wo in den Schichten des Modells (seinem „Gehirn“) dieses Wissen lebte.
- Einfache Identität: Zu wissen, „was für eine Art von Zelle“ dies ist, wird stärker, je tiefer man in das Modell geht.
- Krankheitsstatus: Zu wissen, ob eine Zelle krank ist, erreichte seinen Höhepunkt in den mittleren Schichten und verblasste dann, je tiefer das Modell wurde.
- Batch-Effekte: Die Modelle waren gut darin, technisches Rauschen (wie welches Gerät das Bild aufgenommen hat) in den frühen Schichten zu ignorieren, aber sie haben es nicht vollständig vergessen.
Das Fazit
Was ist also das Urteil? Biologische Large Language Models sind real, und sie besitzen eine geometrische Wissenskarte. Aber es ist keine saubere, geradlinige, perfekt organisierte Karte, wie wir sie in Sprachmodellen gesehen haben. Stattdessen ist es eine „teilweise linearisierte, niedrigdimensionale“ Karte.
Die Modelle sind großartig bei den einfachen Dingen (wie der Unterscheidung zwischen einer männlichen und einer weiblichen Zelle), aber für die schwierigen, klinisch wichtigen Dinge (wie Krankheit oder Entwicklung) ist das Wissen gekrümmt und verheddert. Das meiste der „geradlinigen“ Wissensbestände, die die Modelle haben, ist eigentlich das, was wir bereits mit einfachen, altbewährten mathematischen Werkzeugen erreichen könnten. Das neue Wissen, das die Modelle gelernt haben, ist vorhanden, aber es ist in den Kurven verborgen, was es schwieriger macht, es zu lesen und zu nutzen.
Die Studie kommt zu dem Schluss, dass diese Modelle zwar nützlich sind, aber nicht der magische „Geradlinigkeits-Durchbruch“ sind, auf den einige gehofft hatten. Die wahre Herausforderung für die Zukunft besteht nicht nur darin, größere Modelle zu bauen, sondern bessere Werkzeuge zu entwickeln, um die gekrümmten, gewundenen Pfade zu lesen, in denen die wichtigsten biologischen Geheimnisse tatsächlich verborgen liegen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.