← Nieuwste papers
🧬 biology

Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis

Deze empirische studie onthult dat hoewel biologische grote taalmodellen (SCFMs) een werkelijke, laagdimensionale en gedeeltelijk lineair gestructureerde geometrie voor biologische kennis coderen, deze structuur bescheiden is, vaak niet lineair verstrengeld is en grotendeels overlapt met wat klassieke expressiegebaseerde methoden zoals PCA al kunnen herstellen, waardoor het tekortschiet ten opzichte van de heldere, regelmatige geometrie die wordt waargenomen in natuurlijke taalmodellen.

Oorspronkelijke auteurs: Olivia Denvis

Gepubliceerd 2026-07-22
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Olivia Denvis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je voor dat je een gigantische, magische bibliotheek hebt waar elk boek een levende cel uit het menselijk lichaam is. Jarenlang hebben wetenschappers geprobeerd deze boeken te lezen om te begrijpen hoe onze lichamen werken, maar de tekst is rommelig en moeilijk te ontcijferen. Onlangs is er een nieuw soort "superlezer" uitgevonden, een Biological Large Language Model (of Biological LLM). Dit zijn computerprogramma's die getraind zijn op miljoenen cellulaire "boeken" om patronen te herkennen, net zoals het toetsenbord van je telefoon leert om het volgende woord te voorspellen dat je typt.

De grote vraag die wetenschappers zich hebben gesteld is: organiseren deze superlezers kennis op een nette, rechte manier? In reguliere taalmodellen (de modellen die essays schrijven of met je chatten) ontdekten onderzoekers dat ideeën als "koning" en "koningin" op een rechte lijn liggen, en dat tegenpolen slechts een eenvoudige stap van elkaar verwijderd zijn. Het is als een perfect georganiseerde kaart waar elk concept zijn eigen duidelijke straat heeft. Wetenschappers hoopten dat deze biologische superlezers ook zo'n nette, rechte kaart zouden hebben voor zaken als "gezond vs. ziek" of "groeiend vs. rustend". Als dat zo zou zijn, zouden we de denkwijze van de computer gemakkelijk kunnen bijsturen om ziektes of ontwikkeling te begrijpen. Maar, zoals we zo zullen zien, is de kaart in deze biologische modellen meer een kronkelend, heuvelachtig bospad dan een rechte stadsstraat.


De Kaart in de Machine: Een Bos, Geen Snelweg

In dit onderzoek besloot een onderzoeker genaamd Olivia Denvis een diepe duik te nemen in vier van deze biologische superlezers (genaamd scBERT, Geneformer, scGPT en UCE) om te zien of ze echt die nette, rechte organisatie hebben. Ze behandelde hen als ontdekkingsreizigers en stuurde hen de diepte in met een enorme dataset van 420.000 cellen met gedetailleerde aantekeningen over wat ze zijn, waar ze leven en wat ze doen. Vervolgens vergeleek ze de interne "kaarten" van de modellen met de klassieke, betrouwbare instrumenten die wetenschappers al decennia gebruiken, zoals eenvoudige wiskundige trucjes genaamd PCA.

Dit is wat ze vond: De modellen hebben wel een kaart, maar het is niet de strakke, rechte snelweg waar iedereen op hoopte.

1. De kaart is compact, maar overvol
Eerst controleerden de onderzoekers hoeveel ruimte de modellen gebruiken om informatie op te slaan. Stel je een enorme loods voor (de volledige omvang van het model) die 1.280 planken zou kunnen bevatten. De studie toonde aan dat de modellen eigenlijk slechts ongeveer 12 tot 26 planken gebruiken om hun kennis op te slaan. Dat is een zeer laag-dimensionale ruimte, wat goed is omdat het betekent dat de modellen efficiënt zijn. Echter, de ruimte is "anisotroop", wat een chique manier is om te zeggen dat het gevormd is als een lange, smalle kegel in plaats van een ronde bal. De kleinere modellen waren zelfs nog meer in deze smalle kegel geperst, wat suggereert dat ze een beetje "gepropt" kunnen zijn in hun denken.

2. Het makkelijke deel is recht, het moeilijke deel is krom
Wanneer de onderzoeker de modellen vroeg om eenvoudige dingen te identificeren, zoals "is deze cel van een man of een vrouw?" of "zit deze in het immuunsysteem?", waren de modellen verbazingweft goed. Ze konden een rechte lijn trekken om deze groepen te scheiden, net zoals de taalmodellen dat doen. Sterker nog, voor deze gemakkelijke categorieën waren de modellen bijna perfect.

Maar hier kwam de twist: Wanneer ze de modellen vroeg naar de interessante zaken — zoals "is deze cel ziek?" of "wat is het specifieke subtype?" of "hoe ver is deze cel in zijn ontwikkeling?" — stopten de rechte lijnen met werken. De kennis was er nog wel, maar het zat verstrengeld in krommingen.

  • Het bewijs: Toen de onderzoeker probeerde een eenvoudige rechte lijn te gebruiken om de ontwikkelingstijd van een cel te voorspellen, kreeg ze slechts ongeveer 61% van het antwoord goed. Maar toen ze de computer liet volgen van het natuurlijke, kromme pad van de data (zoals wandelen langs een kronkelend pad in plaats van dwars door een veld te snijden), sprong de nauwkeurigheid omhoog naar 80%.
  • De les: De modellen kennen de complexe zaken, maar ze slaan ze op op een kromme, niet-lineaire manier die eenvoudige rechte lijnen niet gemakkelijk kunnen bereiken. Dit is anders dan bij taalmodellen, waar zelfs complexe ideeën vaak op rechte lijnen liggen.

3. Het "stuurwiel" is een beetje wiebelig
In taalmodellen, als je de betekenis van een woord wilt veranderen (zoals "blij" veranderen in "verdrietig"), kun je er gewoon een specifieke vector (een richting) aan toevoegen en het werkt perfect. De onderzoeker probeerde dit met de biologische modellen. Ze probeerde de identiteit van een cel te "sturen" door een richtingvector toe te voegen.

  • Het resultaat: Het werkte, maar slechts in 54% tot 66% van de gevallen. Het was beter dan een kop-of-munt, maar ver verwijderd van de perfecte controle die men in taalmodellen ziet. Soms veranderde het proberen te veranderen van één ding per ongeluk ook iets anders. De richtingen voor verschillende ideeën waren enigszins parallel, maar niet perfect zo, en ze waren slechts zwak uitgelijnd.

4. De modellen zijn het met elkaar eens, niet met de "waarheid"
De onderzoeker controleerde ook of alle vier de modellen op dezelfde manier denken. Ze waren matig vergelijkbaar met elkaar (ongeveer 55% tot 74% vergelijkbaar), wat positief is. Maar toen ze ze vergeleek met de "Gouden Standaard" van biologische kennis (een gedetailleerde kaart van hoe celtypen in de echte wereld aan elkaar gerelateerd zijn), waren de modellen slechts voor ongeveer 36% tot 45% vergelijkbaar.

  • De verrassing: De modellen leken eigenlijk meer op de klassieke wiskundige instrumenten (PCA) dan op de echte biologische waarheid. Ze kwamen samen in een gedeeld, vereenvoudigd beeld van de data dat dichter bij de basiswiskunde lag dan bij de complexe biologische realiteit.

5. De "diepe" kennis zit in het midden
Ten slotte keek ze naar waar in de lagen van het model (het "brein") deze kennis zich bevond.

  • Eenvoudige identiteit: Weten "wat voor soort cel" dit is, wordt sterker naarmate je dieper in het model komt.
  • Ziektestatus: Weten of een cel ziek is, piekte in de middelste lagen en vervaagde naarmate het model dieper werd.
  • Batch-effecten: De modellen waren goed in het negeren van technische ruis (zoals welk apparaat de foto heeft gemaakt) in de vroege lagen, maar ze vergaten het niet volledig.

De Conclusie

Dus, wat is het eindoordeel? Biologische Large Language Models zijn echt, en ze bevatten inderdaad een geometrische kaart van kennis. Maar het is geen schone, rechte kaart met een perfecte organisatie zoals we die in taalmodellen zagen. In plaats daarvan is het een "gedeeltelijk lineaire, laag-dimensionale" kaart.

De modellen zijn geweldig in het makkelijke werk (zoals het onderscheiden van een mannelijke cel van een vrouwelijke), maar voor het moeilijke, klinisch belangrijke werk (zoals ziekte of ontwikkeling), is de kennis gekromd en verstrengeld. Veel van de "rechte-lijn"-kennis die de modellen bezitten, is eigenlijk gewoon wat we al konden krijgen met eenvoudige, klassieke wiskundige instrumenten. Het nieuwe dat de modellen hebben geleerd, is er wel, maar het is verborgen in de krommingen, waardoor het moeilijker te lezen en te gebruiken is.

De studie concludeert dat hoewel deze modellen nuttig zijn, ze niet de magische "rechte-lijn" doorbraak zijn waar sommigen op hoopten. De echte uitdaging voor de toekomst is niet alleen het bouwen van grotere modellen, maar het bouwen van betere instrumenten om de kromme, kronkelende paden te lezen waar de belangrijkste biologische geheimen zich daadwerkelijk verschuilen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →