← Nieuwste papers
💻 computer science

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

CytoFormer is een nieuw cel-fundatiemodel dat gepaard gaande H&E-histologie en ruimtelijke transcriptomica-data van 16 organen benut om nauwkeurige, label-efficiënte en generaliseerbare celclassificatie te bereiken zonder afhankelijk te zijn van handmatige patholoogannotaties.

Oorspronkelijke auteurs: Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van de geneeskunde is de meest voorkomende manier om in het menselijk lichaam te kijken via een microscoop, waarbij dunne plakjes weefsel worden onderzocht die zijn gekleurd met roze en paarse kleurstoffen. Dit is de standaardzorg voor het diagnosticeren van ziekten zoals kanker. Een patholoog kijkt naar deze dia's en identificeert de verschillende soorten cellen die aanwezig zijn—of het nu gaat om gezond weefsel, binnendringende immuuncellen of kwaadaardige tumorcellen. Deze visuele inspectie is krachtig, maar het is ook traag, subjectief en moeilijk schaalbaar. Het tellen van miljoenen individuele cellen met het blote oog is onmogelijk, en zelfs experts kunnen het oneens zijn over wat een specifieke cel is, vooral wanneer verschillende celtypen onder een microscoop bijna identiek aan elkaar lijken. Decennialang was de droom om computers te leren dit tellen automatisch te doen, maar het bouwen van een dergelijke computer liep vast in een bottleneck: het vereist een menselijke expert om miljoenen cellen handmatig te labelen om de machine te leren waar hij naar moet zoeken. Dit handmatige werk is tijdrovend, duur en vaak onbetrouwbaar, waardoor het veld zonder voldoende hoogwaardige data kwam te zitten om werkelijk intelligente systemen te trainen.

Een team onderzoekers aan de Universiteit van Pennsylvania heeft een manier gevonden om deze menselijke bottleneck volledig te omzeilen. In plaats van pathologen te vragen om cellen te labelen, gebruikten ze een ander soort biologische kaart om de computer te onderwijzen. Ze koppelden de standaard roze-en-paarse weefselsneden aan een nieuwere technologie genaamd ruimtelijke transcriptomics, die fungeert als een moleculaire barcode-scanner. Deze scanner leest de genetische activiteit binnen elke individuele cel terwijl deze nog in het weefsel zit. Omdat de genetische code uniek is voor de identiteit van een cel, vertelt het de onderzoekers precies welk type cel ze bekijken, zonder dat er menselijke gissingen aan te pas komen. Door deze moleculaire identiteiten te koppelen aan de overeenkomstige afbeeldingen op de standaarddia's, creëerde het team een enorme, zelfgesuperviseerde dataset. Ze gebruikten deze om een nieuw kunstmatig intelligentie-model genaamd CytoFormer te trainen, dat leerde celtypen te herkennen door enkel te kijken naar de vorm en textuur van de cellen in de routinematige microscoopbeelden.

Het resultaat is een systeem dat celtypen kan identificeren met een nauwkeurigheid die die van menselijke experts evenaart, maar zonder dat er een mens een enkel kader rond een cel hoeft te tekenen tijdens de training. De onderzoekers stelden data samen van 81 verschillende weefselsecties die 16 verschillende organen in het menselijk lichaam beslaan, variërend van de borst en de long tot de hersenen en het beenmerg. In totaal verwerkten ze meer dan 15 miljoen individuele cellen. Voor elke cel leerde de computer de visuele verschijning in het gekleurde beeld te associëren met de specifieke moleculaire identiteit die door de genetische scanner werd geleverd. Dit stelde het model in staat om een universele taal van celvormen te leren die werkt over het hele lichaam. Wanneer het werd getest op nieuwe weefselsecties die het model nog nooit eerder had gezien, identificeerde het de celtypen in gemiddeld 85 procent van de gevallen correct. Nog belangrijker is dat het model niet alleen cellen telde; het reconstrueerde de volledige architectuur van het weefsel, waarbij het correct in kaart bracht waar tumoren, immuuncellen en gezonde structuren zich bevonden, en daarmee effectief het biologische landschap van het orgaan reproduceerde.

Wat deze ontdekking bijzonder significant maakt, is hoe goed het model zijn kennis overdraagt naar nieuwe situaties. De onderzoekers testten of de AI kon omgaan met organen en celtypen die het tijdens de training nooit was tegengekomen. Ze pasten het model toe op vier verschillende publieke datasets met cellen uit organen zoals de dikke darm en de huid, die geen deel uitmaakten van de oorspronkelijke trainingsset. Zelfs zonder deze specifieke weefsels eerder te hebben gezien, presteerde het model beter dan zes andere vooraanstaande kunstmatige intelligentiesystemen die waren getraind op miljoenen handmatig gelabelde afbeeldingen. Het was vooral effectief in moeilijke scenario's waarin cellen erg op elkaar lijken, zoals het onderscheiden tussen normale gezonde weefsels en kankercellen die het nabootsen. In één test slaagde het model erin om normale cellen te spotten die verborgen waren tussen look-alike tumorcellen met behulp van slechts een paar honderd door een mens verstrekte voorbeelden, terwijl andere systemen veel meer voorbeelden nodig hadden om hetzelfde nauwkeurigheidsniveau te bereiken. Dit suggereert dat het model de fundamentele visuele regels heeft geleerd van hoe cellen er in hun omgeving uitzien, in plaats van enkel een lijst met specifieke celtypen te memoriseren.

De onderzoekers onderzochten ook hoeveel van het omliggende weefsel de computer moet zien om een correcte identificatie te maken. Ze testten verschillende groottes van het beeldvenster rond elke cel, van een minuscuul uitzicht dat enkel de cel zelf laat zien tot een groot uitzicht dat de hele buurt toont. Ze kwamen tot de conclusie dat het model het beste werkte wanneer het de cel en zijn directe buren kon zien, maar niet de gehele weefselsectie. Deze balans stelde de computer in staat om de context van de cel te begrijpen—of deze zich in een bloedvat, een tumormassa of een gezond klierweefsel bevond—zonder de fijne details van de eigen vorm van de cel te verliezen. Dit specifieke vensterformaat, dat overeenkomt met een zeer klein maar duidelijk uitzicht op de cel, bleek het ideale punt voor nauwkeurigheid te zijn.

Door de moleculaire data van de genetische scanner om te zetten in een hulpmiddel voor visuele herkenning, heeft het team een herbruikbare bron gecreëerd die kan worden toegepast op elke routinematige weefselsnede. Het model heeft geen dure nieuwe apparatuur nodig om te draaien; het kan standaard dia's analyseren die dagelijks al in ziekenhuizen worden gebruikt. De onderzoekers hebben de code en het getrainde model beschikbaar gesteld aan de wetenschappelijke gemeenschap, zodat anderen deze nieuwe manier van cellen zien kunnen gebruiken. Hoewel het huidige model sommige zeer gelijkaardige cellen bij elkaar groepeert, zoals verschillende typen immuuncellen, omdat ze op elkaar lijken, vertegenwoordigt het een grote stap voorwaarts. Het bewijst dat we krachtige instrumenten voor cellulaire analyse kunnen bouwen zonder te vertrouwen op het trage en dure proces van handmatige labeling. Deze aanpak opent de deur naar het analyseren van miljoenen cellen over duizenden patiënten, waardoor routinematige microscoopdia's worden omgevormd tot gedetailleerde kaarten van cellulaire activiteit die artsen kunnen helpen ziekten eerder en nauwkeuriger te diagnosticeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →