CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification
CytoFormer è un nuovo modello di fondazione cellulare che sfrutta dati accoppiati di istologia H&E e trascrittomica spaziale da 16 organi per ottenere una classificazione cellulare accurata, efficiente in termini di etichette e generalizzabile senza fare affidamento su annotazioni manuali dei patologi.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel mondo della medicina, il modo più comune per guardare all'interno del corpo umano è attraverso un microscopio, esaminando sottili sezioni di tessuto colorate con coloranti rosa e viola. Questo è lo standard di cura per la diagnosi di malattie come il cancro. Un patologo osserva queste slide e identifica i diversi tipi di cellule presenti: se si tratti di tessuto sano, di cellule immunitarie infiltranti o di cellule tumorali rogue. Questa ispezione visiva è potente, ma è anche lenta, soggettiva e difficile da scalare. Contare milioni di singole cellule a occhio nudo è impossibile, e persino gli esperti possono dissentire su cosa sia una specifica cellula, specialmente quando diversi tipi cellulari appaiono quasi identici sotto un microscopio. Per decenni, il sogno è stato quello di insegnare ai computer di fare questo conteggio automaticamente, ma la costruzione di un simile computer è rimasta bloccata in un collo di bottiglia: richiede che un esperto umano etichetti a mano milioni di cellule per insegnare alla macchina cosa cercare. Questo lavoro manuale è tedioso, costoso e spesso inaffidabile, lasciando il campo privo di abbastanza dati di alta qualità per addestrare sistemi veramente intelligenti.
Un team di ricercatori dell'Università della Pennsylvania ha trovato un modo per aggirare completamente questo collo di bottiglia umano. Inveve di chiedere ai patologi di etichettare le cellule, hanno utilizzato un tipo diverso di mappa biologica per insegnare al computer. Hanno accoppiato le classiche slide di tessuto rosa e viola con una tecnologia più recente chiamata trascrittomica spaziale, che funge da scanner di codici a barre molecolari. Questo scanner legge l'attività genetica all'interno di ogni singola cellula mentre questa si trova ancora nel tessuto. Poiché il codice genetico è unico per l'identità di una cellula, esso dice ai ricercatori esattamente quale tipo di cellula stanno osservando, senza alcuna supposizione umana. Combinando queste identità molecolari con le corrispondenti immagini delle slide standard, il team ha creato un enorme dataset auto-supervisionato. Hanno utilizzato questo per addestrare un nuovo modello di intelligenza artificiale chiamato CytoFormer, che ha imparato a riconoscere i tipi cellulari semplicemente guardando la forma e la trama delle cellule nelle immagini di routine al microscopio.
Il risultato è un sistema in grado di identificare i tipi cellulari con un livello di accuratezza che rivaleggia con quello degli esperti umani, ma senza che un essere umano debba disegnare un singolo riquadro attorno a una cellula durante l'addestramento. I ricercatori hanno assemblato dati da 81 diverse sezioni di tessuto che coprono 16 diversi organi del corpo umano, dalla mammella e il polmone al cervello e al midollo osseo. In totale, hanno elaborato più di 15 milioni di singole cellule. Per ogni cellula, il computer ha imparato ad associare l'aspetto visivo nell'immagine colorata con la specifica identità molecolare fornita dallo scanner genetico. Ciò ha permesso al modello di apprendere un linguaggio universale delle forme cellulari che funziona in tutto il corpo. Quando testato su nuove sezioni di tessuto che il modello non aveva mai visto prima, ha identificato correttamente i tipi cellulari nell'85 percento dei casi mediamente. Ancora più importante, il modello non si è limitato a contare le cellule; ha ricostruito l'intera architettura del tessuto, mappando correttamente dove si trovavano tumori, cellule immunitarie e strutture sane, riproducendo efficacementamente il paesaggio biologico dell'organo.
Ciò che rende questa scoperta particolarmente significativa è quanto bene il modello trasferisca la sua conoscenza a nuove situazioni. I ricercatori hanno testato se l'IA potesse gestire organi e tipi cellulari che non aveva mai incontrato durante l'addestramento. Hanno applicato il modello a quattro diversi dataset pubblici contenenti cellule di organi come il colon e la pelle, che non facevano parte del set di addestramento originale. Anche senza aver visto in precedenza questi specifici tessuti, il modello ha superato altri sei sistemi di intelligenza artificiale leader che erano stati addestrati su milioni di immagini etichettate manualmente. È stato particolarmente efficace in scenari difficili in cui le cellule appaiono molto simili, come distinguere tra tessuto sano normale e tessuto canceroso che lo imita. In un test, il modello ha imparato a individuare cellule normali nascoste tra cellule tumorali simili utilizzando solo poche centinaia di esempi forniti da un essere umano, mentre altri sistemi richiedevano molti più esempi per raggiungere lo stesso livello di accuratezza. Ciò suggerisce che il modello abbia appreso le regole visive fondamentali di come le cellule appaiono nel loro ambiente, piuttosto che limitarsi a memorizzare una lista di tipi cellulari specifici.
I ricercatori hanno anche esplorato quanto del tessuto circostante il computer debba vedere per effettuare un'identificazione corretta. Hanno testato diverse dimensioni della finestra d'immagine attorno a ciascuna cellula, da una vista minuscola che mostrava solo la cellula stessa a una vista ampia che mostrava l'intero vicinato. Hanno scoperto che il modello funzionava meglio quando poteva vedere la cellula e i suoi vicini immediati, ma non l'intera sezione di tessuto. Questo equilibrio ha permesso al computer di comprendere il contesto della cellula — se si trovasse in un vaso sanguigno, in una massa tumorale o in una ghiandola sana — senza perdere i dettagli fini della forma della cellula stessa. Questa dimensione specifica della finestra, che corrisponde a una vista molto piccola ma chiara della cellula, si è rivelata il punto ottimale per l'accuratezza.
Trasformando i dati molecolari dello scanner genetico in uno strumento di insegnamento per il riconoscimento visivo, il team ha creato una risorsa riutilizzabile che può essere applicata a qualsiasi slide di tessuto di routine. Il modello non richiede l'uso di attrezzature costose; può analizzare le slide standard che vengono già utilizzate ogni giorno negli ospedali. I ricercatori hanno reso disponibili il codice e il modello addestrato alla comunità scientifica, permettendo ad altri di utilizzare questo nuovo modo di vedere le cellule. Sebbene l'attuale modello raggruppi alcune cellule molto simili, come diversi tipi di cellule immunitarie, perché appaiono simili, esso rappresenta un grande passo avanti. Dimostra che possiamo costruire strumenti potenti per l'analisi cellulare senza fare affidamento sul processo lento ed costoso dell'etichettatura manuale. Questo approccio apre la porta all'analisi di milioni di cellule attraverso migliaia di pazienti, trasformando le comuni slide al microscopio in mappe dettagliate dell'attività cellulare che potrebbero aiutare i medici a diagnosticare le malattie in modo più precoce e accurato.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.