CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification
CytoFormer est un nouveau modèle de fondation cellulaire qui exploite des données appariées d'histologie H&E et de transcriptomique spatiale provenant de 16 organes pour parvenir à une classification cellulaire précise, efficace en termes de labels et généralisable sans dépendre des annotations manuelles de pathologistes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de la médecine, la façon la plus courante d'observer l'intérieur du corps humain est de passer par un microscope, en examinant de fines coupes de tissus colorées avec des teintures roses et violettes. C'est la norme de soin pour diagnostiquer des maladies comme le cancer. Un pathologiste observe ces lames et identifie les différents types de cellules présents — qu'il s'agisse de tissus sains, de cellules immunitaires envahissantes ou de cellules tumorales rebelles. Cette inspection visuelle est puissante, mais elle est aussi lente, subjective et difficile à mettre à l'échelle. Compter des millions de cellules individuelles à l'œil nu est impossible, et même les experts peuvent être en désaccord sur la nature d'une cellule spécifique, surtout lorsque différents types de cellules se ressemblent presque de manière identique sous un microscope. Pendant des décennies, le rêve a été d'apprendre aux ordinateurs à effectuer ce comptage automatiquement, mais la construction d'un tel ordinateur est restée bloquée dans un goulot d'étranglement : il nécessite qu'un expert humain étiquette des millions de cellules à la main pour apprendre à la machine ce qu'elle doit chercher. Ce travail manuel est fastidieux, coûteux et souvent peu fiable, laissant le domaine sans assez de données de haute qualité pour entraîner de véritables systèmes intelligents.
Une équipe de chercheurs de l'Université de Pennsylvanie a trouvé un moyen de contourner entièrement ce goulot d'étranglement humain. Au lieu de demander aux pathologistes d'étiqueter les cellules, ils ont utilisé un autre type de carte biologique pour enseigner à l'ordinateur. Ils ont couplé les lames de tissus roses et violettes standards avec une technologie plus récente appelée transcriptomique spatiale, qui agit comme un scanner de codes-barres moléculaires. Ce scanner lit l'activité génétique à l'intérieur de chaque cellule individuelle pendant qu'elle est encore située dans le tissu. Comme le code génétique est unique à l'identité d'une cellule, il indique précisément aux chercheurs quel type de cellule ils observent, sans aucune supposition humaine. En faisant correspondre ces identités moléculaires aux images correspondantes sur les lames standard, l'équipe a créé un immense ensemble de données auto-supervisées. Ils ont utilisé cela pour entraîner un nouveau modèle d'intelligence artificielle appelé CytoFormer, qui a appris à reconnaître les types de cellules simplement en regardant la forme et la texture des cellules dans les images de microscopie de routine.
Le résultat est un système capable d'identifier les types de cellules avec un niveau de précision qui rivalise avec celui des experts humains, mais sans avoir besoin qu'un humain dessine le moindre cadre autour d'une cellule pendant l'entraînement. Les chercheurs ont assemblé des données provenant de 81 sections de tissus différentes couvrant 16 organes différents du corps humain, allant du sein et du poumon au cerveau et à la moelle osseuse. Au total, ils ont traité plus de 15 millions de cellules individuelles. Pour chaque cellule, l'ordinateur a appris à associer l'apparence visuelle dans l'image colorée avec l'identité moléculaire spécifique fournie par le scanner génétique. Cela a permis au modèle d'apprendre un langage universel des formes cellulaires qui fonctionne dans tout le corps. Lorsqu'il a été testé sur de nouvelles sections de tissus qu'il n'avait jamais vues auparavant, il a correctement identifié les types de cellules dans 85 % des cas en moyenne. Plus important encore, le modèle ne s'est pas contenté de compter les cellules ; il a reconstruit l'architecture entière du tissu, cartographiant correctement l'emplacement des tumeurs, des cellules immunitaires et des structures saines, reproduisant ainsi efficacement le paysage biologique de l'organe.
Ce qui rend cette découverte particulièrement significative est la capacité du modèle à transférer ses connaissances à de nouvelles situations. Les chercheurs ont testé si l'IA pouvait gérer des organes et des types de cellules qu'elle n'avait jamais rencontrés lors de son entraînement. Ils ont appliqué le modèle à quatre ensembles de données publics contenant des cellules d'organes comme le côlon et la peau, qui ne faisaient pas partie de l'ensemble d'entraînement original. Même sans avoir vu ces tissus spécifiques auparavant, le modèle a surpassé six autres systèmes d'intelligence artificielle de pointe qui avaient été entraînés sur des millions d'images étiquetées manuellement. Il s'est montré particulièrement efficace dans des scénarios difficiles où les cellules se ressemblent beaucoup, comme pour distinguer un tissu sain normal d'un tissu cancéreux qui le mime. Dans un test, le modèle a appris à repérer des cellules normales cachées parmi des cellules tumorales similaires en utilisant seulement quelques centaines d'exemples fournis par un humain, alors que d'autres systèmes nécessitaient beaucoup plus d'exemples pour atteindre le même niveau de précision. Cela suggère que le modèle a appris les règles visuelles fondamentales de l'apparence des cellules dans leur environnement, plutôt que de simplement mémoriser une liste de types de cellules spécifiques.
Les chercheurs ont également exploré la quantité de tissu environnant que l'ordinateur doit voir pour effectuer une identification correcte. Ils ont testé différentes tailles de fenêtres d'image autour de chaque cellule, d'une vue minuscule montrant juste la cellule elle-même à une vue large montrant tout le voisinage. Ils ont découvert que le modèle fonctionnait mieux lorsqu'il pouvait voir la cellule et ses voisins immédiats, mais pas l'ensemble de la section de tissu. Cet équilibre a permis à l'ordinateur de comprendre le contexte de la cellule — qu'elle soit située dans un vaisseau sanguin, une masse tumorale ou une glande saine — sans perdre les détails fins de la propre forme de la cellule. Cette taille de fenêtre spécifique, qui correspond à une vue très petite mais claire de la cellule, s'est avérée être le point optimal pour la précision.
En transformant les données moléculaires du scanner génétique en un outil d'enseignement pour la reconnaissance visuelle, l'équipe a créé une ressource réutilisable qui peut être appliquée à n'importe quelle lame de tissu de routine. Le modèle ne nécessite pas d'équipement coûteux pour fonctionner ; il peut analyser des lames standard qui sont déjà utilisées quotidiennement dans les hôpitaux. Les chercheurs ont mis le code et le modèle entraîné à la disposition de la communauté scientifique, permettant à d'autres d'utiliser cette nouvelle façon de voir les cellules. Bien que le modèle actuel regroupe certains types de cellules très similaires, comme différents types de cellules immunitaires, parce qu'elles se ressemblent, il représente une avancée majeure. Il prouve que nous pouvons construire des outils puissants pour l'analyse cellulaire sans dépendre du processus lent et coûteux de l'étiquetage manuel. Cette approche ouvre la voie à l'analyse de millions de cellules à travers des milliers de patients, transformant les lames de microscope de routine en cartes détaillées de l'activité cellulaire qui pourraient aider les médecins à diagnostiquer les maladies plus tôt et plus précisément.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.