spaGFM is a scalable graph foundation model for spatial transcriptomics analyses
L'article présente spaGFM, un modèle de fondation sur graphes évolutif qui exploite les marches aléatoires et l'apprentissage auto-supervisé pour générer des représentations robustes et transférables de données de transcriptomique spatiale, permettant l'analyse de l'organisation tissulaire complexe et des conséquences fonctionnelles à travers divers contextes biologiques.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
La biologie s'est longtemps appuyée sur l'examen au microscope d'un fragment de tissu pour compter les cellules qu'elle y voit, mais cette approche passe souvent à côté de l'essentiel. Une cellule isolée n'existe pas dans le vide ; son comportement est dicté par la compagnie qu'elle fréquente. Dans un organe vivant, la fonction d'une cellule change selon qu'elle se trouve à côté d'une voisine qui combat une infection ou d'une autre qui répare discrètement des dommages. Pour comprendre comment les tissus fonctionnent, et pourquoi ils tombent malades, les scientifiques doivent voir non seulement les acteurs individuels, mais aussi les quartiers complexes et changeants qu'ils forment. Ces dernières années, une nouvelle technologie appelée transcriptomique spatiale a rendu cela possible en cartographiant précisément où chaque gène est activé au sein d'un échantillon de tissu, préservant ainsi la carte du quartier aux côtés de la liste de ses résidents. Cependant, ces cartes deviennent si vastes et détaillées qu'elles sont difficiles à lire pour les ordinateurs. Les données ne sont pas une simple liste de mots ou une ligne droite de code ; c'est un réseau complexe de connexions, où la distance et la relation entre les cellules comptent plus que les cellules elles-mêmes.
Une équipe de chercheurs a introduit un nouvel outil appelé spaGFM, conçu pour donner du sens à ces quartiers cellulaires complexes. Considérez cela comme un système qui apprend à lire l'histoire d'un tissu en traçant les chemins entre ses cellules, plutôt qu'en les observant de manière isolée. Les chercheurs ont entraîné ce système sur une collection massive de données, lui fournissant des informations provenant de 132 échantillons de tissus différents contenant près de 44 millions de cellules. Ces échantillons provenaient de diverses parties du corps humain et de la souris, notamment du poumon, du foie et du cerveau, et ont été capturés à l'aide de différentes machines d'imagerie haute résolution. En étudiant cette immense bibliothèque, le système a appris à reconnaître les schémas de la façon dont les cellules s'organisent en groupes fonctionnels. Il y parvient en traitant le tissu comme une carte de points connectés, où chaque point est une cellule. Au lieu d'essayer de traiter toute la carte à la fois, le système effectue des « marches » à travers la carte, sautant d'une cellule à sa voisine, puis de cette voisine à la suivante. Il enregistre ces voyages sous la forme d'une séquence d'étapes, ce qui lui permet de comprendre l'environnement local de n'importe quelle cellule donnée, de ses environs immédiats jusqu'au quartier plus large qu'elle habite.
La puissance de cette approche a été testée face à trois défis biologiques très différents, chacun révélant la capacité du système à appliquer ce qu'il a appris à de nouvelles situations. Premièrement, les chercheurs ont demandé si le système pouvait trouver des structures immunitelles spécifiques connues sous le nom de structures lymphoïdes tertiaires. Ce sont de petits amas organisés de cellules immunitaires qui se forment dans les tissus lors d'inflammations chroniques ou de cancers, et leur présence prédit souvent la réponse d'un patient à un traitement. Les identifier est notoirement difficile, surtout dans les données d'imagerie plus anciennes et à plus basse résolution où les limites entre les cellules sont floues. Le système, ayant été entraîné uniquement sur des images à haute résolution, a réussi à localiser ces structures dans des données à plus basse résolution provenant d'échantillons de cancer du poumon et du rein. Il y est parvenu sans avoir besoin d'être réentraîné sur les nouvelles données, simplement en reconnaissant les motifs spatiaux qu'il avait appris précédemment. Les résultats ont montré que le système pouvait distinguer ces amas immunitaires du tissu tumoral environnant avec plus de précision que les méthodes précédentes, même lorsque les données provenaient d'un type de machine complètement différent.
Ensuite, l'équipe a exploré comment le système comprenait l'influence de l'environnement immunitaire sur les cellules cancéreuses. Dans une étude impliquant des expériences génétiques sur des tumeurs de souris, les chercheurs avaient déjà modifié des gènes spécifiques dans les cellules cancéreuses pour voir comment elles réagissaient. La question était de savoir si la réaction d'une cellule cancéreuse dépendait de sa proximité avec une cellule T, un type de cellule immunitaire. Le système a été capable d'examiner les changements génétiques dans les cellules cancéreuses et de prédire correctement lesquelles étaient proches des cellules T et lesquelles en étaient éloignées, simplement en analysant les schémas de leur activité génique. Plus important encore, il pouvait prédire comment une cellule cancéreuse réagirait à un changement génétique qu'il n'avait jamais vu auparavant, mais seulement si cette réaction dépendait de sa proximité avec une cellule immunitaire. Cela suggère que le système avait véritablement appris les règles de communication entre les cellules et leurs voisines, plutôt que de simplement mémoriser une liste de comportements géniques.
Enfin, les chercheurs ont appliqué l'outil à une biopsie rénale humaine provenant d'un patient atteint de néphropathie diabétique. Dans cette pathologie, les unités de filtration minuscules du rein, appelées glomérules, deviennent endommagées et cicatrisées. Les pathologistes évaluent ce dommage de léger à sévère, mais le faire à l'œil nu est difficile et subjectif. Le système a pu examiner le tissu et regrouper automatiquement les cellules dans les bonnes catégories de dommages, correspondant aux grades attribués par des experts humains. Il a même identifié de nouvelles zones qui semblaient être des glomérules endommagés mais qui avaient été manquées par l'examen humain initial, lesquelles ont été confirmées plus tard par la présence de marqueurs moléculaires spécifiques. Le système a également révélé qu'à mesure que les dommages s'aggravaient, la composition du quartier changeait de manière prévisible, certaines cellules protectrices disparaissant pour laisser la place à d'autres.
La portée de ce travail réside dans sa capacité de mise à l'échelle. Les méthodes précédentes pour analyser ces cartes cellulaires éprouvaient souvent des difficultés lorsque les données devenaient trop volumineuses ou complexes, étant freinées par le nombre considérable de connexions. Cette nouvelle approche contourne ces limites en convertissant le réseau complexe de connexions cellule-cellule en un format que les ordinateurs modernes peuvent traiter efficacement. Elle permet aux scientifiques d'apprendre des règles générales sur la façon dont les tissus se construisent et dont ils se dégradent, des règles qui restent vraies à travers différents organes et différentes maladies. Bien que le système ne soit pas une solution miracle remplaçant les experts humains, il offre une nouvelle lentille puissante pour observer le monde microscopique. Il transforme le désordre chaotique de milliards de cellules en un récit organisé et lisible, offrant une voie plus claire vers la compréhension des principes fondamentaux de la vie et de la maladie.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.