← Últimos artículos
💻 computer science

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

CytoFormer es un novedoso modelo fundacional de células que aprovecha datos pareados de histología H&E y transcriptómica espacial de 16 órganos para lograr una clasificación celular precisa, eficiente en etiquetas y generalizable sin depender de anotaciones manuales de patólogos.

Autores originales: Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la medicina, la forma más común de mirar dentro del cuerpo humano es a través de un microscopio, examinando cortes finos de tejido teñidos con colorantes rosas y púrpuras. Este es el estándar de atención para diagnosticar enfermedades como el cáncer. Un patólogo observa estas láminas e identifica los diferentes tipos de células presentes: si se trata de tejido sano, células inmunitarias invasoras o células tumorales rebeldes. Esta inspección visual es poderosa, pero también es lenta, subjetiva y difícil de escalar. Contar millones de células individuales a ojo es imposible, e incluso los expertos pueden discrepar sobre qué es una célula específica, especialmente cuando diferentes tipos de células se ven casi idénticas bajo un microscopio. Durante décadas, el sueño ha sido enseñar a las computadoras a hacer este conteo automáticamente, pero la construcción de tal computadora se ha quedado estancada en un cuello de botella: requiere que un experto humano etiquete millones de células a mano para enseñarle a la máquina qué es lo que debe buscar. Este trabajo manual es tedioso, costoso y, a menudo, poco fiable, dejando al campo sin suficientes datos de alta calidad para entrenar sistemas verdaderamente inteligentes.

Un equipo de investigadores de la Universidad de Pensilvania ha encontrado una manera de evitar este cuello de botella humano por completo. En lugar de pedir a los patólogos que etiqueten las células, utilizaron un tipo diferente de mapa biológico para enseñar a la computadora. Emparejaron las láminas de tejido estándar de color rosa y púrpura con una tecnología más nueva llamada transcriptómica espacial, que actúa como un escáner de códigos de barras moleculares. Este escáner lee la actividad genética dentro de cada célula individual mientras todavía está sentada en el tejido. Debido a que el código genético es único para la identidad de una célula, este le dice a los investigadores exactamente qué tipo de célula están observando, sin necesidad de que un humano adivine. Al emparejar estas identidades moleculares con las imágenes correspondientes en las láminas estándar, el equipo creó un enorme conjunto de datos autosupervisado. Utilizaron esto para entrenar un nuevo modelo de inteligencia artificial llamado CytoFormer, el cual aprendió a reconocer tipos de células simplemente observando la forma y la textura de las células en las imágenes de rutina del microscopio.

El resultado es un sistema que puede identificar tipos de células con un nivel de precisión que rivaliza con el de los expertos humanos, pero sin necesidad de que un humano dibuje un solo cuadro alrededor de una célula durante el entrenamiento. Los investigadores ensamblaron datos de 81 secciones de tejido diferentes que cubrían 16 órganos distintos del cuerpo humano, que van desde el seno y el pulmón hasta el cerebro y la médula ósea. En total, procesaron más de 15 millones de células individuales. Para cada célula, la computadora aprendió a asociar la apariencia visual en la imagen teñida con la identidad molecular específica proporcionada por el escáner genético. Esto permitió al modelo aprender un lenguaje universal de formas celulares que funciona en todo el cuerpo. Cuando se probó en nuevas secciones de tejido que el modelo nunca había visto antes, identificó correctamente los tipos de células en un promedio del 85 por ciento de los casos. Más importante aún, el modelo no solo contó células; reconstruyó toda la arquitectura del tejido, mapeando correctamente dónde se encontraban los tumores, las células inmunitarias y las estructuras sanas, reproduciendo efectivamente el paisaje biológico del órgano.

Lo que hace que este descubrimiento sea particularmente significativo es lo bien que el modelo transfiere su conocimiento a nuevas situaciones. Los investigadores probaron si la IA podía manejar órganos y tipos de células que no había encontrado durante su entrenamiento. Aplicaron el modelo a cuatro conjuntos de datos públicos que contenían células de órganos como el colon y la piel, que no formaban parte del entrenamiento original. Incluso sin haber visto estos tejidos específicos antes, el modelo superó a otros seis sistemas de inteligencia artificial líderes que habían sido entrenados con millones de imágenes etiquetadas manualmente. Fue especialmente efectivo en escenarios difíciles donde las células se ven muy similares, como distinguir entre tejido sano normal y tejido canceroso que lo imita. En una prueba, el modelo aprendió a detectar células normales ocultas entre células tumorales de apariencia similar utilizando solo unos pocos cientos de ejemplos proporcionados por un humano, mientras que otros sistemas requirieron muchos más ejemplos para alcanzar el mismo nivel de precisión. Esto sugiere que el modelo aprendió las reglas visuales fundamentales de cómo lucen las células en su entorno, en lugar de simplemente memorizar una lista de tipos de células específicos.

Los investigadores también exploraron cuánto tejido circundante necesita la computadora para realizar una identificación correcta. Probaron diferentes tamaños de la ventana de imagen alrededor de cada célula, desde una vista diminuta que muestra solo la célula misma hasta una vista amplia que muestra todo el vecindario. Descubrieron que el modelo funcionaba mejor cuando podía ver la célula y sus vecinos inmediatos, pero no la sección de tejido completa. Este equilibrio permitió a la computadora comprender el contexto de la célula —si estaba sentada en un vaso sanguíneo, en una masa tumoral o en una glándula sana— sin perder los detalles finos de la propia forma de la célula. Este tamaño de ventana específico, que corresponde a una vista muy pequeña pero clara de la célula, demostró ser el punto óptimo para la precisión.

Al convertir los datos moleculares del escáner genético en una herramienta de enseñanza para el reconocimiento visual, el equipo ha creado un recurso reutilizable que puede aplicarse a cualquier lámina de tejido de rutina. El modelo no requiere equipo nuevo y costoso para funcionar; puede analizar láminas estándar que ya se utilizan en los hospitales todos los días. Los investigadores han puesto el código y el modelo entrenado a disposición de la comunidad científica, permitiendo que otros utilicen esta nueva forma de ver las células. Si bien el modelo actual agrupa algunas células muy similares, como diferentes tipos de células inmunitarias, debido a que se ven parecidas, representa un gran paso adelante. Demuestra que podemos construir herramientas poderosas para el análisis celular sin depender del proceso lento y costoso del etiquetado manual. Este enfoque abre la puerta al análisis de millones de células a través de miles de pacientes, convirtiendo las láminas de microscopio de rutina en mapas detallados de la actividad celular que podrían ayudar a los médicos a diagnosticar enfermedades de manera más temprana y precisa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →