CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification
CytoFormer एक नवीन सेल फाउंडेशन मॉडल है जो 16 अंगों के युग्मित H&E हिस्टोलॉजी और स्थानिक ट्रांसक्रिप्टोमिक्स डेटा का लाभ उठाकर मैनुअल पैथोलॉजिस्ट एनोटेशन पर निर्भर किए बिना सटीक, लेबल-कुशल और सामान्यीकरण योग्य सेल वर्गीकरण प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
चिकित्सा जगत में, मानव शरीर के भीतर देखने का सबसे आम तरीका सूक्ष्मदर्शी (माइक्रोस्कोप) के माध्यम से है, जिसमें गुलाबी और बैंगनी रंगों से रंगे ऊतकों (टिश्यू) की पतली परतों का परीक्षण किया जाता है। कैंसर जैसी बीमारियों के निदान के लिए यह मानक प्रक्रिया है। एक रोगविज्ञानी (पैथोलॉजिस्ट) इन स्लाइड्स को देखता है और मौजूद विभिन्न प्रकार की कोशिकाओं की पहचान करता है—चाहे वे स्वस्थ ऊतक हों, हमलावर प्रतिरक्षा कोशिकाएं हों, या अनियमानक ट्यूमर कोशिकाएं। यह दृश्य निरीक्षण शक्तिशाली है, लेकिन यह धीमा, व्यक्तिपरक और विस्तार करने में कठिन भी है। आंखों से लाखों व्यक्तिगत कोशिकाओं को गिनना असंभव है, और विशेषज्ञों के बीच भी इस बात पर असहमति हो सकती है कि एक विशिष्ट कोशिका क्या है, विशेष रूप से तब जब सूक्ष्मदर्शी के नीचे अलग-अलग कोशिका प्रकार लगभग एक जैसे दिखते हैं। दशकों से, कंप्यूटर को यह गणना स्वचालित रूप से करने के लिए सिखाने का सपना देखा गया है, लेकिन ऐसा कंप्यूटर बनाने में एक बाधा बनी हुई है: इसके लिए मशीन को यह सिखाने के लिए कि क्या देखना है, एक मानव विशेषज्ञ को लाखों कोशिकाओं को हाथ से लेबल करना पड़ता है। यह मैन्युअल कार्य उबाऊ, महंगा और अक्सर अविश्वसनीय होता है, जिससे यह क्षेत्र वास्तव में बुद्धिमान प्रणालियों को प्रशिक्षित करने के लिए पर्याप्त उच्च गुणवत्ता वाले डेटा के बिना रह गया है।
पेंसिल्वेनिया विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस मानवीय बाधा को पूरी तरह से पार करने का एक तरीका खोज लिया है। पैथोलॉजिस्टों से कोशिकाओं को लेबल करने के लिए कहने के बजाय, उन्होंने कंप्यूटर को सिखाने के लिए एक अलग प्रकार के जैविक मानचित्र का उपयोग किया। उन्होंने मानक गुलाबी-और-बैंगनी ऊतक स्लाइड्स को एक नई तकनीक के साथ जोड़ा जिसे 'स्पेशियल ट्रांसक्रिप्टोमिक्स' कहा जाता है, जो एक आणविक बारकोड स्कैनर की तरह कार्य करती है। यह स्कैनर ऊतक के भीतर बैठे प्रत्येक व्यक्तिगत कोशिका के भीतर की आनुवंशिक गतिविधि को पढ़ता है। चूंकि आनुवंशिक कोड कोशिका की पहचान के लिए अद्वितीय होता है, इसलिए यह शोधकर्ताओं को सटीक रूप से बताता है कि वे किस प्रकार की कोशिका देख रहे हैं, जिसमें किसी मानवीय अनुमान की आवश्यकता नहीं होती। इन आणविक पहचानों को मानक स्लाइड्स पर संबंधित छवियों के साथ मिलाकर, टीम ने एक विशाल, स्व-पर्यवेक्षित (सेल्फ-सुपरवाइज्ड) डेटासेट बनाया। उन्होंने इसका उपयोग 'साइटोफॉर्मर' (CytoFormer) नामक एक नए कृत्रिम बुद्धिमत्ता मॉडल को प्रशिक्षित करने के लिए किया, जिसने नियमित सूक्ष्मदर्शी छवियों में कोशिकाओं के आकार और बनावट को देखकर कोशिकाओं को पहचानना सीख लिया।
परिणामस्वरूप, एक ऐसी प्रणाली प्राप्त हुई है जो मानव विशेषज्ञों के समान सटीकता के साथ कोशिका प्रकारों की पहचान कर सकती है, लेकिन इसके प्रशिक्षण के दौरान किसी भी इंसान को एक भी बॉक्स खींचने की आवश्यकता नहीं पड़ी। शोधकर्ताओं ने मानव शरीर के 16 विभिन्न अंगों (स्तन और फेफड़े से लेकर मस्तिष्क और अस्थि मज्जा तक) के 81 विभिन्न ऊतक खंडों से डेटा एकत्र किया। कुल मिलाकर, उन्होंने 15 मिलियन से अधिक व्यक्तिगत कोशिकाओं को संसाधित किया। प्रत्येक कोशिका के लिए, कंप्यूटर ने रंगे हुए चित्र में दिखने वाले दृश्य स्वरूप को आनुवंशिक स्कैनर द्वारा प्रदान की गई विशिष्ट आणविक पहचान के साथ जोड़ना सीखा। इसने मॉडल को कोशिकाओं के आकार की एक सार्वभौमिक भाषा सीखने में मदद की जो पूरे शरीर में काम करती है। जब इसे उन नए ऊतक खंडों पर परखा गया जिन्हें मॉडल ने पहले कभी नहीं देखा था, तो इसने औसतन 85 प्रतिशत मामलों में कोशिका प्रकारों की सही पहचान की। इससे भी महत्वपूर्ण बात यह है कि मॉडल ने केवल कोशिकाओं को गिना ही नहीं; बल्कि इसने पूरे ऊतक की संरचना का पुनर्निर्माण भी किया, जिससे यह सही ढंग से मैप किया जा सका कि ट्यूमर, प्रतिरक्षा कोशिकाएं और स्वस्थ संरचनाएं कहां स्थित थीं, जिससे प्रभावी रूप से अंग के जैविक परिदृश्य को पुनरुत्पादित किया गया।
यह खोज विशेष रूप से महत्वपूर्ण है क्योंकि यह मॉडल नई स्थितियों में अपने ज्ञान को कितनी अच्छी तरह स्थानांतरित करता है। शोधकर्ताओं ने परीक्षण किया कि क्या एआई उन अंगों और कोशिका प्रकारों को संभाल सकता है जिनका सामना उसने अपने प्रशिक्षण के दौरान नहीं किया था। उन्होंने मॉडल को कोलोन और त्वचा जैसे अंगों की कोशिकाओं वाले चार अलग-अलग सार्वजनिक डेटासेट पर लागू किया, जो मूल प्रशिक्षण सेट का हिस्सा नहीं थे। इन विशिष्ट ऊतकों को पहले देखे बिना भी, मॉडल ने लाखों मैन्युअल रूप से लेबल की गई छवियों पर प्रशिक्षित छह अन्य अग्रणी कृत्रिम बुद्धिमत्ता प्रणालियों को पछाड़ दिया। यह उन कठिन परिदृश्यों में विशेष रूप से प्रभावी था जहां कोशिकाएं बहुत समान दिखती हैं, जैसे कि सामान्य स्वस्थ ऊतक और कैंसरयुक्त ऊतक के बीच अंतर करना जो एक जैसा दिखता है। एक परीक्षण में, मॉडल ने केवल कुछ सौ उदाहरणों का उपयोग करके उन सामान्य कोशिकाओं को पहचानने में महारत हासिल की जो दिखने में समान ट्यूमर कोशिकाओं के बीच छिपी हुई थीं, जबकि अन्य प्रणालियों को उसी स्तर की सटीकता तक पहुँचने के लिए कई अधिक उदाहरणों की आवश्यकता थी। यह सुझाव देता है कि मॉडल ने केवल विशिष्ट कोशिका प्रकारों की सूची को याद करने के बजाय, अपने परिवेश में कोशिकाओं के दिखने के मूलभूत दृश्य नियमों को सीखा है।
शोधकर्ताओं ने यह भी पता लगाया कि सही पहचान करने के लिए कंप्यूटर को आसपास के ऊतक का कितना हिस्सा देखने की आवश्यकता है। उन्होंने प्रत्येक कोशिका के चारों ओर छवि विंडो के विभिन्न आकारों का परीक्षण किया, जिसमें केवल कोशिका को दिखाने वाला एक छोटा दृश्य और पूरे पड़ोस को दिखाने वाला एक बड़ा दृश्य शामिल था। उन्होंने पाया कि मॉडल तब सबसे अच्छा काम करता है जब वह कोशिका और उसके निकटतम पड़ोसियों को देख पाता है, लेकिन पूरे ऊतक खंड को नहीं। इस संतुलन ने कंप्यूटर को कोशिका के संदर्भ को समझने में मदद की—चाहे वह रक्त वाहिका में हो, ट्यूमर के द्रव्यमान में हो, या एक स्वस्थ ग्रंथि में—बिना कोशिका के अपने सूक्ष्म विवरण खोए। यह विशिष्ट विंडो आकार, जो कोशिका का एक बहुत छोटा लेकिन स्पष्ट दृश्य है, सटीकता के लिए सबसे उपयुक्त सिद्ध हुआ।
आनुवंशिक स्कैनर से प्राप्त आणविक डेटा को दृश्य पहचान के शिक्षण उपकरण में बदलकर, टीम ने एक ऐसा पुन: प्रयोज्य संसाधन बनाया है जिसे किसी भी नियमित ऊतक स्लाइड पर लागू किया जा सकता है। इस मॉडल को चलाने के लिए महंगे नए उपकरणों की आवश्यकता नहीं है; यह उन मानक स्लाइड्स का विश्लेषण कर सकता है जो हर दिन अस्पतालों में उपयोग की जा रही हैं। शोधकर्ताओं ने कोड और प्रशिक्षित मॉडल को वैज्ञानिक समुदाय के लिए उपलब्ध करा दिया है, जिससे अन्य लोग कोशिका को देखने के इस नए तरीके का उपयोग कर सकें। हालांकि वर्तमान मॉडल कुछ बहुत समान कोशिकाओं, जैसे कि प्रतिरक्षा कोशिकाओं के विभिन्न प्रकारों को एक साथ समूहबद्ध करता है, क्योंकि वे एक जैसी दिखती हैं, फिर भी यह एक बड़ी प्रगति का प्रतिनिधित्व करता है। यह सिद्ध करता है कि हम मैन्युअल लेबलिंग की धीमी और महंगी प्रक्रिया पर निर्भर हुए बिना कोशिकीय विश्लेषण के शक्तिशाली उपकरण बना सकते हैं। यह दृष्टिकोण लाखों कोशिकाओं के विश्लेषण के द्वार खोलता है, जो हजारों रोगियों के लिए संभव है, जिससे नियमित सूक्ष्मदर्शी स्लाइड्स को कोशिकीय गतिविधि के विस्तृत मानचित्रों में बदला जा सकता है जो डॉक्टरों को बीमारियों का जल्दी और अधिक सटीक रूप से निदान करने में मदद कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।