← नवीनतम पेपर
🤖 machine learning

CoM3^3eT: A foundation model for medical image analysis through federated, multidimensional context integration

CoM3^3eT एक नवीन मेडिकल विजन फाउंडेशन मॉडल है जो विविध डेटा आयामों और प्रेडिक्शन कार्यों के माध्यम से पैथोलॉजी और रेडियोलॉजी को एकीकृत करता है, जो कंज्यूमर-ग्रेड हार्डवेयर पर कुशल पैरामीटर अनुकूलन और फेडरेटेड लर्निंग के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: J. Raphael Schäfer, Kai Geissler, Till Nicke, Chiara Tappermann, Karoline Heber, Eike Petersen, Habib Mergan, Lars Ole Schwen, Nick Weiss, Annika Gerken, Jan Hendrik Moltz, Tom Bisson, Isil Dogan O, T
प्रकाशित 2026-08-18
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: J. Raphael Schäfer, Kai Geissler, Till Nicke, Chiara Tappermann, Karoline Heber, Eike Petersen, Habib Mergan, Lars Ole Schwen, Nick Weiss, Annika Gerken, Jan Hendrik Moltz, Tom Bisson, Isil Dogan O, Tim-Rasmus Kiehl, Norman Zerbe, Sefer Elezkurtaj, Robin S. Mayer, Nadine Flinner, Peter Wild, Isabel Dahm, Felix Peisen, Heinrich von Busch, Robert Grimm, Sebastian Arndt, Lisa Siegler, Matthias Stefan May, Antje Prasse, Natalia Artysh, Fabian Kiessling, Johannes Lotz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव शरीर दृश्य डेटा का एक विशाल परिदृश्य प्रस्तुत करता है, जो एक्स-रे की सपाट, द्वि-आयामी छाया से लेकर सीटी स्कैन के जटिल, त्रि-आयामी आयतन और एक ऊतक स्लाइड के सूक्ष्म, गीगापिक्सेल विवरणों तक फैला हुआ है। दशकों से, आर्टिफिशियल इंटेलिजेंस ने इन परिदृश्यों में नेविगेट करना सीखा है, लेकिन इसने ऐसा अलग-थलग पॉकेट में किया है। एक ऐसा सिस्टम जिसे चेस्ट एक्स-रे में ट्यूमर खोजने के लिए प्रशिक्षित किया गया है, वह अक्सर एक माइक्रोस्कोप स्लाइड को नहीं समझ पाता है, और एक मॉडल जिसे ऊतक के नमूने में कोशिकाओं को गिनने के लिए डिज़ाइन किया गया है, वह 3D अंग स्कैन की व्याख्या करने में संघर्ष करता है। यह विखंडन डॉक्टरों और शोधकर्ताओं को हर प्रकार के इमेज के लिए एक अलग विशिष्ट उपकरण पर निर्भर करने के लिए मजबूर करता है, जो एक ऐसी सीमा है जो तब महत्वपूर्ण हो जाती है जब डेटा कम हो या जब रोगी की स्थिति के लिए एक साथ कई प्रकार के स्कैन देखने की आवश्यकता हो। आधुनिक मेडिकल एआई का लक्ष्य एक एकल, बहुमुखी मस्तिष्क बनाना है जो प्रारूप की परवाह किए बिना पूरी तस्वीर देख सके, लेकिन एक ऐसा सिस्टम बनाने में इस विविध दृश्य दुनिया को सटीकता खोए बिना संयोजित करने की कठिनाई ने बाधा डाली है।

शोधकर्ताओं की एक टीम ने अब एक एकीकृत प्रणाली विकसित की है जिसे CoM³eT कहा जाता है, जो एक फाउंडेशन मॉडल है जिसे सभी आयामों और कार्यों में मेडिकल इमेज को समझने के लिए डिज़ाइन किया गया है। पिछले मॉडलों के विपरीत जो रेडियोलॉजी या पैथोलॉजी जैसे एकल विशेषज्ञता तक सीमित थे, या सरल वर्गीकरण या विस्तृत सेगमेंटेशन जैसे विशिष्ट प्रकार के उत्तरों तक सीमित थे, यह नया मॉडल उन सभी को एकीकृत करता है। यह हृदय के 3D वॉल्यूम, एक सपाट एक्स-रे और एक विशाल डिजिटल माइक्रोस्कोप स्लाइड को एक ही मौलिक दृश्य भाषा के विभिन्न रूपों के रूप में मानता है। एकल-कोशिका छवियों से लेकर पूरे शरीर के स्कैन तक, 1,00,000 से अधिक रोगियों के विशाल संग्रह पर प्रशिक्षण देकर, मॉडल ने उन पैटर्न को पहचानना सीखा जो विभिन्न पैमानों और मोडालिटीज़ में बने रहते हैं। परिणाम एक एकल आर्किटेक्चर है जो चेस्ट एक्स-रे में निमोनिया के निदान, ब्रेस्ट कैंसर स्लाइड में विभाजित कोशिकाओं को गिनने और 3D सीटी स्कैन में रक्त वाहिकाओं को सेगमेंट करने जैसे विविध कार्यों को वर्तमान में उपलब्ध सर्वश्रेष्ठ विशिष्ट उपकरणों के बराबर या उनसे बेहतर सटीकता के साथ कर सकता है।

इस प्रणाली की शक्ति इस बात में निहित है कि यह सूचना को कैसे संसाधित करती है। 3D स्कैन को अलग-अलग 2D स्लाइस के स्टैक के रूप में मानने के बजाय, मॉडल पूरे वॉल्यूम को एक सुसंगत इकाई के रूप में देखता है, जिससे यह एक छवि के विभिन्न परतों में फैले संदर्भ को समझने में सक्षम होता है। यह एक ऐसे तंत्र का उपयोग करता है जो इसे छवि के सबसे प्रासंगिक हिस्सों पर ध्यान केंद्रित करने की अनुमति देता है जबकि यह भी ट्रैक रखता है कि वे हिस्से स्थान में कहाँ स्थित हैं। यह दृष्टिकोण इतना प्रभावी साबित हुआ कि हाल ही में एक स्वतंत्र प्रतियोगिता में, जिसे मेडिकल फाउंडेशन मॉडल्स का परीक्षण करने के लिए डिज़ाइन किया गया था, CoM³eT ने समग्र रूप से प्रथम स्थान प्राप्त किया, जिसने रेडियोलॉजी और पैथोलॉजी दोनों में अग्रणी मॉडलों को पीछे छोड़ दिया। यह प्रत्येक कार्य को संभालने में सक्षम एकमात्र मॉडल था, जिसमें छवियों के बारे में टेक्स्ट रिपोर्ट तैयार करने से लेकर जटिल 3D डेटा में विशिष्ट संरचनाओं की पहचान करना शामिल है। एमआरआई स्कैन में स्तन ट्यूमर के सेगमेंटेशन से संबंधित एक विशिष्ट परीक्षण में, मॉडल ने एक ऐसा स्कोर प्राप्त किया जो विशिष्ट प्रतिस्पर्धियों की तुलना में काफी अधिक था, जो यह दर्शाता है कि एक एकल, एकीकृत दृष्टिकोण कई संकीर्ण, विशिष्ट उपकरणों के संग्रह से बेहतर प्रदर्शन कर सकता है।

इस कार्य का सबसे व्यावहारिक ब्रेकथ्रू केवल इसकी बुद्धिमत्ता नहीं है, बल्कि इसकी दक्षता है। इतने विशाल मॉडल को प्रशिक्षित करने के लिए आमतौर पर अत्यधिक कंप्यूटिंग शक्ति की आवश्यकता होती है, जो अक्सर सुपर कंप्यूटर तक पहुंच रखने वाले कुछ चुनिष्ट संस्थानों तक ही सीमित होती है। हालाँकि, शोधकर्ताओं ने पाया कि वे केवल इसके आंतरिक सेटिंग्स के एक बहुत छोटे अंश को अपडेट करके इस शक्तिशाली प्रणाली को नए चिकित्सा कार्यों के लिए अनुकूलित कर सकते हैं—कुल मापदंडों (पैरामीटर्स) का 2.5 प्रतिशत से भी कम। 'पार्शियल फाइन-ट्यूनिंग' के रूप में जानी जाने वाली यह तकनीक मॉडल को अपने पूरे मस्तिष्क को फिर से प्रशिक्षित किए बिना नए कौशल सीखने की अनुमति देती है। यह दक्षता अस्पतालों के बीच सहयोग करने का एक नया तरीका खोलती है। टीम ने प्रदर्शित किया कि वे कई जर्मन विश्वविद्यालय अस्पतालों में मॉडल को प्रशिक्षित कर सकते हैं बिना संवेदनशील रोगी डेटा को उसके स्थानीय स्टोरेज से हटाए। मॉडल के मुख्य भाग को फ्रीज (स्थिर) रखकर और केवल इंटरनेट के माध्यम से सिस्टम के छोटे, अपडेटेड हिस्सों को साझा करके, उन्होंने एक एकल, विशाल संयुक्त डेटा पूल पर प्रशिक्षण के समान प्रदर्शन स्तर प्राप्त किया। यह सिद्ध करता है कि उच्च-स्तरीय मेडिकल एआई को मानक कंप्यूटर हार्डवेयर और साधारण इंटरनेट कनेक्शन के साथ सुरक्षित रूप से विकसित और साझा किया जा सकता है, जिससे उन्नत नैदानिक उपकरण चिकित्सा केंद्रों की एक विस्तृत श्रृंखला के लिए सुलभ हो जाते हैं।

डेटा के विविध प्रकारों को संभालने की मॉडल की क्षमता चिकित्सा इमेजिंग की एक लंबे समय से चली आ रही चुनौती को भी संबोधित करती है: एक रोगी की स्थिति का कई कोणों से विश्लेषण करने की आवश्यकता। अतीत में, एक डॉक्टर को सीटी स्कैन पढ़ने के लिए एक रेडियोलॉजिस्ट और ऊतक स्लाइड पढ़ने के लिए एक पैथोलॉजिस्ट पर निर्भर होना पड़ सकता था, जिसमें कोई भी एकल प्रणाली दोनों दृश्यों को संश्लेषित करने में सक्षम नहीं थी। CoM³eT विभिन्न स्रोतों से जानकारी को एकीकृत करने का सीखकर इस अंतर को पाटता है। उदाहरण के लिए, कैंसर पुनरावृत्ति की भविष्यवाणी करने वाले कार्यों में, मॉडल ने व्यक्तिगत सेल पैच के विशिष्ट विवरणों के साथ पूरे ऊतक स्लाइड के स्थानिक संदर्भ को सफलतापूर्वक संयोजित किया। इस समग्र दृष्टिकोण ने इसे उन मॉडलों की तुलना में अधिक सटीक भविष्यवाणियां करने की अनुमति दी जो डेटा को अलगाव में देखते थे। शोधकर्ताओं ने पाया कि जब मॉडल को एक छवि के विभिन्न हिस्सों के बीच संबंधों पर विचार करने की अनुमति दी गई, तो इसके प्रदर्शन में काफी सुधार हुआ, जो बताता है कि किसी छवि का संदर्भ स्वयं छवि जितना ही महत्वपूर्ण है।

अपनी सफलता के बावजूद, शोधकर्ता सावधानी बरतते हुए यह स्पष्ट करते हैं कि यह प्रणाली एक जादुई समाधान नहीं है जो हर परिदृश्य में पूरी तरह से काम करती है। कुछ विशिष्ट कार्यों में, जैसे कि सीटी स्कैन में बहुत छोटी रक्त वाहिकाओं की पहचान करना, मॉडल अभी भी चुनौतियों का सामना करता है, विशेष रूप से तब जब संरचनाएं अपने परिवेश से अलग पहचानना कठिन हो। टीम स्वीकार करती है कि हालांकि वैश्विक संदर्भ को एकीकृत करने की मॉडल की क्षमता एक बड़ी ताकत है, फिर भी ऐसे क्षेत्र हैं जहां विशिष्ट, पारंपरिक तरीके बढ़त बनाए रख सकते हैं। हालांकि, तथ्य यह है कि एक एकल, लचीली प्रणाली इन विशिष्ट तरीकों के साथ प्रतिस्पर्धा कर सकती है और अक्सर उनसे बेहतर प्रदर्शन कर सकती है, यह सुझाव देता है कि मेडिकल एआई कैसे विकसित होगा, इसमें एक बदलाव आया है। हर नई बीमारी या इमेजिंग तकनीक के लिए एक नया, संकीर्ण उपकरण बनाने के बजाय, भविष्य इन व्यापक, अनुकूलनीय आधारों में निहित हो सकता है जिन्हें विशिष्ट आवश्यकताओं के लिए जल्दी से ट्यून किया जा सकता है।

इस कार्य के निहितार्थ प्रयोगशाला से परे तक विस्तृत हैं। यह सिद्ध करके कि एक एकल मॉडल विशाल चिकित्सा डेटा के एक विस्तृत समूह से सीख सकता है और नए कार्यों के लिए कुशलतापूर्वक अनुकूलित किया जा सकता है, शोधकर्ताओं ने अगली पीढ़ी के मेडिकल एआई के लिए एक ब्लूप्रिंट प्रदान किया है। यह दृष्टिकोण नए नैदानिक ​​उपकरणों को विकसित करने के लिए प्रवेश की बाधा को कम करता है, क्योंकि अब हर नए अनुप्रयोग के लिए विशाल डेटासेट या सुपरकंप्यूटिंग संसाधनों की आवश्यकता नहीं होती है। कच्चे रोगी डेटा को साझा किए बिना कई संस्थानों में इन मॉडलों को प्रशिक्षित करने की क्षमता गोपनीयता संबंधी चिंताओं को भी संबोधित करती है, जो रोगी की गोपनीयता का सम्मान करते हुए सहयोगात्मक अनुसंधान के लिए एक मार्ग प्रदान करती है। जैसे-जैसे यह क्षेत्र आगे बढ़ेगा, ध्यान संभवतः अलग-थलग, विशिष्ट मॉडलों के निर्माण से हटकर इन बहुमुखी, फाउंडेशनल सिस्टम बनाने की ओर स्थानांतरित होगा जो मानव स्वास्थ्य की हमारी समझ के साथ बढ़ और अनुकूलित हो सकते हैं। CoM³eT की सफलता यह सुझाव देती है कि मेडिकल इमेजिंग विश्लेषण का भविष्य इस बात से परिभाषित नहीं होगा कि एक डॉक्टर के पास कितने उपकरण हैं, बल्कि एक एकल, बुद्धिमान प्रणाली की गहराई और व्यापकता से होगा जो चिकित्सा डेटा के संपूर्ण परिदृश्य को देख सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →