← नवीनतम पेपर
🤖 machine learning

FunduSegmenter: Leveraging the RETFound Foundation Model for Joint Optic Disc and Optic Cup Segmentation in Retinal Fundus Images

यह शोध पत्र FunduSegmenter को प्रस्तुत करता है, जो एक नवीन ढांचा है जो विविध रेटिनल फंडस डेटासेट में संयुक्त ऑप्टिक डिस्क और ऑप्टिक कप सेगमेंटेशन में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए विशेष मॉड्यूल के साथ RETFound फाउंडेशन मॉडल को अनुकूलित करता है, जो मौजूदा बेसलाइन की तुलना में बेहतर सटीकता और सामान्यीकरण प्रदर्शित करता है।

मूल लेखक: Zhenyi Zhao, Muthu Rama Krishnan Mookiah, Emanuele Trucco

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenyi Zhao, Muthu Rama Krishnan Mookiah, Emanuele Trucco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शहर के मानचित्र (एक रेटिनल फंडस इमेज) को देख रहे हैं। इस मानचित्र पर, दो बहुत ही महत्वपूर्ण स्थल हैं: ऑप्टिक डिस्क (मुख्य सिटी स्क्वायर जहाँ सड़कें मिलती हैं) और ऑप्टिक कप (उसी चौक के ठीक बीच में स्थित एक छोटा, कटोरे के आकार का गड्ढा)।

डॉक्टरओं को बीमारियों जैसे कि ग्लूकोमा (glaucoma) का पता लगाने के लिए इन दोनों स्थलों के आकार और आकृति को मापना होता है। लेकिन इन हजारों धुंधले और जटिल मानचित्रों पर हाथ से सीमाएं खींचना धीमा, थकाऊ और मानवीय त्रुटियों की संभावना वाला काम है।

यहाँ आता है FunduSegmenter, एक नया AI टूल जिसे यह ड्राइंग स्वचालित रूप से करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसे बिना किसी तकनीकी शब्दावली के यहाँ समझाया गया है।

1. समस्या: "विशेषज्ञ" बनाम "सामान्यज्ञ"

पारंपरिक रूप से, AI मॉडल विशेषज्ञ प्रशिक्षुओं (specialist apprentices) की तरह होते हैं। उन्हें एक विशिष्ट प्रकार के मानचित्र पर प्रशिक्षित किया जाता है। यदि आप उन्हें किसी दूसरे शहर का मानचित्र (एक अलग कैमरा या अस्पताल) दिखाते हैं, तो वे भ्रमित हो जाते हैं और गलतियाँ करते हैं। उन्हें सीखने के लिए हर एक मानचित्र को लेबल करने के लिए एक मानव शिक्षक की भी आवश्यकता होती है, जिसमें बहुत समय लगता है।

2. समाधान: "सुपर-रीडर" फाउंडेशन

शोधकर्ताओं ने RETFound नामक एक प्री-ट्रेंड AI का उपयोग किया। RETFound को एक सुपर-रीडर के रूप में समझें जिसने पहले ही विभिन्न पुस्तकालयों (कैमरों और अस्पतालों) से लाखों किताबें (इमेज) पढ़ ली हैं। इस AI ने पहले ही रेटिनल छवियों की "व्याकरण" सीख ली है। यह जानता है कि रक्त वाहिकाएं कैसी दिखती हैं, स्वस्थ ऊतक कैसे दिखते हैं, और एक डिस्क कैसी दिखती है, यह सब केवल डेटा को पढ़कर।

हालाँकि, यह सुपर-रीडर छवियों को वर्गीकृत करने (जैसे, "क्या यह बीमार है या स्वस्थ?") के लिए प्रशिक्षित किया गया था, न कि विशिष्ट भागों के चारों ओर रेखाएं खींचने के लिए। यह एक ऐसे प्रोफेसर की तरह है जो आपको बता सकता है कि कोई पेंटिंग उत्कृष्ट कृति है या नहीं, लेकिन उन्हें उसमें मौजूद वस्तुओं की रूपरेखा (outlines) बनाना नहीं आता।

3. नवाचार: "एडैप्टर सूट"

शोधकर्ताओं ने इस "सुपर-रीडर" को "मास्टर पेंटर" में बदलने के लिए FunduSegmenter बनाया। उन्होंने पूरे मस्तिष्क को फिर से प्रशिक्षित नहीं किया; इसके बजाय, उन्होंने उस पर एक कस्टम एडैप्टर सूट पहनाया। इस सूट में चार विशेष उपकरण हैं:

  • द प्री-एडैप्टर (आकार बदलने वाला): सुपर-रीडर एक विशिष्ट आकार की छवियों (जैसे 224x224 पिक्सेल का वर्ग) को देखने का आदी है। लेकिन वास्तविक दुनिया की छवियां सभी आकारों और आकारों की आती हैं। प्री-एडैप्टर एक जादुई रिसाइजिंग लेंस की तरह है जो एक विशाल फोटो या एक छोटी फोटो को ले सकता है और उसे सुपर-रीडर के समझने के लिए पूरी तरह से नया आकार दे सकता है, बिना किसी विवरण को खोए।
  • द पोस्ट-एडैप्टर (परिष्कृत करने वाला): जब सुपर-रीडर रेखाएं खींचने की कोशिश करता है, तो किनारे थोड़े धुंधले हो सकते हैं, खासकर डिस्क और कप के बीच (जो बहुत समान दिखते हैं)। पोस्ट-एडैप्टर एक बारीक कंघी (fine-tooth comb) की तरह है जो उन खुरदरे किनारों को चिकना करता है, जिससे सीमाएं स्पष्ट और सटीक बनती हैं।
  • द स्किप कनेक्शंस (स्मृति मार्ग): जैसे-जैसे सुपर-रीडर एक छवि को देखता है, वह बड़ी तस्वीर पर ध्यान केंद्रित करते समय छोटे विवरणों को भूल जाता है। स्किप कनेक्शंस तत्काल स्मृति रिकॉल (instant memory recall) की तरह कार्य करते हैं, जो छोटे विवरणों (जैसे कप के सूक्ष्म किनारे) को वापस ड्राइंग टूल तक पहुँचाते हैं ताकि कुछ भी छूटे नहीं।
  • द ViT ब्लॉक एडैप्टर (अनुवादक): यह एक छोटा मॉड्यूल है जो सुपर-रीडर को अपने "बड़ी तस्वीर" वाले ज्ञान को "पिक्सेल-परफेक्ट" निर्देशों में अनुवाद करने में मदद करता है। यह एक अनुवादक की तरह है जो यह सुनिश्चित करता है कि AI केवल "पैटर्न पहचानने" के बजाय "रेखाएं खींचने" की भाषा बोल रहा है।

4. परिणाम: स्थिरता का एक उत्कृष्ट नमूना

टीम ने इस नए टूल का कई डेटासेट्स (अलग-अलग कैमरे, अलग-अलग अस्पताल, अलग-अलग देश) पर परीक्षण किया।

  • "विशेषज्ञ" मॉडल (जैसे nnU-Net) उस सटीक शहर में परीक्षण के दौरान बहुत अच्छे थे जिससे वे सीखे थे, लेकिन जब उन्हें एक नए शहर में दिखाया गया, तो वे अक्सर पूरी तरह से विफल हो गए (उनका स्कोर 18% जितना कम हो गया)।
  • FunduSegmenter अनुकूलन क्षमता का चैंपियन था। इसने पूरे क्षेत्र में लगभग 90% सटीकता प्राप्त की। चाहे इमेज किसी छोटे स्थानीय क्लिनिक से हो या किसी विशाल अंतरराष्ट्रीय डेटाबेस से, इसने लगातार अच्छा प्रदर्शन किया।

यह क्यों मायने रखता है

इसे एक छात्र को एक विशिष्ट पाठ्यपुस्तक को याद करने के बजाय, कोई भी किताब पढ़ने के लिए सिखाने के रूप में समझें।

  • डॉक्टरों के लिए: इसका अर्थ है कि वे दुनिया में कहीं भी, किसी भी कैमरे से आंखों के स्वास्थ्य के विश्वसनीय माप प्राप्त कर सकते हैं, बिना हर नई मशीन के लिए AI को फिर से प्रशिक्षित किए।
  • मरीजों के लिए: इससे आंखों की बीमारियों का तेज़ और अधिक सटीक निदान संभव होता है, जिससे संभावित रूप से अंधापन रोका जा सकता है।

संक्षेप में, FunduSegmenter एक शानदार, प्री-ट्रेंड AI को लेता है और उसे मानव आंख के लिए दुनिया का सबसे विश्वसनीय स्वचालित मानचित्र-चित्रकार बनने के लिए एक कस्टम टूलकिट प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →