← नवीनतम पेपर
💻 computer science

Revisiting the Role of Foundation Models in Cell-Level Histopathological Image Analysis under Small-Patch Constraints -- Effects of Training Data Scale and Blur Perturbations on CNNs and Vision Transformers

यह अध्ययन प्रदर्शित करता है कि अत्यधिक स्थानिक बाधाओं के तहत सेल-स्तरीय हिस्टोपैथोलॉजिकल इमेज विश्लेषण के लिए, पर्याप्त डेटा पर प्रशिक्षित कार्य-विशिष्ट आर्किटेक्चर, सटीकता और दक्षता दोनों में फाउंडेशन मॉडलों से बेहतर प्रदर्शन करते हैं, जबकि ब्लर व्यवधानों (blur perturbations) के प्रति तुलनीय मजबूती प्रदान करते हैं।

मूल लेखक: Hiroki Kagiyama, Toru Nagasaka, Yukari Adachi, Takaaki Tachibana, Ryota Ito, Mitsugu Fujita, Kimihiro Yamashita, Yoshihiro Kakeji

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hiroki Kagiyama, Toru Nagasaka, Yukari Adachi, Takaaki Tachibana, Ryota Ito, Mitsugu Fujita, Kimihiro Yamashita, Yoshihiro Kakeji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: रेत के एक कण को देखना

कल्पना कीजिए कि आप चींटियों की विभिन्न प्रजातियों की पहचान करने की कोशिश कर रहे हैं। आमतौर पर, वैज्ञानिक यह पता लगाने के लिए कि वे कौन सी प्रजाति हैं, पूरी चींटी कॉलोनी या चींटियों के एक बड़े समूह को देखते हैं। उनके पास चींटियों के पैर, पंख और उनके एक साथ चलने के तरीके को देखने के लिए पर्याप्त जगह होती है।

लेकिन इस अध्ययन में, शोधकर्ताओं के पास बहुत कठिन काम था। उन्हें एक समय में केवल एक एकल कोशिका (cell) को देखना पड़ा, और जिस छवि के साथ उन्हें काम करना था वह अविश्वसनीय रूप से छोटी थी—जैसे कि चींटी द्वारा खड़े होकर देखे जा रहे रेत के एक अकेले कण को देखकर चींटी की पहचान करने की कोशिश करना।

मेडिकल इमेजिंग की दुनिया में, इसे "छोटे पैच" (40x40 पिक्सल) पर "सेल-लेवल विश्लेषण" कहा जाता है। यह किसी प्रसिद्ध अभिनेता के चेहरे को पहचानने की कोशिश करने जैसा है जब आपको केवल उनकी नाक के एक सिंगल पिक्सेल को देखने की अनुमति दी जाती है।

प्रश्न: क्या "सुपर-ब्रेन" मदद करते हैं?

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, "फाउंडेशन मॉडल्स" होते हैं। इन्हें सुपर-ब्रेन के रूप में सोचें जिन्होंने लाखों किताबें पढ़ी हैं और लाखों मानक आकार की तस्वीरें (जैसे बिल्ली, कुत्ता और कार) देखी हैं ताकि वे चीजों को पहचानना सीख सकें। वे विशाल, महंगे और बहुत शक्तिशाली होते हैं।

शोधकर्ताओं ने पूछा: "यदि हम इन सुपर-ब्रेन को रेत के एक छोटे से कण जैसी छवि देते हैं, तो क्या वे अभी भी कोशिका की पहचान करने में सर्वश्रेष्ठ होंगे?"

उन्होंने इन विशाल, प्री-ट्रेन्ड सुपर-ब्रेन की तुलना छोटे, कस्टम-बिल्ट "टास्क-स्पेसिफिक" मॉडल्स (जैसे कि इस एक विशेष काम के लिए बनाया गया एक विशेष उपकरण) से की।

प्रयोग: मॉडल्स को प्रशिक्षित करना

शोधकर्ताओं ने भारी मात्रा में डेटा एकत्र किया: कोलोरेक्टल कैंसर के रोगियों से ली गई 18성을,000 छोटी सेल छवियां। फिर उन्होंने अलग-अलग प्रकार के AI मॉडल्स को इस डेटा पर प्रशिक्षित किया, जो बहुत कम मात्रा से शुरू होकर धीरे-धीरे बढ़ती गई, जैसे कि कोई छात्र परीक्षा के लिए पढ़ाई कर रहा हो।

उन्होंने तीन मुख्य चीजों का परीक्षण किया:

  1. उन्हें कितने डेटा की आवश्यकता है? (क्या सुपर-ब्रेन को कस्टम टूल की तुलना में कम पढ़ाई के समय की आवश्यकता है?)
  2. वे कितने तेज़ हैं? (क्या वे निदान जल्दी कर सकते हैं?)
  3. क्या वे मजबूत हैं? (क्या होता है यदि छवि धुंधली हो, जैसे गंदी खिड़की से देखना?)

आश्चर्यजनक परिणाम

1. "सुपर-ब्रेन" एक सीमा पर टकरा जाता है

शुरुआत में, जब शोधकर्ताओं के पास बहुत कम डेटा था (जैसे कि एक छात्र जिसने केवल 1 घंटा पढ़ाई की है), तो फाउंडेशन मॉडल्स (सुपर-ब्रेन) विजेता थे। क्योंकि उन्होंने अन्य तस्वीरों से पहले ही बहुत कुछ सीख लिया था, इसलिए वे बहुत कम नई जानकारी के साथ भी सही अनुमान लगा सकते थे।

हालाँकि, जैसे-जैसे शोधकर्ताओं ने मॉडल्स को अधिक से अधिक डेटा दिया (प्रति क्लास 16,000 सैंपल तक), सुपर-ब्रेन में सुधार रुक गया। वे एक सीमा (सीलिंग) पर पहुँच गए। वे रेत के उस छोटे से कण वाली छवियों से और अधिक नहीं सीख सके क्योंकि उनका प्रशिक्षण बड़े, स्पष्ट चित्रों पर आधारित था।

2. "कस्टम टूल" अभ्यास के साथ जीतता है

कस्टम-बिल्ट मॉडल्स (विशेष रूप से एक प्रकार का CustomViT, जो छोटे पैच के लिए डिज़ाइन किया गया एक विजन ट्रांसफार्मर है) शुरुआत में धीमे थे। उन्हें अच्छा होने के लिए बहुत अधिक डेटा की आवश्यकता थी। लेकिन एक बार जब उनके पास पर्याप्त डेटा हो गया, तो वे बेहतर और बेहतर होते गए।

अंततः, CustomViT ने सुपर-ब्रेन को पछाड़ दिया। इसने बहुत अधिक सटीकता (92% बनाम 78%) प्राप्त की और इसने यह काम बहुत तेजी से किया।

  • उपमा: कल्पना कीजिए कि सुपर-ब्रेन एक प्रसिद्ध शेफ है जो 10-कोर्स का भोज बनाना जानता है लेकिन एक अकेला क्रैकर (बिस्कुट जैसा) बनाने में संघर्ष करता है। CustomViT एक विशेष क्रैकर बनाने वाला है जो, बहुत अभ्यास करने के बाद, प्रसिद्ध शेफ की तुलना में बहुत तेज़ी से और सस्ते में हर बार एक आदर्श क्रैकर बनाता है।

3. "धुंधलापन" परीक्षण

शोधकर्ताओं ने यह भी परीक्षण किया कि यदि छवियां धुंधली हों (जैसे फोकस से बाहर कैमरा) तो क्या होता है।

  • परिणाम: जब छवियां बहुत धुंधली थीं, तो दोनों—सुपर-ब्रेन और कस्टम टूल्स—भ्रमित हो गए।
  • मुख्य निष्कर्ष: एक "सुपर-ब्रेन" होने से AI धुंधलेपन के प्रति अधिक प्रतिरोधी नहीं बना। यदि तस्वीर बहुत धुंधली है, तो सबसे स्मार्ट AI भी विवरण नहीं देख सकता। सुपर-ब्रेन "मजबूत" नहीं था; वह बस स्पष्ट तस्वीरों पर उच्च स्कोर से शुरू हुआ था।

अंतिम निर्णय

जब आपके पास एक बहुत छोटी, लो-रेज़ोल्यूशन वाली छवि (जैसे एक एकल कोशिका) हो:

  • "सुपर-ब्रेन" (फाउंडेशन मॉडल्स) पर भरोसा न करें यदि आपके पास पर्याप्त डेटा है। वे बहुत बड़े, बहुत धीमे हैं और वे इतने छोटे विवरणों के अनुकूल नहीं हो पाते हैं। वे एक अखरोट तोड़ने के लिए हथौड़े के उपयोग करने जैसे हैं।
  • एक "कस्टम टूल" (टास्क-स्पेसिफिक मॉडल) बनाएं। यदि आपके पास पर्याप्त डेटा है, तो छोटे चित्रों के लिए विशेष रूप से बनाया गया मॉडल तेज़, सस्ता और अधिक सटीक होता है।

संक्षेप में: छोटी कोशिकाओं को देखने के लिए, एक विशेष, कस्टम-बिल्ट AI सबसे अच्छा डॉक्टर है। विशाल, प्री-ट्रेन्ड AI मॉडल्स बड़ी तस्वीरों के लिए बेहतरीन हैं, लेकिन जब दृश्य बहुत छोटा हो जाता है, तो वे खो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →