← नवीनतम पेपर
⚡ electrical engineering

BreastMammo and DenseMammo: Benchmarks for Mammography Domain Generalization

यह शोध पत्र BreastMammo और DenseMammo डेटासेट प्रस्तुत करता है और एक फोरग्राउंड-ओनली हिस्टोग्राम मैचिंग फ्रेमवर्क का प्रस्ताव देता है जो कई क्लिनिकल साइटों में वेंडर-विशिष्ट डोमेन शिफ्ट को प्रभावी ढंग से हल करके ब्रेस्ट डेंसिटी क्लासिफिकेशन में मौजूदा डोमेन जनरलाइजेशन विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Hongyi Pan, Gorkem Durak, Halil Ertugrul Aktas, Andrea Mia Bejar, Mustafa Ege Seker, Nebile Alibeyoglu, Rumeysa Guclu, Rana Gunoz Comert Bozkurt, Sibel Ozkan Gurdal, Neslihan Cabioglu, Beyza Ozcinar
प्रकाशित 2026-08-12
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyi Pan, Gorkem Durak, Halil Ertugrul Aktas, Andrea Mia Bejar, Mustafa Ege Seker, Nebile Alibeyoglu, Rumeysa Guclu, Rana Gunoz Comert Bozkurt, Sibel Ozkan Gurdal, Neslihan Cabioglu, Beyza Ozcinar, Ravza Yilmaz, Vahit Ozmen, Erkin Aribal, Sukru Mehmet Erturk, Yalda Zafari, Mohamed Mabrok, Kayhan Batmanghelich, Mohammad Yaqub, Ziyue Xu, Ulas Bagci

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ डॉक्टरों के पास एक सुपर-पावर्ड चश्मा हो जो मानव शरीर के आर-पार देख सके और संकट बनने से पहले ही समस्याओं को पहचान सके। यह चिकित्सा में आर्टिफिशियल इंटेलिजेंस (AI) का वादा है, विशेष रूप से मैमोग्राम—स्तन के विशेष एक्स-रे चित्रों—को देखने के संदर्भ में। वर्षों से, वैज्ञानिक इन AI "चश्मों" को स्तन कैंसर को पहचानने के लिए प्रशिक्षित कर रहे हैं, लेकिन वे एक निराशाजनक दीवार से टकरा गए हैं। आप देखते हैं, हर अस्पताल अलग-अलग कंपनियों की अलग-अलग एक्स-रे मशीनों का उपयोग करता है, ठीक वैसे ही जैसे हर ब्रांड का कैमरा अलग-अलग रंगों और रोशनी के साथ फोटो लेता है। एक ब्रांड के फोटो पर प्रशिक्षित AI दूसरे ब्रांड के फोटो देखकर भ्रमित हो जाता है। यह एक छात्र को केवल एक विशिष्ट कला शैली के चित्रों का उपयोग करके बिल्ली को पहचानना सिखाने जैसा है; जब आप उन्हें किसी अन्य शैली में ली गई फोटो दिखाते हैं, तो शायद वे समझ न पाएं कि यह वही बिल्ली है। इस भ्रम को "डोमेन शिफ्ट" (domain shift) कहा जाता है, और यह एक बड़ी समस्या है क्योंकि इसका मतलब है कि एक AI जो एक अस्पताल में पूरी तरह काम करता है, वह अगले अस्पताल में विफल हो सकता है, जिससे निदान (diagnosis) छूट सकता है।

यह शोध पत्र उस भ्रम को ठीक करने का एक चतुर नया तरीका पेश करता है। शोधकर्ताओं ने मैमोग्राम डेटा के दो बिल्कुल नए सेट बनाए, जिन्हें BreastMammo और DenseMammo नाम दिया गया, जो AI के लिए एक विशाल, विविध अभ्यास परीक्षण (practice test) के रूप में कार्य करते हैं। लेकिन असली जादू केवल डेटा नहीं है; यह एक नई तकनीक है जिसे उन्होंने AI को "कैमरा स्टाइल" को अनदेखा करने और केवल "बिल्ली" पर ध्यान केंद्रित करने के लिए सिखाने हेतु आविष्कार किया है। वे इसे फोरग्राउंड-ओनली हिस्टोग्राम मैचिंग (foreground-only histogram matching) कहते हैं। इसे एक फोटो एडिटर की तरह समझें जो ठीक जानता है कि चित्र के कौन से हिस्से वास्तव में स्तन ऊतक (breast tissue) हैं और कौन से हिस्से केवल खाली काला स्थान हैं। पूरे चित्र को ठीक करने के बजाय (जिसमें बेकार काला बैकग्राउंड भी शामिल है), AI केवल ऊतक के ब्राइटनेस और कंट्रास्ट को एक मानक लुक से मेल खाने के लिए समायोजित करता है। ऐसा करके, AI यह पहचानना सीख जाता है कि ऊतक का आकार और बनावट कैसी है, चाहे वह किसी भी मशीन द्वारा ली गई हो। परिणाम उत्साहजनक हैं: जब उन्होंने उन अस्पतालों के डेटा पर परीक्षण किया जिन्हें वे पहले से नहीं जानते थे, तो AI ने घने ऊतकों (dense tissue) को पहचानने और सौम्य (benign) एवं घातक (malignant) मामलों के बीच अंतर करने में बहुत बेहतर प्रदर्शन किया, और उन अन्य लोकप्रिय तरीकों से बेहतर रहा जिन्होंने समस्या को अलग-अलग तरीकों से ठीक करने की कोशिश की थी।

समस्या: "कैमरा फिल्टर" का मुद्दा

कल्पimate करें कि आप एक रोबोट को सेब की पहचान करना सिखाने की कोशिश कर रहे हैं। आप उसे धूप वाले किचन में ली गई लाल सेबों की हजारों तस्वीरें दिखाते हैं। रोबोट इसे पूरी तरह सीख जाता है। लेकिन फिर, आप उसे एक अलग किचन में ले जाते जहाँ रोशनी कम और पीली है, और सेब नारंगी दिख रहे हैं। रोबट घबरा जाता है। "क्या यह एक सेब है?" वह पूछता है। "यह उन सेबों जैसा नहीं दिखता जिन्हें मैं जानता हूँ!"

मैमोग्राफी की दुनिया में, बिल्कुल यही होता है। अस्पताल अलग-अलग एक्स-रे मशीनों (GE, Hologic, या Siemens जैसे विक्रेताओं से) का उपयोग करते हैं, और प्रत्येक मशीन छवि को थोड़ा अलग तरीके से प्रोसेस करती है। एक मशीन ऊतक को बहुत चमकीला और हाई-कंट्रास्ट बना सकती है, जबकि दूसरी इसे नरम और ग्रे दिखा सकती है। जब कोई AI मॉडल केवल एक या दो अस्पतालों के डेटा पर प्रशिक्षित होता है, तो वह उन मशीनों के "स्टाइल" को बीमारी के साथ-साथ पहचानना सीख जाता है। यदि आप उस मॉडल को तीसरे अस्पताल में भेजते हैं जिसके पास अलग मशीन है, तो वह भ्रमित हो जाता है। शोध पत्र इसे डोमेन शिफ्ट (domain shift) कहता है। यह एक बड़ी बाधा है क्योंकि इसका मतलब है कि हम केवल एक "परफेक्ट" AI नहीं बना सकते जिसे हर जगह इस्तेमाल किया जा सके; हमें एक ऐसा तरीका चाहिए जिससे AI इन कैमरा अंतरों से अछूता रहे।

नया डेटा: एक विशाल अभ्यास लाइब्रेरी

इसे हल करने के लिए, शोधकर्ताओं को सबसे पहले बेहतर अभ्यास सामग्री की आवश्यकता थी। उन्होंने दो नए डेटासेट पेश किए:

  1. BreastMammo: यह 447 रोगियों के 894 चित्रों का एक संग्रह है। ये "डायग्नोस्टिक" चित्र हैं, जिसका अर्थ है कि इन्हें तब लिया गया था जब रोगी को पहले से ही कोई लक्षण या गांठ थी। प्रत्येक रोगी के एक स्तन के दो दृश्य (एक ऊपर से नीचे का दृश्य और एक साइड दृश्य) होते हैं। इन चित्रों को इस लेबल के साथ चिह्नित किया गया है कि गांठ सौम्य (benless) थी या घातक (malignant), और इनमें रोगी के स्तन घनत्व (density) की श्रेणी भी शामिल है।
  2. DenseMammo: यह 620 रोगियों के 2,480 चित्रों वाला एक बड़ा "स्क्रीनिंग" डेटासेट है। ये बिना लक्षणों वाले लोगों के लिए नियमित जांच (routine check-ups) हैं। यहाँ प्रत्येक रोगी के पास चार दृश्यों का एक पूरा सेट (दोनों स्तन, प्रत्येक दो कोणों से) है।

दोनों डेटासेट विशेषज्ञ लेबल (स्तन घनत्व श्रेणियों A से D तक) के साथ सावधानीपूर्वक तैयार किए गए हैं और अन्य वैज्ञानिकों के उपयोग के लिए उपलब्ध हैं। लक्ष्य एक मानकीकृत "टेस्ट ट्रैक" बनाना था जहाँ सभी अपने AI मॉडल एक ही नियमों के तहत दौड़ा सकें।

समाधान: "केवल ऊतक" वाला फिल्टर

शोधकर्ताओं ने महसूस किया कि "कैमरा स्टाइल" की समस्या को ठीक करने के पिछले प्रयास गलतियाँ कर रहे थे। कुछ तरीकों ने अलग-अलग छवियों के "फीचर्स" को आपस में मिलाने की कोशिश की, जो पेंट के रंगों को मिलाकर एक नया शेड बनाने जैसा है। समस्या यह है कि यह अनजाने में ऊतक की बनावट (texture) के सूक्ष्म, महत्वपूर्ण विवरणों को धुंधला कर सकता है। अन्य तरीकों ने छवि की "फ्रीक्वेंसी" (जैसे गाने में बास और ट्रेबल बदलना) को बदलने की कोशिश की, लेकिन इसने अक्सर बैकग्राउंड को बिगाड़ दिया, जिससे एक्स-रे के खाली काले हिस्सों में अजीब शोर (noise) आ गया।

टीम ने एक नया दृष्टिकोण प्रस्तावित किया: फोरग्राउंड-ओनली हिस्टोग्राम मैचिंग (Foreground-Only Histogram Matching)

यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
कल्पना करें कि आपके पास कागज के एक टुकड़े पर एक जंगल (स्तन ऊतक) की ब्लैक-एंड-व्हाइट फोटो है। कागज पर एक बड़ा काला बॉर्डर है (एक्स-रे में खाली स्थान)।

  • पुराने तरीके पूरे कागज (काले बॉर्डर सहित) की ब्राइटनेस को एडजस्ट करने की कोशिश करते थे। यह बुरा है क्योंकि बॉर्डर केवल खाली स्थान है; इसे बदलने से आपको पेड़ों को बेहतर देखने में मदद नहीं मिलती, बल्कि यह पेड़ों को अजीब भी दिखा सकता है।
  • नया तरीका काले बॉर्डर पर एक मास्क लगा देता है। यह कहता है, "इस हिस्से को अनदेखा करो। हमें केवल पेड़ों की परवाह है।" फिर यह केवल पेड़ों के "हिस्टोग्राम" (एक चार्ट जो दिखाता है कि कितने पिक्सेल गहरे, हल्के या बीच के हैं) को देखता है। फिर यह स्रोत फोटो के पेड़ों की ब्राइटनेस को इस तरह एडजस्ट करता है कि वे संदर्भ (reference) फोटो के पेड़ों की ब्राइटनेस से मेल खा सकें।

महत्वपूर्ण रूप से, वे केवल स्टाइल को बदलते नहीं हैं; वे एक स्मूथ ग्रेडिएंट (smooth gradient) बनाते हैं। वे नई "सिंथेटिक" छवियां उत्पन्न करते हैं जो मूल और नए स्टाइल का मिश्रण होती हैं। वे हर इमेज के चार संस्करण बनाते हैं, जो 25%, 50%, 75%, और 100% पर स्टाइल को ब्लेंड करते हैं। यह AI को सिखाता है कि एक ही ऊतक मशीन के आधार पर थोड़ा अलग दिख सकता है, लेकिन वह फिर भी वही ऊतक है।

परिणाम: क्या यह काम करता है?

शोधकर्ताओं ने Swin Transformer नामक एक शक्तिशाली AI मॉडल का उपयोग करके अपने नए सिस्टम का परीक्षण किया। उन्होंने दो प्रकार के परीक्षण चलाए:

1. आंतरिक परीक्षण (अभ्यास रन)
उन्होंने अपने नए डेटासेट्स (BreastMammo और DenseMammo) पर AI को प्रशिक्षित किया और 5-फोल्ड क्रॉस-वैलिडेशन (डेटा को विभाजित करने का एक कठोर तरीका ताकि मॉडल केवल रट न ले) का उपयोग करके उसी डेटा पर इसके प्रदर्शन की जाँच की।

  • परिणाम: Swin Transformer मॉडल ने डेंसिटी क्लासिफिकेशन के लिए DenseMammo डेटासेट पर 98.32% का पीक AUC प्राप्त किया। यह एक बहुत ही उच्च स्कोर है, जो दर्शाता है कि जब मॉडल डेटा को अच्छी तरह जानता है, तो वह कार्य में अत्यंत कुशल है।
  • उन्होंने यह भी पाया कि उच्च रिज़ॉल्यूशन वाली छवियों (512x512 पिक्सेल) का उपयोग करने से मानक आकार (224x224) की तुलना में वास्तव में अधिक मदद नहीं मिली, क्योंकि AI पहले से ही मानक आकारों पर प्रशिक्षित था।

2. बाहरी परीक्षण (वास्तविक दुनिया की चुनौती)
यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने अपने डेटा पर प्रशिक्षित AI को दो पूरी तरह से अलग डेटासेट्स पर टेस्ट किया: TNMammo और LUMINA। ये डेटासेट्स अलग-अलग मशीनों और शैलियों का उपयोग करते हैं, जो "डोमेन शिफ्ट" की समस्या को दर्शाते हैं।

  • उनके तरीके के बिना: AI संघर्ष कर रहा था। TNMammo पर, AUC 83.46% था। LUMINA पर, यह 81.72% था।
  • उनके तरीके के साथ: AI में महत्वपूर्ण सुधार हुआ। TNMammo पर, AUC बढ़कर 86.38% हो गया। LUMINA पर, यह बढ़कर 86.13% हो गया।
  • तुलना: उन्होंने अपने तरीके की तुलना MixStyle (जो फीचर्स को ब्लेंड करता है) और DFT (जो फ्रीक्वेंसी पैटर्न को बदलता है) जैसे अन्य लोकप्रिय तकनीकों से की। उनका "फोरग्राउंड-ओनली" तरीका लगातार इन अन्य दृष्टिकोणों से बेहतर रहा।

यह क्यों मायने रखता है

शोध पत्र सुझाव देता है कि केवल ऊतक पर ध्यान केंद्रित करके और खाली बैकग्राउंड को अनदेखा करके, AI एक "यूनिवर्सल" तरीका सीख जाता है जिससे वह अलग-अलग मशीनों पर काम कर सके। लेखक तर्क देते हैं कि पूरे चित्र (बैकग्राउंड सहित) को ठीक करने की कोशिश करने से शोर और भ्रम पैदा होता है, जबकि उनका लक्षित दृष्टिकोण उन नाजुक बनावटों (textures) को सुरक्षित रखता है जो निदान के लिए आवश्यक हैं।

अंत में, यह केवल एक टेस्ट में उच्च स्कोर प्राप्त करने के बारे में नहीं है। यह ऐसे AI बनाने के बारे में है जिस पर दुनिया के किसी भी अस्पताल में भरोसा किया जा सके। यदि एक AI "कैमरा फिल्टर" को अनदेखा करना और "बिल्ली" पर ध्यान केंद्रित करना सीख सकता है, तो यह डॉक्टरों को दुनिया भर में कहीं भी, उनके पास मौजूद उपकरणों की परवाह किए बिना, स्तन कैंसर का जल्दी और अधिक सटीक रूप से पता लगाने में मदद कर सकता है। शोधकर्ताओं ने अपना डेटा और कोड सार्वजनिक कर दिया है, इस उम्मीद में कि यह "केवल ऊतक" वाला तरीका बेहतर, अधिक विश्वसनीय मेडिकल AI बनाने के लिए एक मानक उपकरण बन जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →