← नवीनतम पेपर
💻 computer science

Mammo-FM: Breast-specific foundational model for Integrated Mammographic Diagnosis, Prognosis, and Reporting

यह शोध पत्र Mammo-FM को प्रस्तुत करता है, जो 1,40,,000 से अधिक रोगियों के एक विशाल और विविध डेटासेट पर प्रीट्रेन किया गया एक स्तन-विशिष्ट फाउंडेशन मॉडल है, जो कैंसर निदान, रोग का निदान (प्रोगनोसिस) और संरचित रिपोर्टिंग को एकीकृत करता है और अधिक दक्षता एवं व्याख्यात्मकता के साथ बड़े सामान्य मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Shantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung Aiden Wong, Abhishek Varshney, Payel Basak, Weicheng Dai, Judy Wawira Gichoya
प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung Aiden Wong, Abhishek Varshney, Payel Basak, Weicheng Dai, Judy Wawira Gichoya, Hari M. Trivedi, Imon Banerjee, Shyam Visweswaran, Clare B. Poynton, Kayhan Batmanghelich

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को दुनिया का सर्वश्रेष्ठ ब्रेस्ट कैंसर डिटेक्टिव (जासूस) बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। वर्षों से, शोधकर्ता इसे सामान्य चिकित्सा ज्ञान (जैसे एक मेडिकल छात्र जिसे सब कुछ थोड़ा-थोड़ा पता है) सिखाकर या उन्हें छोटे, विशिष्ट डेटासेट पर प्रशिक्षित करके करने की कोशिश कर रहे हैं। लेकिन मैमोग्राम (mammograms) पेचीदा होते हैं; ये उच्च-रिज़ॉल्यूशन वाली, विस्तृत छवियां हैं जहाँ सूक्ष्म सुराग (जैसे माइक्रो-कैलसिफिकेशन) जीवन और मृत्यु के बीच का अंतर तय कर सकते हैं।

यह पेपर Mammo-FM पेश करता है, जो एक नए प्रकार का "AI मस्तिष्क" है जिसे विशेष रूप से ब्रेस्ट इमेजिंग के लिए बनाया गया है। इसे एक सामान्य मेडिकल छात्र के रूप में नहीं, बल्कि एक विशेषज्ञ मास्टर डिटेक्टिव के रूप में सोचें जिसने केवल ब्रेस्ट स्कैन और दुनिया के सर्वश्रेष्ठ रेडियोलॉजिस्ट द्वारा लिखी गई रिपोर्टों का अध्ययन किया है।

यहाँ इसकी कहानी दी गई है कि यह कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "सुपर-लाइब्रेरी" (प्रशिक्षण डेटा)

अधिकांश AI मॉडल एक छोटी सी किताबों की लाइब्रेरी पर प्रशिक्षित होते हैं। Mammo-FM को अब तक के सबसे बड़े, सबसे विविध ब्रेस्ट स्कैन की लाइब्रेरी पर प्रशिक्षित किया गया था।

  • पैमाना: इसने 140,000 रोगियों और चार अलग-अलग प्रमुख अमेरिकी अस्पतालों के 820,000 से अधिक मैमोग्राम्स का अध्ययन किया।
  • उपमा: कल्पना कीजिए कि एक जासूस जिसने चार अलग-अलग शहरों की हर एक केस फाइल पढ़ ली है, जिससे उसने लाखों पन्नों के नोट्स से सीखा है। यह AI को उन पैटर्नों को पहचानने की अनुमति देता है जिन्हें केवल एक अस्पताल के डेटा पर प्रशिक्षित मॉडल मिस कर सकता है। यह उस जासूस और उस जासूस के बीच का अंतर है जिसने केवल न्यूयॉर्क में अपराध देखे हैं और जिसने न्यूयॉर्क, लंदन, टोक्यो और सिडनी में अपराध देखे हैं।

2. "अनुवादक" (विज़न-लैंग्वेज एलाइनमेंट)

यही इस पेपर का 'सीक्रेट सॉस' है। अधिकांश AI एक तस्वीर देखते हैं और कहते हैं, "यह कैंसर जैसा दिखता है।" Mammo-FM एक तस्वीर देखता है और साथ ही रेडियोलॉजिस्ट की रिपोर्ट भी पढ़ता है

  • यह कैसे काम करता है: यह एक्स-रे में विजुअल डॉट्स को डॉक्टर के नोट्स के शब्दों से जोड़ना सीखता है। यह सीखता है कि जब एक रेडियोलॉजिस्ट लिखता है "ऊपरी बाहरी भाग में कैलसिफिकेशन का समूह," तो वह विशिष्ट दृश्य पैटर्न वही है जिसे वे देख रहे हैं।
  • उपमा: इसे एक द्विभाषी अनुवादक की तरह सोचें। केवल एक पेंटिंग को देखकर यह अनुमान लगाने के बजाय कि वह क्या है, यह AI पेंटिंग को देख सकता है और उसके बारे में कलाकार की डायरी का प्रविष्टि भी पढ़ सकता है। यह AI को "व्याख्या योग्य" (explainable) बनाता है। यदि यह किसी स्थान को संदिग्ध के रूप में चिह्नित करता है, तो यह रिपोर्ट के ठीक उस वाक्य की ओर इशारा कर सकता है जो इसके द्वारा देखे गए पैटर्न से मेल खाता है। यह डॉक्टरों के साथ विश्वास बनाता है।

3. "तीन महाशक्तियाँ"

इस विशाल प्रशिक्षण के कारण, Mammo-FM किसी भी पिछले AI की तुलना में तीन चीजें बेहतर कर सकता है:

  • शक्ति 1: त्वरित निदान (जीरो-शॉट लर्निंग)
    आमतौर पर, किसी AI को किसी विशिष्ट प्रकार के ट्यूमर को पहचानने के लिए सिखाने हेतु, आपको उसे उस ट्यूमर के हजारों लेबल किए गए उदाहरण देने पड़ते हैं। Mammo-FM को इसकी आवश्यकता नहीं है। क्योंकि यह ब्रेस्ट कैंसर की भाषा समझता है, आप बस इससे पूछ सकते हैं, "क्या यहाँ कोई मास (द्रव्यमान) है?" और यह जानता है कि "मास" कैसा दिखता है, बिना इसके कि इसे विशेष रूप से इसे खोजने के लिए सिखाया गया हो।

    • उपमा: यह एक ऐसे शेफ की तरह है जिसने दुनिया के हर मसाले का स्वाद चखा है। आपको इसे "जीरा" की तस्वीर दिखाने की ज़रूरत नहीं है कि "क्या यह जीरा है?" वे बस जानते हैं।
  • शक्ति 2: भविष्यवक्ता (जोखिम भविष्यवाणी)
    यह 1 से 5 वर्षों में ब्रेस्ट कैंसर विकसित होने के जोखिम की भविष्यवाणी कर सकता है। लेकिन अन्य "ब्लैक बॉक्स" मॉडल के विपरीत जो केवल एक नंबर देते हैं (जैसे, "85% जोखिम"), Mammo-FM आपको बता सकता है कि क्यों

    • उपमा: एक सामान्य रिस्क कैलकुलेटर एक मौसम ऐप की तरह है जो कहता है "बारिश होगी।" Mammo-FM एक मौसम विज्ञानी की तरह है जो कहता है, "बारिश होगी क्योंकि पश्चिम से एक कम दबाव वाला सिस्टम आ रहा है, और आर्द्रता अधिक है।" यह जोखिम स्कोर को विशिष्ट दृश्य संकेतों और रिपोर्ट के वाक्यों से जोड़ता है।
  • शक्ति 3: ऑटो-राइटर (रिपोर्ट जनरेशन)
    रेडियोलॉजिस्ट रिपोर्ट लिखने में घंटों बिताते हैं। Mammo-FM उनके लिए एक ड्राफ्ट रिपोर्ट तैयार कर सकता है। लेकिन यहाँ ट्विस्ट यह है: यह केवल शब्दों का अनुमान नहीं लगाता है। यह एक "ग्राउंडिंग" चरण का उपयोग करता है जहाँ यह यह सुनिश्चित करने के लिए अपनी स्वयं की राइटिंग की वास्तविक छवि के विरुद्ध दोबारा जाँच करता है कि उसने ऐसी कोई ट्यूमर की कल्पना तो नहीं कर ली जो वहाँ नहीं है।

    • उपमा: यह एक जूनियर लेखक की तरह है जो एक कहानी का ड्राफ्ट तैयार करता है, लेकिन फिर एक सीनियर एडिटर (इमेज एनकोडर) हर वाक्य की जाँच करता है ताकि यह सुनिश्चित हो सके कि तथ्य तस्वीरों से मेल खाते हैं या नहीं, इससे पहले कि कहानी प्रकाशित हो।

4. यह "जनरलिस्ट" से बेहतर क्यों है

शोधकर्ताओं ने Mammo-FM की तुलना "जनरलिस्ट" AI मॉडल (जैसे MedGemma) से की जो सभी प्रकार के मेडिकल इमेज (एक्स-रे, सीटी स्कैन, एमआरआई) पर प्रशिक्षित होते हैं।

  • समस्या: जनरलिस्ट मॉडल स्पेस बचाने के लिए अक्सर इमेज को छोटा (squish) कर देते हैं, जिससे माइक्रो-कैलसिफिकेशन जैसे सूक्ष्म विवरण छूट जाते हैं। वे एक की-होल (चाबी के छेद) के माध्यम से हाई-डेफिनिशन फोटो देखने जैसे हैं।
  • समाधान: Mammo-FM पूरी, उच्च-रिज़ॉल्यूशन वाली इमेज को देखता है। यह सभी सूक्ष्म विवरणों को बनाए रखता है। भले ही Mammo-FM विशाल जनरलिस्ट मॉडलों की तुलना में छोटा और कम कंप्यूटिंग पावर का उपयोग करता है, फिर भी यह हर बार जीतता है क्योंकि इसे विशेष रूप से इसी काम के लिए बनाया गया था।

निष्कर्ष

Mammo-FM एक विशिष्ट, उच्च-रिज़ॉल्यूशन, द्विभाषी AI डिटेक्टिव है।

यह केवल तस्वीरें नहीं देखता; यह रिपोर्ट भी पढ़ता है। यह केवल अनुमान नहीं लगाता; यह अपने तर्क की व्याख्या करता है। सबसे बड़ी डेटासेट पर प्रशिक्षित होने और केवल ब्रेस्ट इमेजिंग पर ध्यान केंद्रित करने के कारण, यह अपने से पहले के "सब कुछ जानने वाले" (jack-of-all-trades) AI मॉडलों की तुलना में अधिक सटीक, अधिक कुशल और अधिक भरोसेमंद बन गया है। यह AI को रेडियोलॉजिस्ट के लिए केवल एक रहस्यमय उपकरण बनाने के बजाय, एक सहायक, पारदर्शी साथी बनाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →