← नवीनतम पेपर
🤖 machine learning

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC एक स्वचालित फ्रेमवर्क पेश करता है जो 6.1 मिलियन PubMed Central लेखों से 11 मिलियन उच्च-सटीकता वाले मेडिकल इमेज-टेक्स्ट पेयर्स को क्यूरेट करता है, जो मौजूदा बेसलाइन्स की तुलना में ज़ीरो-शॉट क्लासिफिकेशन, विजुअल क्वेश्चन अनस्वर्सिंग और क्लिनिकल रिट्रीवल बेंचमार्क में मेडिकल मल्टीमॉडल फाउंडेशन मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gu
प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को डॉक्टर बनना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, कंप्यूटर को मेडिकल इमेज (जैसे एक्स-रे या त्वचा की तस्वीरें) को "देखने" और उन्हें समझाने वाले टेक्स्ट को "पढ़ने" की आवश्यकता होती है। लेकिन एक बहुत बड़ी समस्या है: गोपनीयता कानूनों के कारण अस्पतालों में वास्तविक रोगी डेटा सुरक्षित रखा जाता है, और एक स्मार्ट AI को प्रशिक्षित करने के लिए पर्याप्त डेटा प्राप्त करना बहुत कठिन है।

इस शोध पत्र के पीछे के शोधकर्ताओं ने MedPMC के माध्यम से एक चतुर समाधान निकाला। उन्होंने महसूस किया कि दुनिया का सबसे बड़ा चिकित्सा ज्ञान का पुस्तकालय, PubMed Central (PMC), विशेषज्ञों द्वारा लिखे गए लाखों लेखों से भरा हुआ है। इन लेखों में हजारों मेडिकल इमेज और उन्हें वर्णित करने वाला टेक्स्ट मौजूद है। हालाँकि, इस लाइब्रेरी से सब कुछ डाउनलोड करना ऐसा ही है जैसे एक पूरे कबाड़खाने को अपने लॉट पर डालकर घर बनाने की कोशिश करना—यह उपयोगी सामग्री से भरा है, लेकिन यह कचरे (जैसे ग्राफ, चार्ट और आणविक आरेख जो वास्तविक रोगी की तस्वीरें नहीं हैं) और अव्यवस्थित बंडलों (जहाँ एक इमेज में चार अलग-अलग तस्वीरें एक लंबे, भ्रमित करने वाले कैप्शन के साथ चिपकी हुई हैं) से भी भरा है।

उन्होंने इसे कैसे साफ किया और उन्हें क्या मिला, इसका सरल विवरण यहाँ दिया गया है:

1. "स्मार्ट लाइब्रेरियन" सिस्टम (फ्रेमवर्क)

सब कुछ बस यूँ ही इकट्ठा करने के बजाय, टीम ने 6.1 मिलियन लेखों को छाँटने के लिए एक स्वचालित, पाँच-चरणीय "स्मार्ट लाइब्रेरियन" सिस्टम बनाया। इसे एक हाई-टेक असेंबली लाइन की तरह समझें:

  • चरण 1: गेटकीपर (द्वारपाल)। यह इमेज डाउनलोड करने से पहले टेक्स्ट को पढ़ता है। यदि टेक्स्ट वास्तव में किसी वास्तविक चिकित्सा स्थिति के बारे में लगता है, तो यह फ़ाइल को रखता है। यदि यह केवल एक गणितीय ग्राफ या रसायन विज्ञान का आरेख है, तो यह उसे फेंक देता है। इससे उन्हें बेकार का टेराबाइट्स डेटा डाउनलोड करने से बचने में मदद मिली।
  • चरण 2: अनरैपर (अनपैक करने वाला)। कई मेडिकल इमेज "कंपाउंड फिगर्स" होते हैं—एक बड़ा बॉक्स जिसमें चार या पाँच छोटी तस्वीरें होती हैं (जैसे माइक्रोस्कोप स्लाइड का ग्रिड)। सिस्टम इन्हें पहचानता है और सावधानी से इन्हें अलग-अलग टुकड़ों में काट देता है।
  • चरण 3: टेलर (दर्जी)। एक बार जब तस्वीरों को काट दिया जाता है, तो लंबे, अव्यवस्थित कैप्शन को भी काटना पड़ता है। सिस्टम प्रत्येक छोटी तस्वीर को उसके विशिष्ट छोटे वाक्य के साथ जोड़ता है। पहले, कंप्यूटर अक्सर इन्हें आपस में मिला देते थे, लेकिन यह सिस्टम इसे उच्च सटीकता के साथ करता है।
  • चरण 4: क्वालिटी कंट्रोल (गुणवत्ता नियंत्रण)। यह हर एक छोटी तस्वीर की फिर से जाँच करता है कि क्या वह वास्तव में एक मेडिकल इमेज है या कोई बचा हुआ चार्ट या आरेख है।
  • चरण 5: परिणाम। इस अव्यवस्थित लाइब्रेरी से, उन्होंने 11 मिलियन उच्च-गुणवत्ता वाले, साफ मेडिकल इमेज-और-टेक्स्ट पेयर्स तैयार किए।

2. "ताजगी" का कारक (The Freshness Factor)

अधिकांश डेटासेट 2020 में लिए गए किसी पुस्तकालय के स्नैपशॉट की तरह होते हैं; जैसे ही नए किताबें प्रकाशित होती हैं, वे पुराने हो जाते हैं। MedPMC अलग है। इसे लगातार अपडेट होने के लिए डिज़ाइन किया गया है। जैसे-जैसे नए मेडिकल लेख प्रकाशित होते हैं, सिस्टम स्वचालित रूप से उन्हें प्रोसेस कर सकता है। 2020 के बाद से, यह हर साल दस लाख से अधिक नए, उपयोगी इमेज-टेक्स्ट पेयर्स खोज रहा है।

3. "डॉक्टर-इन-ट्रेनिंग" (मॉडल)

शोधकर्ताओं ने इस साफ, ताज़ा डेटा का उपयोग करके एक नया AI मॉडल प्रशिक्षित किया जिसे MedPMC-CLIP कहा जाता है। यह देखने के लिए कि क्या यह काम करता है, उन्होंने इसे परीक्षणों की एक श्रृंखला से गुजारा:

  • "ब्लाइंड" टेस्ट (ज़ीरो-शॉट): उन्होंने AI को उन बीमारियों की पहचान करने के लिए कहा जिन्हें उसने पहले कभी नहीं देखा था, बिना किसी अतिरिक्त प्रशिक्षण के।
    • परिणाम: इसने पिछले सर्वश्रेष्ठ मॉडलों को एक महत्वपूर्ण अंतर से पीछे छोड़ दिया (औसतन लगभग 7% बेहतर), भले ही इसे अन्य मॉडलों की तुलना में कम डेटा पर प्रशिक्षित किया गया था। यह एक ऐसे छात्र की तरह था जिसने कम पाठ्यपुस्तकें पढ़ीं लेकिन सामग्री को बेहतर ढंग से समझा क्योंकि पाठ्यपुस्तकें उच्च गुणवत्ता वाली थीं।
  • "प्रश्न उत्तर" टेस्ट: उन्होंने इस AI को एक बड़े सिस्टम में प्लग किया जो चिकित्सा संबंधी प्रश्नों के उत्तर देता है।
    • परिणाम: जब सिस्टम ने MedPMC-प्रशिक्षित "आंखों" का उपयोग किया, तो वह छवियों में जो देख रहा था, उसके बारे में प्रश्नों के उत्तर देने में बहुत बेहतर हो गया।
  • "वास्तविक दुनिया" का टेस्ट: उन्होंने न्यू हेवन के एक अस्पताल से 10,000 वास्तविक त्वचा की तस्वीरों पर इसका परीक्षण किया। लक्ष्य यह देखना था कि क्या AI त्वचा के रैश (rash) के विवरण को देखकर अस्पताल के डेटाबेस में मिलान करने वाली फोटो ढूंढ सकता है।
    • परिणाम: यह पिछले सर्वश्रेष्ठ मॉडलों की तुलना में सही फोटो खोजने में काफी बेहतर था।

4. यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि मेडिकल AI की समस्या केवल यह नहीं है कि हमें अधिक डेटा चाहिए, बल्कि यह है कि हमें बेहतर डेटा चाहिए। पिछले प्रयासों में अक्सर मेडिकल लिटरेचर का उपयोग किया गया जिसमें बहुत अधिक "शोर" (गैर-चिकित्सा चित्र) शामिल था और चित्रों को उनके विवरण के साथ ठीक से नहीं मिलाया गया था।

डेटा क्यूरेशन को एक कठोर इंजीनियरिंग प्रक्रिया के रूप में मानकर—सफाई, अलगाव और डेटा का सटीक संरेखण—उन्होंने दिखाया कि आप वास्तविक रोगी रिकॉर्ड प्राप्त करने के लिए गोपनीयता कानूनों को तोड़े बिना एक स्मार्ट, अधिक सामान्यीकरण योग्य मेडिकल AI बना सकते हैं।

संक्षेप में: उन्होंने मेडिकल लेखों की एक अव्यवस्थित, असंगठित लाइब्रेरी को एक स्वच्छ, पूरी तरह से व्यवस्थित प्रशिक्षण नियमावली (training manual) में बदल दिया। जब उन्होंने इस नियमावली का उपयोग करके एक AI को सिखाया, तो वह पुराने, अव्यवस्थित मैनुअल से सीखे गए AI की तुलना में बहुत बेहतर "डॉक्टर" बन गया। उन्होंने इस सिस्टम, डेटा और प्रशिक्षित AI को सभी के उपयोग के लिए उपलब्ध करा दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →