OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models
OpenMedQ एक अत्याधुनिक मेडिकल विजन-लैंग्वेज मॉडल है जिसे 3.35 मिलियन नमूनों के एक व्यापक, पूर्णतः-ओपन डेटासेट पर प्रीट्रेन किया गया है, जो प्रमुख बेंचमार्क पर Med-PaLM M जैसे काफी बड़े मॉडलों से बेहतर प्रदर्शन करता है और डाउनस्ट्रीम मेडिकल क्लासिफिकेशन कार्यों में भी श्रेष्ठ प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को चिकित्सा की जटिल दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आमतौर पर, इसके लिए आपको दो चीजों की आवश्यकता होती है: एक "मस्तिष्क" जो मेडिकल रिपोर्ट पढ़ सके और एक जोड़ी "आंखें" जो एक्स-रे, सूक्ष्मदर्शी (microscopes) और पैथोलॉजी स्लाइड्स को देख सकें।
लंबे समय से, इस क्षेत्र के सबसे अच्छे रोबोट (AI मॉडल्स) गुप्त प्रतिभाशाली (secretive geniuses) की तरह रहे हैं। वे अविश्वसनीय रूप से स्मार्ट हैं, लेकिन उनके निर्माता उनकी प्रशिक्षण पुस्तकें (डेटा) और उनके मस्तिष्क के भार (weights) को छिपा कर रखते हैं। आप यह नहीं देख सकते कि उन्होंने कैसे सीखा, आप उनके ज्ञान का पुन: उपयोग नहीं कर सकते, और न ही उनकी गलतियों को सुधार सकते हैं। अन्य मॉडल विशेषज्ञ प्रशिक्षुओं (specialized apprentices) की तरह हैं; वे एक विशिष्ट कार्य (जैसे एक्स-रे पढ़ना) में बहुत अच्छे हैं लेकिन उन्हें पूरी तस्वीर समझने के लिए पर्याप्त किताबें नहीं पढ़ी हैं।
OpenMedQ इस समस्या का उत्तर है। यह एक नया, "ओपन-सोर्स" मेडिकल रोबोट है जिसे लेखकों ने एक ऐसे मॉडल को प्रशिक्षित करने के लिए बनाया है जिसने अब तक के सबसे बड़े, खुले और मुफ्त मेडिकल टेक्स्टबुक्स और इमेज सेट्स को इकट्ठा किया है।
यहाँ एक सरल उपमाओं का उपयोग करते हुए बताया गया है कि उन्होंने क्या किया और क्या पाया:
1. "पुस्तकालय" (प्रशिक्षण डेटा)
अधिकांश मेडिकल AI मॉडल एक छोटे, संकीर्ण पुस्तकालय की किताबों पर प्रशिक्षित होते हैं। हालाँकि, OpenMedQ को एक विशाल, विविध पुस्तकालय पर प्रशिक्षित किया गया था जिसमें लगभग 3.35 मिलियन उदाहरणों के साथ 14 अलग-अलग डेटासेट शामिल थे।
इसे इस तरह समझें:
- अन्य मॉडल शायद केवल हृदय के एक्स-रे वाली किताबें ही पढ़ें।
- OpenMedQ ने हृदय के एक्स-रे, मस्तिष्क के स्कैन, कोशिकाओं के सूक्ष्मदर्शी स्लाइड और यहाँ तक कि केवल टेक्स्ट-आधारित मेडिकल क्विज़ भी पढ़ीं।
- महत्वपूर्ण बात यह है कि इस पुस्तकालय की हर एक किताब खुली और मुफ्त थी जिसे कोई भी उपयोग कर सकता था। लेखकों ने अपने स्रोतों को नहीं छिपाया।
2. "मस्तिष्क" और "आंखें" (आर्किटेक्चर)
यह मॉडल एक मानक आधुनिक AI (जिसे LLaVA-शैली कहा जाता है) की तरह बना है।
- आंखें (विज़न एनकोडर): यह एक पूर्व-प्रशिक्षित "आंख" का उपयोग करता है जो पहले से ही मेडिकल इमेज देखने में अच्छी थी (BiomedCLIP नामक मॉडल से)।
- मस्तिष्क (लैंग्वेज मॉडल): यह उन आंखों को एक बड़े भाषाई मस्तिष्क (LLaMA-7B) से जोड़ता है जो पहले से ही मेडिकल टेक्स्ट में कुशल था।
- प्रशिक्षण: उन्होंने आँखों और मस्तिष्क को एक-दूसरे से बात करना सिखाने के लिए "नेक्स्ट-टोकन प्रेडिक्शन" नामक तकनीक का उपयोग किया। कल्पना कीजिए कि आप रोबोट को एक छवि और एक प्रश्न दिखा रहे हैं, और उससे उत्तर में अगले शब्द का अनुमान लगाने के लिए कह रहे हैं, और ऐसा बार-बार कर रहे हैं, जब तक कि वह पैटर्न को सीख न ले।
3. "टेस्ट ड्राइव" (परिणाम)
लेखकों ने यह देखने के लिए कि OpenMedQ ने कितनी अच्छी तरह सीखा, इसे दो मुख्य परीक्षणों से गुजारा।
परीक्षण A: "सामान्य ज्ञान" क्विज़ (विजुअल क्वेश्चन आंसरिंग)
उन्होंने रोबोट से छवियों के आधार पर मेडिकल प्रश्न पूछे (जैसे, "यह एक्स-रे क्या दिखाता है?")।
- परिणाम: OpenMedX ने बाहर मौजूद कुछ सबसे बड़े और सबसे महंगे मॉडल्स से अधिक स्कोर किया।
- उपमा: कल्पना कीजिए कि OpenMedQ एक छात्र है जिसके पास 7B-पैरामीटर वाला मस्तिष्क (एक मध्यम आकार का मस्तिष्क) है। इसने एक विशाल, 562B-पैरामीटर वाले मस्तिष्क (एक विशाल सुपरकंप्यूटर मस्तिष्क) के खिलाफ टेस्ट दिया। लगभग 80 गुना छोटा होने के बावजूद, OpenMedQ ने एक विशिष्ट टेस्ट (PathVQA) पर बेहतर स्कोर किया और दूसरे (VQA-MED) पर सर्वश्रेष्ठ स्कोर के बराबर प्रदर्शन किया।
- दावा: यह सिद्ध करता है कि एक विशाल, गुप्त मस्तिष्क होने की तुलना में एक व्यापक, खुला पुस्तकालय होना अधिक महत्वपूर्ण है।
परीक्षण B: "विशेषज्ञ" परीक्षा (इमेज क्लासिफिकेशन)
उन्होंने OpenMedQ के केवल "आंखों" (विज़न पार्ट) को लिया और उन्हें 8 अलग-अलग मेडिकल इमेज कार्यों पर परखा जिन्हें उन्होंने पहले कभी नहीं देखा था (जैसे अल्ट्रासाउंड में स्तन कैंसर या चेस्ट एक्स-रे में निमोनिया की पहचान करना)।
- परिणाम: OpenMedQ की आंखों ने तीन शीर्ष-स्तरीय मेडिकल मॉडल्स (BiomedCLIP, PMC-CLIP, PubMedCLIP) और शून्य से प्रशिक्षित एक मॉडल की तुलना में औसतन बेहतर प्रदर्शन किया।
- उपमा: यह एक ऐसे सामान्य चिकित्सक को लेने जैसा है जिसने हर चीज़ का थोड़ा बहुत अनुभव किया है और उनसे विशिष्ट बीमारियों का निदान करने के लिए कहना। क्योंकि उन्होंने अपने प्रशिक्षण के दौरान विविध मामलों को देखा था, इसलिए वे उन डॉक्टरों की तुलना में नए स्थितियों में पैटर्न पहचानने में बेहतर थे जो केवल एक संकीर्ण क्षेत्र में विशेषज्ञ थे।
4. कमी (सीमाएं)
लेखक इस बारे में ईमानदार हैं कि रोबोट अभी भी कहाँ संघर्ष कर रहा है।
- हर जगह पूर्ण नहीं: हालांकि OpenMedQ औसत रूप से सर्वश्रेष्ठ था, लेकिन यह हर श्रेणी में नहीं जीता। उदाहरण के लिए, स्तन अल्ट्रासाउंड छवियों पर, एक अन्य मॉडल अभी भी थोड़ा बेहतर था।
- सतही स्तर: टेस्ट स्कोर (BLEU-1) यह मापते हैं कि रोबोट के शब्द मानव उत्तरों के कितने समान हैं, न कि यह कि चिकित्सा तर्क 100% सही है या नहीं।
- "बड़ा मस्तिष्क" अभी भी कुछ मामलों में जीतता है: विशाल, गुप्त मॉडल्स (Med-PaLM M) ने रेडियोलॉजी और माइक्रोस्कोपी से जुड़े कुछ विशिष्ट, कठिन परीक्षणों में बेहतर प्रदर्शन किया।
निष्कर्ष
इस शोध का मुख्य संदेश यह है कि विविधता और खुलापन शक्तिशाली उपकरण हैं। एक महान मेडिकल AI बनाने के लिए आपको आवश्यक रूप से एक गुप्त, विशाल सुपरकंप्यूटर की आवश्यकता नहीं है। यदि आप एक मध्यम आकार के मॉडल को उपलब्ध सबसे व्यापक, खुले मेडिकल डेटा संग्रह पर प्रशिक्षित करते हैं, तो आप बहुत बड़े, बंद मॉडल्स को भी मात दे सकते हैं।
लेखकों ने अपना कोड, अपनी प्रशिक्षण विधियाँ और एक इंटरैक्टिव डेमो सार्वजनिक रूप से उपलब्ध करा दिया है, जिससे सभी को उनके काम का निरीक्षण करने, पुन: उपयोग करने और उसमें सुधार करने का आमंत्रण दिया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।