← नवीनतम पेपर
🤖 AI

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

MedPixel एक एकीकृत मेडिकल पिक्सेल-लैंग्वेज मॉडल है जो एक नव-निर्मित 440K-नमूना डेटासेट (MedPLG-440K) और एक नवीन पिक्सेल-लेवल प्रेफरेंस ऑप्टिमाइज़ेशन रणनीति का लाभ उठाकर विजुअल रीजनिंग और सटीक लोकलाइजेशन के बीच के अंतर को पाटता है ताकि सेगमेंटेशन, रीजनिंग और ज़ीरो-शॉट ट्रांसफर सहित विविध चिकित्सा कार्यों में उत्कृष्ट प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai Jiang

प्रकाशित 2026-08-11
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए एक ऐसी दुनिया की जहाँ कंप्यूटर चित्रों को देख सकते हैं और आपको ठीक-ठीक बता सकते हैं कि वे क्या देख रहे हैं, लेकिन वे किसी विशिष्ट स्थान की ओर उंगली दिखाने में बहुत खराब हैं। अब, एक दूसरे प्रकार के कंप्यूटर की कल्पना करें जो फोटो में वस्तुओं के चारों ओर सटीक रूपरेखा (outlines) बनाने में अद्भुत है, लेकिन वह यह समझाने के लिए मानव भाषा का एक भी शब्द नहीं बोल सकता कि उसने वह रेखा क्यों खींची। लंबे समय तक, इस प्रकार के दो "दृष्टाओं" (visionaries) अलग-अलग घरों में रहते थे, आपस में शायद ही कभी बात करते थे। यह मेडिकल एआई (Medical AI) की वर्तमान स्थिति है: कुछ मॉडल एक्स-रे पढ़ने और रिपोर्ट लिखने में माहिर हैं, जबकि अन्य तस्वीरों में ट्यूमर को हाइलाइट करने में अच्छे हैं, लेकिन इन दोनों को जोड़ना ऐसा था जैसे किसी तोते को उड़ते समय एक चित्र बनाने के लिए सिखाना।

यह अंतर महत्वपूर्ण है क्योंकि डॉक्टरों को केवल तथ्यों की सूची या एक स्थिर चित्र की आवश्यकता नहीं होती; उन्हें एक ऐसे साथी की आवश्यकता होती है जो एक स्कैन को देख सके, तर्क कर सके कि क्या गलत है, और फिर समस्या के महत्व को समझाते हुए सीधे समस्या की ओर इशारा कर सके। आप जिस शोध पत्र को पढ़ने जा रहे हैं, वह इसी चुनौती से निपटता है। यह एक नए प्रकार के एआई को पेश करता है जो एक सेतु (bridge) के रूप में कार्य करता है, जो एक साथ बोलना, सोचना और चित्र बनाना सीखता है। समाधान में उतरने से पहले, यह समझना मददगार है कि यह किन उपकरणों का उपयोग करता है। "विज़न-लैंग्वेज मॉडल्स" (Vision-Language Models) को स्मार्ट सहायकों के रूप में समझें जो एक तस्वीर पढ़ सकते हैं और उसके बारे में प्रश्न का उत्तर दे सकते हैं, जैसे "यह कौन सा अंग है?" लेकिन वे आमतौर पर यह नहीं कह सकते, "यहाँ ट्यूमर है," और उसके चारों ओर घेरा नहीं बना सकते। दूसरी ओर, "सेगमेंटेशन मॉडल्स" (Segmentation Models) कुशल मानचित्रकारों की तरह हैं जो प्रत्येक अंग या बीमारी का सटीक नक्शा बना सकते हैं, लेकिन उन्हें आमतौर पर विशिष्ट निर्देशों की आवश्यकता होती है, जैसे "बायां गुर्दा (left kidney) बनाओ," और यदि आप उनसे किसी जटिल चिकित्सा संकेत के बारे में तर्क करने के लिए कहते हैं, जैसे "उस क्षेत्र को खोजें जो ऑक्सीजन की कमी महसूस कर रहा है," तो वे संघर्ष करते हैं। इस शोध का लक्ष्य इन कौशलों को एक ही मस्तिष्क में मिलाना है जो दोनों कर सके, और इसके लिए एक विशेष तकनीक का उपयोग करना है जिससे वह खुद को सटीक होना सिखा सके बिना इस बात की आवश्यकता के कि हर एक चित्र को इंसान द्वारा ग्रेड किया जाए।

समस्या: महान विभाजन (The Great Divide)

मेडिकल एआई की दुनिया में, एक निराशाजनक विभाजन रहा है। एक तरफ, आपके पास ऐसे मॉडल हैं जो भाषा और छवियों को एक साथ समझने में माहिर हैं। वे "क्या यह निमोनोनिया है?" जैसे प्रश्नों का उत्तर दे सकते हैं या स्कैन के बारे में रिपोर्ट लिख सकते हैं। लेकिन यदि आप उनसे पूछते हैं कि निमोनोनिया वास्तव में चित्र में कहाँ है, तो वे अक्सर भटक जाते हैं या केवल अस्पष्ट अनुमान लगाते हैं। दूसरी ओर, आपके पास ऐसे मॉडल हैं जो सेगमेंटेशन (रेखांकन) में अविश्वसनीय हैं—अंगों या बीमारियों के चारों ओर सटीक रूपरेखा बनाना। हालाँकि, इन मॉडलों को आमतौर पर बहुत विशिष्ट निर्देशों की आवश्यकता होती है, जैसे "बायां गुर्दा बनाओ," और वे किसी जटिल चिकित्सा संकेत के माध्यम से तर्क करने में संघर्ष करते हैं, जैसे "उस क्षेत्र को खोजें जो ऑक्सीजन की कमी महसूस कर रहा है।"

शोधकर्ताओं ने देखा कि इन मॉडलों को प्रशिक्षित करने के लिए उपयोग किए जाने वाले डेटा भी विभाजित थे। रेखांकन (segmentation) के लिए उपयोग किए जाने वाले डेटासेट में हजारों सटीक चित्र थे लेकिन उनके साथ लगभग कोई भाषा नहीं थी। चिकित्सा संबंधी प्रश्नों के लिए उपयोग किए जाने वाले डेटासेट में बहुत सारा टेक्स्ट था लेकिन उनमें शायद ही कभी उन सटीक चित्रों को शामिल किया गया था जिनकी आवश्यकता एआई को यह सिखाने के लिए होती है कि कैसे इशारा किया जाए। इसने एक बाधा उत्पन्न की: एक वास्तव में स्मार्ट मेडिकल एआई बनाने के लिए, आपको बहुत बड़ी मात्रा में डेटा की आवश्यकता थी जो भाषा और सटीक रेखांकन दोनों को जोड़ता हो, लेकिन उस डेटा को प्राप्त करना महंगा और कठिन था।

समाधान: मेडपिक्सेल (MedPixel) और "मेडपीएलजी-440के" (MedPLG-440K) का जादू

यहाँ आता है MedPixel, एक नया एकीकृत मॉडल जिसे अंतिम मेडिकल जासूस बनने के लिए डिज़ाइन किया गया है। दो अलग-अलग मॉडलों को एक-दूसरे से बात करने के लिए मजबूर करने के बजाय, MedPixel को शुरू से ही शब्दों और पिक्सेल दोनों को एक साथ समझने के लिए बनाया गया है। यह एक चतुर इंटरफ़ेस का उपयोग करता है जहाँ एक विशेष टोकन (इसे एक जादुई शब्द, <SEG> के रूप में सोचें) मॉडल को बताता है, "ठीक है, अब बोलना बंद करो और चित्र बनाना शुरू करो।"

लेकिन आप एक मॉडल को एक ही समय में बोलने और चित्र बनाने के लिए कैसे सिखा सकते हैं बिना लाखों छवियों को लेबल करने के लिए हजारों डॉक्टरों को काम पर रखे? लेखकों ने MedPLG-440K नामक एक डेटासेट बनाया। यह नए चित्रों का संग्रह नहीं है; यह मौजूदा चिकित्सा रेखांकनों का एक चतुर पुनर्कल्पना है। शोधकर्ताओं ने पहले से मौजूद हजारों चिकित्सा छवियों को लिया जिनमें पहले से ही रेखांकन (मास्क) बने हुए थे और उन रेखांकनों को भाषा के पाठों में बदलने के लिए एक स्मार्ट प्रक्रिया का उपयोग किया।

कल्पना कीजिए कि आपके पास एक ट्यूमर का चित्र है। केवल चित्र रखने के बजाय, सिस्टम ट्यूमर के आकार, आकार और बनावट को देखता है और स्वचालित रूप से उसका विवरण लिखता है: "केंद्र में एक छोटा, अंडाकार ट्यूमर है जिसके किनारे चिकने हैं।" फिर यह एक संवाद बनाता है जहाँ एक डॉक्टर पूछता है, "क्या आप मुझे ट्यूमर दिखा सकते हैं?" और एआई विवरण और चित्र दोनों के साथ उत्तर देता है। उन्होंने यह लगभग 440,000 विभिन्न परिदृश्यों के लिए किया, जो चार मुख्य प्रकार की अंतःक्रियाओं को कवर करता है:

  1. रेफरिंग सेगमेंटेशन (Referring Segmentation): "दायां गुर्दा बनाओ।"
  2. रीज़निंग सेगमेंटेशन (Reasoning Segmentation): "उस क्षेत्र को खोजें जो ऑक्सीजन की कमी महसूस कर रहा है।" (एआई को चित्र बनाने से पहले यह समझना होगा कि वह क्या है)।
  3. इंटरैक्टिव सेगमेंटेशन (Interactive Segmentation): "जो मैं इशारा कर रहा हूँ उसे बनाओ।"
  4. एक्सप्लेनेटरी सेगमेंटेशन (Explanatory Segmentation): "इस ट्यूमर का वर्णन करें और इसे बनाएँ।"

महत्वपूर्ण रूप से, उन्होंने यह बिना किसी बाहरी लार्ज लैंग्वेज मॉडल (LLM) का उपयोग किए किया, यह सुनिश्चित करते हुए कि डेटा पूरी तरह से चिकित्सा छवियों और उनके मौजूदा रेखांकनों से उत्पन्न हुआ है।

गुप्त नुस्खा: पीएलपीओ (PLPO)

मॉडल को यह सब करने के लिए प्रशिक्षित करना केवल आधी लड़ाई है। शोधकर्ताओं ने महसूस किया कि एक मॉडल एक आदर्श वाक्य लिख सकता है लेकिन एक खराब रेखांकन भी बना सकता है, या इसके विपरीत। इसे ठीक करने के लिए, उन्होंने पिक्सेल-लेवल प्रेफरेंस ऑप्टिमाइज़ेशन (PLPO) नामक एक प्रशिक्षण तकनीक पेश की।

PLPO को एक सख्त कला शिक्षक के रूप में सोचें जो केवल निबंध को ग्रेड नहीं देता; वे उसके साथ आने वाले चित्र को भी ग्रेड देते हैं। प्रशिक्षण के दौरान, मॉडल एक ही प्रश्न के लिए कई अलग-अलग उत्तर उत्पन्न करता है। कुछ उत्तर बहुत अच्छे लग सकते हैं लेकिन परिणाम स्वरूप खराब चित्र बन सकते हैं। अन्य थोड़े कम शानदार हो सकते हैं लेकिन एक सटीक रूपरेखा दे सकते हैं। PLPO "ग्राउंड ट्रुथ" (सही, वास्तविक दुनिया का चित्र) को देखता है और मॉडल के प्रयासों को इस आधार पर रैंक करता है कि उनके चित्र वास्तविक चीज़ के कितने करीब थे। फिर यह मॉडल को उन उत्तरों को प्राथमिकता देने के लिए सिखाता है जो सबसे अच्छे चित्र बनाने की ओर ले जाते हैं। यह मॉडल के "मस्तिष्क" (भाषा) को उसके "हाथ" (चित्र) के साथ संरेखित करता है, यह सुनिश्चित करता है कि जब वह बोले, तो वह सही स्थान की ओर इशारा कर रहा हो।

उन्होंने क्या पाया

परिणाम प्रभावशाली थे। MedPixel ने केवल औसत प्रदर्शन नहीं किया; यह सभी क्षेत्रों में एक शीर्ष प्रदर्शन करने वाला बन गया।

  • सटीकता (Precision): उन कार्यों पर जहाँ एआई को विशिष्ट अंगों या बीमारियों को दिखाना था, MedPixel ने सरल "इशारा करने" वाले कार्यों के लिए 85.0 का डाइस स्कोर (Dice score) और जटिल "तर्क" वाले कार्यों के लिए 66.7 प्राप्त किया (जहाँ उसे पहले यह समझना था कि क्या बनाना है)। यह उन पिछले मॉडलों की तुलना में काफी बेहतर था जो दोनों कार्य करने की कोशिश करते थे।
  • तर्क (Reasoning): मॉडल ने कठिन प्रश्नों को संभालने की क्षमता दिखाई। उदाहरण के लिए, जब "हाइपोक्सिमिया" (ऑक्सीजन की कमी) और "बाइलेटरल इन्फिल्ट्रेट्स" (दोनों तरफ के जमाव) से जुड़े क्षेत्र को खोजने के लिए पूछा गया, तो इसने सफलतापूर्वक लक्ष्य का अनुमान लगाया और सही मास्क बनाया, एक ऐसा कार्य जहाँ अन्य मॉडल अक्सर विफल हो जाते हैं।
  • मजबूती (Robustness): सबसे दिलचस्प निष्कर्षों में से एक यह था कि मॉडल ने अस्पष्ट निर्देशों को कैसे संभाला। यदि किसी उपयोगकर्ता ने मार्गदर्शन के लिए थोड़ा गलत बॉक्स या बिंदु दिया, तो MedPixel अपनी भाषा कौशल का उपयोग करके स्पष्ट कर सकता था कि क्या अर्थ था और फिर भी सही रूपरेखा बना सकता था। यह पिछले "पॉइंट-एंड-ड्रॉ" मॉडलों की तुलना में मानवीय त्रुटियों के प्रति बहुत अधिक सहनशील था।
  • सामान्यीकरण (Generalization): यहाँ तक कि जब इसका परीक्षण उस चिकित्सा डेटा पर किया गया जिसे इसने पहले कभी नहीं देखा था (जीरो-शॉट ट्रांसफर), MedPixel अन्य मॉडलों से बेहतर प्रदर्शन करता रहा, जिससे सिद्ध हुआ कि इसने केवल विशिष्ट छवियों को याद करने के बजाय चिकित्सा तर्क की अवधारणा को सीखा है।

यह क्यों मायने रखता है

यह कार्य सुझाव देता है कि हमें एक ऐसे मॉडल को चुनने की आवश्यकता नहीं है जो बात कर सके और एक ऐसा मॉडल जो चित्र बना सके। उन्हें एकीकृत करके और एक स्मार्ट प्रशिक्षण पद्धति का उपयोग करके जो अच्छे चित्रों को पुरस्कृत करती है, हम ऐसे एआई सहायकों का निर्माण कर सकते हैं जो मानव डॉक्टरों के सोचने के तरीके के बहुत करीब हैं: अवलोकन करना, तर्क करना, समझाना और समस्याओं को एक साथ पहचानना। हालाँकि मॉडल की अभी भी कुछ सीमाएँ हैं—जैसे सीखने के लिए मौजूदा डेटा की आवश्यकता और मुख्य रूप से पूर्ण 3D वॉल्यूम के बजाय 2D स्लाइस पर काम करना—यह एक ऐसे एआई की दिशा में एक महत्वपूर्ण कदम है जो वास्तव में चिकित्सा की दृश्य और भाषाई जटिलता को समझ सकता है। लेखक आश्वस्त हैं कि यह दृष्टिकोण अधिक इंटरैक्टिव और विश्वसनीय चिकित्सा उपकरणों के द्वार खोलता है, जहाँ एआई केवल अनुमान नहीं लगाता, बल्कि सटीकता के साथ इशारा करता है और स्पष्टता के साथ समझाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →