← नवीनतम पेपर
💬 NLP

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

प्रोमेड (ProMed) एक सुदृढीकरण अधिगम (reinforcement learning) ढांचा है जो चिकित्सा संबंधी लार्ज लैंग्वेज मॉडल्स को एक सक्रिय प्रश्न पूछने वाले प्रतिमान (proactive questioning paradigm) से सुसज्जित करता है, जिसमें नैदानिक रूप से मूल्यवान जानकारी एकत्र करने को प्राथमिकता देने के लिए 'शैप्ली इंफॉर्मेशन गेन' (Shapley Information Gain) रिवॉर्ड का उपयोग किया जाता है, जो नैदानिक सटीकता और सामान्यीकरण में मौजूदा प्रतिक्रियात्मक विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ProMed पेपर का स्पष्टीकरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी समस्या: "गेस-हू" (पहचानो कौन) का खेल

कल्पना कीजिए कि आप एक डॉक्टर हैं, लेकिन एक मरीज के आपके क्लिनिक में आने के बजाय, आप एक कंप्यूटर प्रोग्राम (एक AI) हैं जो एक रहस्य को सुलझाने की कोशिश कर रहा है।

वास्तविक दुनिया में, एक मरीज आमतौर पर आकर कहता है, "मेरे पेट में दर्द हो रहा है।" एक समझदार डॉक्टर तुरंत यह अनुमान नहीं लगाता कि "अपेंडिसाइटिस (Appendicitis) है।" इसके बजाय, वे पूछते हैं, "क्या दर्द दाईं ओर अधिक है?" या "क्या आपको उल्टी भी हुई है?" वे कदम-दर-कदम सुराग इकट्ठा करते हैं।

हालाँकि, वर्तमान मेडिकल AI एक ऐसे छात्र की तरह हैं जो परीक्षा पास करने के लिए बहुत अधिक उत्सुक है। जैसे ही वे देखते हैं "पेट में दर्द है," वे बिना कोई फॉलो-अप सवाल पूछे तुरंत चिल्ला उठते हैं, "अपेंडिसाइटिस!" यदि वे गलत होते हैं, तो इसका कारण यह है कि उन्होंने पर्याप्त सुरागों के लिए प्रतीक्षा नहीं की। इसे रिएक्टिव (Reactive) दृष्टिकोण (जानकारी का इंतज़ार करना, फिर अनुमान लगाना) कहा जाता है। यह पेपर तर्क देता है कि हमें प्रोएक्टिव (Proactive) दृष्टिकोण (अनुमान लगाने से पहले सक्रिय रूप से सुरागों की तलाश करना) की आवश्यकता है।

समाधान: ProMed

शोधकर्ताओं ने एक नया प्रशिक्षण सिस्टम बनाया है जिसे ProMed कहा जाता है। ProMed को एक "कोच" के रूप में सोचें जो AI को एक अंदाज़ा लगाने वाले के बजाय एक जासूस बनने का तरीका सिखाता है। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक एक विशेष खेल का उपयोग करता है (जहाँ AI चीज़ों को आज़माकर और अच्छे मूव्स के लिए अंक प्राप्त करके सीखता है)।

लेकिन एक समस्या थी: आप एक AI को एक अच्छा सवाल पूछने के लिए अंक कैसे देंगे?

  • यदि AI पूछता है, "क्या आपके सिर में दर्द है?" और मरीज कहता है "हाँ," तो क्या यह एक अच्छा सवाल है? शायद।
  • यदि AI पूछता है, "क्या आपके सिर में दर्द है?" और मरीज कहता "नहीं," तो क्या यह एक बुरा सवाल है? शायद नहीं; इसने किसी चीज़ को खारिज कर दिया।

इस समस्या को हल करने के लिए पेपर एक नया स्कोरिंग सिस्टम पेश करता है जिसे शैप्ली इंफॉर्मेशन गेन (Shapley Information Gain - SIG) कहा जाता है।

गुप्त मंत्र: "शैप्ली" स्कोर

SIG को समझने के लिए, कल्पना कीजिए कि आप एक दोस्त के साथ जिग्सॉ पज़ल (jigsaw puzzle) सुलझा रहे हैं।

  • तथ्य A: आकाश नीला है।
  • तथ्य B: आकाश में एक पक्षी है।
  • तथ्य C: पक्षी गा रहा है।

यदि आपके पास केवल तथ्य A है, तो तस्वीर धुंधली है। यदि आप तथ्य B जोड़ते हैं, तो यह स्पष्ट हो जाता है। यदि आप तथ्य C जोड़ते हैं, तो यह बहुत विशिष्ट हो जाता है।
कभी-कभी, तथ्य B तब तक बेकार है जब तक आपके पास तथ्य A न हो। कभी-कभी, तथ्य C वह "जादुई टुकड़ा" होता है जो अंततः पहेली को सुलझा देता है।

पुराने तरीके हर सवाल को समान अंक देने जैसा मानते थे। ProMed शैप्ली वैल्यूज (Shapley Values) (गेम थ्योरी से एक गणितीय अवधारणा) का उपयोग यह पता लगाने के लिए करता है कि एक विशिष्ट प्रश्न जो आप पहले से जानते हैं उसके संदर्भ में कितना नया मूल्य जोड़ता है।

  • उपमा: एक स्पोर्ट्स टीम की कल्पना करें। यदि कोई खिलाड़ी गोल करता है, तो उसे कितना श्रेय मिलता है? यदि टीम पहले से ही आसानी से जीत रही थी, तो शायद बहुत ज़्यादा नहीं। यदि खिलाड़ी ने गोल करने के लिए एक पास दिया था, तो उसे उस इंटरेक्शन के लिए श्रेय मिलता है।
  • ProMed का SIG गणना करता है: "अब तक हम जो कुछ भी जानते हैं, उसे देखते हुए, इस विशिष्ट प्रश्न ने हमें सही निदान (diagnosis) के कितने करीब पहुँचाया?" यह उन सवालों को पुरस्कृत करता है जो पहेली के सबसे बड़े अंतराल को भरते हैं।

ProMed AI को कैसे प्रशिक्षित करता है (दो चरणों वाली योजना)

पेपर एक दो-चरणीय प्रशिक्षण प्रक्रिया का वर्णन करता है, जैसे एक स्पोर्ट्स टीम बड़े मैच की तैयारी करती है।

चरण 1: "रिप्ले" चरण (इनिशियलाइजेशन)
असली खेल खेलने से पहले, कोच (ProMed) मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) नामक तकनीक का उपयोग करके हजारों सिमुलेशन चलाता है।

  • कल्पना कीजिए कि AI "20 Questions" का खेल खेल रहा है। कोच जवाब तक पहुँचने के लिए परफेक्ट रास्ता खोजने के लिए लाखों अलग-अलग बातचीत का सिमुलेशन करता है।
  • कोच उन बातचीत की तलाश करता है जहाँ AI ने सबसे अच्छे सवाल पूछे (वे सवाल जिनका SIG स्कोर सबसे अधिक था) और सही उत्तर प्राप्त किया।
  • AI फिर इन "परफेक्ट रिप्ले" का अध्ययन करता है ताकि सही आदतें सीख सके। इसे सुपरवाइज्ड फाइन-ट्यूनिंग (Supervised Fine-Tuning) कहा जाता है।

चरण 2: "लाइव गेम" चरण (ऑप्टिमाइजेशन)
अब AI वास्तविक (सिम्युलेटेड) मरीजों के खिलाफ खेलता है।

  • मानक प्रशिक्षण में, यदि AI अंतिम उत्तर सही देता है, तो उसके द्वारा बोला गया हर एक शब्द इनाम पाता है। यह अनुचित है; हो सकता है कि AI ने एक मूर्खतापूर्ण सवाल पूछा हो लेकिन अंत में वह भाग्यशाली रहा हो।
  • ProMed एक रिवॉर्ड डिस्ट्रीब्यूशन मैकेनिज्म (Reward Distribution Mechanism) पेश करता है। यह पूरी बातचीत को देखता है और कहता है: " 'रैश' (rash) के बारे में सवाल शानदार था और इसने 10 अंक कमाए। 'मौसम' के बारे में सवाल बेकार था और इसने 0 अंक कमाए।"
  • यह "शानदार" सवालों को अधिक श्रेय और "बेकार" वाले सवालों को कम श्रेय देता है। यह AI को सटीक और कुशल बनना सिखाता है, न कि केवल बातें करना।

परिणाम: क्या यह काम आया?

शोधकर्ताओं ने चिकित्सा परीक्षाओं (जैसे USMLE) पर ProMed का परीक्षण किया और पाया:

  1. यह बेहतर सवाल पूछता है: AI ने तुरंत अनुमान लगाना बंद कर दिया और लक्षित फॉलो-अप सवाल पूछना शुरू कर दिया।
  2. यह अधिक निदान सही करता है: औसतन, ProMed मौजूदा सर्वोत्तम तरीकों की तुलना में 6.29% अधिक सटीक था।
  3. यह एक बड़ी छलांग है: केवल अनुमान लगाने वाले एआई ( "रिएक्टिव" शैली) की तुलना में, ProMed 54% बेहतर था।
  4. यह नई स्थितियों में स्मार्ट है: यहाँ तक कि जब AI को उन मेडिकल मामलों का सामना करना पड़ा जिन्हें उसने पहले कभी नहीं देखा था (अलग बीमारियाँ या अलग डेटा), तब भी इसने अच्छा प्रदर्शन किया। इसने केवल उत्तरों को रटा नहीं; इसने सोचना सीखा।

निष्कर्ष

ProMed मेडिकल AI को प्रशिक्षित करने का एक नया तरीका है। उन्हें केवल तथ्य याद करने या उत्तरों का अनुमान लगाने के लिए मजबूर करने के बजाय, यह उन्हें सही समय पर सही सवाल पूछना सिखाता है। एकत्रित की गई जानकारी की गुणवत्ता को महत्व देने वाले एक गणितीय "स्कोरकार्ड" (SIG) का उपयोग करके, ProMed मेडिकल AI को उत्सुक अंदाज़ा लगाने वालों से सावधान और प्रोएक्टिव जासूसों में बदल देता है।

नोट: पेपर इस बात पर जोर देता है कि यह वर्तमान में एक शोध उपकरण है। इसे शोधकर्ताओं को बेहतर सिस्टम बनाने में मदद करने के लिए डिज़ाइन किया गया है, न कि अभी अस्पताल में वास्तविक डॉक्टरों की जगह लेने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →