← नवीनतम पेपर
💬 NLP

ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering

ConRub-Med ओपन-एंडेड मेडिकल क्वेश्चन आंसरिंग के लिए एक रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो सर्वसम्मति-आधारित, मॉडल-जनरेटेड रूब्रिक्स और एक विशिष्ट तीन-अवस्था वाली स्कोरिंग प्रणाली का उपयोग करता है ताकि कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके और साथ ही महंगी विशेषज्ञ सत्यापन पर निर्भरता को कम किया जा सके।

मूल लेखक: Taojie Zhu, Yuan Xia, Tao Sun, Yizhi Wang, Yan Chen, Qunshan He, Tian Guan, Jian Wang, Jinjie Gu, Junwei Liu, Yonghong He

प्रकाशित 2026-08-12
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taojie Zhu, Yuan Xia, Tao Sun, Yizhi Wang, Yan Chen, Qunshan He, Tian Guan, Jian Wang, Jinjie Gu, Junwei Liu, Yonghong He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डॉक्टर बनना सिखाने की कोशिश कर रहे हैं। आप केवल उससे किसी चिकित्सा प्रश्न का उत्तर अनुमान लगाने और उसे 'गोल्ड स्टार' मिलने की उम्मीद नहीं करेंगे; आप चाहेंगे कि वह यह समझाए कि उसे क्यों लगता है कि वह सही है, यह जांचे कि क्या उसने कोई लक्षण छोड़ दिया है, और यह सुनिश्चित करे कि उसने गलती से मरीज को कोई खतरनाक दवा लेने के लिए तो नहीं कह दिया। यह रीइन्फोर्समेंट लर्निंग (RL) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस प्रशिक्षण का एक प्रकार है जहाँ एक कंप्यूटर चीजों को आजमाकर, फीडबैक प्राप्त करके और बेहतर स्कोर पाने के लिए अपने व्यवहार को समायोजित करके सीखता है।

गणित या कोडिंग जैसे विषयों में, यह आसान है। यदि रोबोट एक समीकरण को हल करता है, तो उत्तर या तो सही होता है या गलत, और एक कंप्यूटर इसे तुरंत जांच सकता है। लेकिन चिकित्सा जटिल है। एक मरीज का उत्तर काफी हद तक सही हो सकता है लेकिन उसमें एक सूक्ष्म, महत्वपूर्ण विवरण छूट गया हो, या यह मददगार हो सकता है लेकिन इसमें एक डरावनी त्रुटि शामिल हो सकती है। ऐसी स्थितियों के लिए कोई सरल "हाँ/नहीं" बटन नहीं है। इसे ठीक करने के लिए, वैज्ञानिक रूब्रिक्स (Rubrics) का उपयोग करते हैं—इन्हें विशेषज्ञों द्वारा लिखे गए विस्तृत ग्रेडिंग चेकलिस्ट के रूप में समझें। केवल "अच्छा काम किया" कहने के बजाय, एक रूब्रिक उत्तर को छोटे हिस्सों में तोड़ देता है: "क्या आपने बीमारी की पहचान की? हाँ। क्या आपने सही दवा का उल्लेख किया? हाँ। क्या आपने दुष्प्रभावों के बारे में चेतावनी दी? नहीं।" चुनौती यह है कि ये चेकलिस्ट लिखने में मानव डॉक्टरों को बहुत समय लगता है, और यदि आप इसे लिखने के लिए कंप्यूटर का उपयोग करते हैं, तो यह गलतियाँ कर सकता है।

यहीं पर ConRub-Med पेपर काम आता है। शोधकर्ता एक स्मार्ट तरीका बनाना चाहते थे जिससे बिना किसी मानव डॉक्टर द्वारा हर एक अभ्यास परीक्षण को ग्रेड किए जाने की आवश्यकता के मेडिकल AI को सिखाया जा सके। उन्होंने एक ऐसा सिस्टम बनाया है जो तीन अलग-अलग विशेषज्ञ रोबोटों के पैनल की तरह काम करता है जो अपनी खुद की चेकलिस्ट लिखते हैं, एक चौथा रोबोट जो एक सख्त संपादक के रूप में कार्य करता है ताकि उस हिस्से को खोज सके जिस पर वे सभी सहमत हों, और एक विशेष स्कोरिंग विधि जो न केवल "सही" उत्तरों को गिनती है बल्कि "गलत" उत्तरों के लिए दंड भी देती है।

समस्या: जब "काफी अच्छा" पर्याप्त नहीं होता

कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं, और आपको 70% अंक मिलते हैं। लेकिन क्या होगा यदि दो छात्रों दोनों को 70% मिले? एक छात्र ने तथ्यों को जानकर सही उत्तर दिया लेकिन एक सुरक्षा चेतावनी छोड़ दी। दूसरे छात्र ने सही उत्तर का अनुमान लगाया लेकिन एक खतरनाक, मनगढ़ंत तथ्य शामिल कर दिया। यदि शिक्षक उन्हें दोनों को "70" देकर जाता है, तो इस स्कोर से सीखने वाला AI नहीं जान पाएगा कि वास्तव में कौन सा छात्र बेहतर है। वह गलत छात्र की नकल करना भी सीख सकता है क्योंकि उन दोनों को एक ही स्कोर मिला था।

मेडिकल AI की दुनिया में, यह एक बड़ी बात है। यदि AI यह सीखता है कि एक खतरनाक, काल्पनिक उत्तर उतना ही अच्छा है जितना कि एक सुरक्षित, सटीक उत्तर, तो वह वास्तविक लोगों को गलत सलाह दे सकता है। प्रशिक्षण के पुराने तरीके अक्सर "जानकारी की कमी" (एक चरण भूल जाना) और "गलत जानकारी" (एक झूठ बोलना) को एक ही तरह से देखते थे: एक शून्य के रूप में। लेकिन चिकित्सा में, झूठ बोलना कुछ भूल जाने से कहीं अधिक बुरा है।

समाधान: रोबोटों की एक टीम और एक सख्त संपादक

इस पेपर के लेखकों ने, सिनहुआ यूनिवर्सिटी और एंट ग्रुप की टीमों के साथ मिलकर, एक नया प्रशिक्षण पाइपलाइन बनाया जिसे ConRub-Med कहा जाता है। यह कैसे काम करता है, यहाँ चरण दर चरण दिया गया है:

1. कंसेंसस काउंसिल (तीन सिर एक से बेहतर हैं)
एक रोबोट से ग्रेडिंग चेकलिस्ट (रूब्रिक) लिखने के लिए कहने के बजाय, उन्होंने तीन अलग-अलग, शक्तिशाली AI मॉडलों से एक "अच्छा" उत्तर कैसा होना चाहिए, इसकी अपनी सूची लिखने को कहा। फिर, एक चौथा, अलग रोबोट एक रेफरी के रूप में कार्य करता है। यह रेफरी केवल उन्हीं नियमों को रखता है जिन पर तीनों मूल रोबोट सहमत थे। यदि एक रोबोट ने सोचा कि एक विशिष्ट विवरण महत्वपूर्ण है, लेकिन अन्य दो ने इसका उल्लेख नहीं किया, तो रेफरी उस नियम को बाहर कर देता था। इसने यह सुनिश्चित किया कि अंतिम चेकलिस्ट एक मजबूत, साझा सहमति पर आधारित थी, न कि किसी एकल मॉडल की यादृच्छिक विचित्रताओं पर।

2. थ्री-पॉइंट स्कोरकार्ड (केवल सही या गलत नहीं)
एक बार चेकलिस्ट बन जाने के बाद, सिस्टम को उत्तरों को ग्रेड करने की आवश्यकता थी। पुराना तरीका बाइनरी था: "क्या आपने इसका उल्लेख किया? हाँ (+1) या नहीं (0)।" नया सिस्टम एक थ्री-स्टेट स्कोरिंग विधि का उपयोग करता है:

  • सही (Correct): आपने इसे सही बताया (+1 अंक)।
  • लुप्त (Missing): आप इसे बताना भूल गए (0 अंक)।
  • गलत (Wrong): आपने कुछ गलत या खतरनाक कहा (-1 अंक)।

यह एक बड़ा बदलाव है। पुराने सिस्टम में, एक छात्र जिसने एक चरण भूल दिया और एक छात्र जिसने एक चरण के बारे में झूठ बोला, दोनों को शून्य मिलता था। इस नए सिस्टम में, झूठ बोलने वाले को नकारात्मक स्कोर मिलता है। यह AI को सिखाता है कि तथ्य गढ़ना एक गंभीर गलती है, न कि केवल एक तटस्थ गलती।

3. टाई-ब्रेकर (जब स्कोर समान होते हैं)
कभी-कभी, इस नई स्कोरिंग के साथ भी, दो अलग-अलग उत्तरों का कुल स्कोर बिल्कुल समान हो सकता है। यदि AI दो उत्तरों को समान स्कोर के साथ देखता है, तो वह भ्रमित हो जाता है कि किससे सीखना है। इसे ठीक करने के लिए, शोधकर्ताओं ने एक "टाई-ब्रेकर" चरण जोड़ा। जब दो उत्तरों के बीच बराबरी होती है, तो एक विशेष जज उन्हें दोनों क्रमों में (उत्तर A बनाम उत्तर B, और फिर उत्तर B बनाम उत्तर A) आमने-सामने देखता है। यदि जज दोनों मामलों में उत्तर A को बेहतर मानता है, तो सिस्टम उत्तर A को एक "बढ़ावा" (boost) देता है और उत्तर B को "दंड" (penalty) देता है, भले ही उनके कच्चे स्कोर समान हों। यह AI को एक स्पष्ट दिशा देता है, भले ही गणित कहता हो कि वे बराबर हैं।

उन्होंने क्या पाया

टीम ने चिकित्सा प्रश्नों के एक बड़े सेट पर इस नए तरीके का परीक्षण किया। उन्होंने 5,166 प्रॉम्प्ट्स (प्रश्नों) का एक डेटासेट बनाया और इसका उपयोग अपने AI मॉडल को प्रशिक्षित करने के लिए किया।

  • बेहतर चेकलिस्ट: जब दो मानव चिकित्सा विशेषज्ञों ने इस नए "कंसेंसस" पद्धति द्वारा बनाई गई चेकलिस्टों को देखा, तो उन्होंने उन्हें एक अकेले रोबोट द्वारा बनाई गई चेकलिस्टों (लगभग 86%) की तुलना में बहुत अधिक नैदानिक रूप से प्रासंगिक (99.3%) बताया।
  • शीर्ष प्रदर्शन: ConRub-Med के साथ प्रशिक्षित AI चिकित्सा प्रश्नों में बहुत अच्छा रहा। यह परीक्षण किए गए नौ प्रमुख मेडिकल बेंचमार्क में से नौ में से छह में प्रथम स्थान पर रहा।
  • कठिन परीक्षण: एक विशेष रूप से कठिन परीक्षण, जिसे HealthBench-Hard कहा जाता है, पर नए मॉडल ने 38.98 का स्कोर किया। यह अन्य तरीकों से अधिक था जिन्होंने बहुत अधिक डेटा का उपयोग किया था (जैसे कि एक तरीका जिसने 28,000 सैंपल का उपयोग किया लेकिन केवल 37.30 स्कोर किया)।

यह क्यों मायने रखता है

पेपर सुझाव देता है कि नियमों को लिखने के लिए "विशेषज्ञों की टीम", नियमों को फ़िल्टर करने के लिए एक "सख्त संपादक" और झूठ बोलने वालों को दंडित करने वाले "थ्री-पॉइंट स्कोरकार्ड" को मिलाकर, हम मेडिकल AI को सुरक्षित और अधिक सटीक बना सकते हैं। शोधकर्ताओं ने पाया कि केवल "सही" उत्तरों को गिनना पर्याप्त नहीं है; आपको सक्रिय रूप से "गलत" उत्तरों को हतोत्साहित करना होगा और ऐसे तरीके खोजने होंगे जिनसे उन दो उत्तरों के बीच अंतर किया जा सके जो कागज पर एक जैसे दिखते हैं।

हालांकि परिणाम आशाजनक हैं, लेखक सावधानीपूर्वक नोट करते हैं कि यह अभी भी एक अनुसंधान उपकरण है। उन्होंने इसे बेंचमार्क पर और नियमों की समीक्षा करने वाले मानव विशेषज्ञों के साथ परीक्षण किया, लेकिन वे इस बात पर जोर देते हैं कि यह प्रणाली अभी वास्तविक रोगियों का निदान करने के लिए तैयार नहीं है। यह AI को प्रशिक्षित करने का एक शक्तिशाली नया तरीका है, लेकिन वास्तविक दुनिया में इसकी सुरक्षा सुनिश्चित करने के लिए अंतिम चरण में अभी भी बहुत काम करने की आवश्यकता है। मुख्य बात यह है कि चिकित्सा की जटिल दुनिया में, "काफी अच्छा" स्कोर पर्याप्त नहीं है—आपको एक ऐसे सिस्टम की आवश्यकता है जो गलती और झूठ के बीच अंतर कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →