← नवीनतम पेपर
💬 NLP

RASC+: Retrieval-Constrained LLM Adjudication for Clinical Value Set Authoring

यह शोध पत्र RASC+ प्रस्तुत करता है, जो एक चरण-वार ढांचा (stage-wise framework) है जो उम्मीदवार रिकॉल (candidate recall) को अधिकतम करने के लिए उन्नत पुनर्प्राप्ति विधियों को एक नियंत्रित LLM निर्णायक (constrained LLM adjudicator) के साथ जोड़कर नैदानिक मूल्य सेट लेखन (clinical value set authoring) में सुधार करता है, जिससे पिछले बेसलाइन से काफी बेहतर प्रदर्शन होता है और यह सुनिश्चित होता है कि सभी आउटपुट एक ऑडिट योग्य उम्मीदवार पूल (auditable candidate pool) से उत्पन्न होते हैं।

मूल लेखक: Sumit Mukherjee

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sumit Mukherjee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जिन्हें एक विशिष्ट विषय, जैसे कि "हृदय स्वास्थ्य" (Heart Health), के लिए "सर्वश्रेष्ठ पुस्तकें" की सूची बनाने का काम सौंपा गया है। हालाँकि, आपको केवल चलते-फिरते बुक टाइटल नहीं बनाने हैं। आपको एक विशाल, निरंतर बदलते पुस्तकालय कैटलॉग से चुनना होगा जिसमें लाखों प्रविष्टियाँ हैं। यदि आप ऐसी पुस्तक चुनते हैं जो कैटलॉग में मौजूद नहीं है, तो आपकी सूची बेकार है। यदि आप एक महत्वपूर्ण पुस्तक को छोड़ देते हैं जो कैटलॉग में है, तो आपकी सूची अधूरी रह जाएगी।

यह क्लिनिकल वैल्यू सेट ऑथरिंग (Clinical Value Set Authoring) की चुनौती है। डॉक्टरों और स्वास्थ्य प्रणालियों को रोगी के स्वास्थ्य को ट्रैक करने के लिए विशिष्ट मेडिकल कोड्स (जैसे "हार्ट अटैक" या "डायबिटीज") की सूचियों की आवश्यकता होती है। ये कोड सख्त शब्दकोशों (जैसे SNOMED-CT या ICD-10) से आते हैं। लक्ष्य एक विशिष्ट चिकित्सा अवधारणा के लिए कोड की एक आदर्श सूची बनाना है बिना कोई फर्जी कोड बनाए या सही कोड को छोड़े बिना।

यह पेपर एक नई विधि पेश करता है जिसे RASC+ कहा जाता है। यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

समस्या: "जीरो-शॉट" (Zero-Shot) की गलती

पहले, शोधकर्ता एक स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) से सीधे सूची "लिखने" के लिए कहते थे।

  • उपमा: यह एक छात्र से लाइब्रेरी देखे बिना अपनी याददाश्त से बिब्लियोग्राफी लिखने के लिए कहने जैसा है।
  • परिणाम: छात्र (AI) अक्सर फर्जी बुक टाइटल बना देता है या वास्तविक शीर्षकों को छोड़ देता है क्योंकि उसने पूरी लाइब्रेरी को याद नहीं किया होता है। चिकित्सा जगत में, यह खतरनाक है क्योंकि एक फर्जी कोड फर्जी दवा की तरह है—इसका उपयोग नहीं किया जा सकता।

समाधान: एक दो-चरणीय "खोज और चयन" (Search and Select) टीम

लेखकों ने महसूस किया कि काम को दो अलग-अलग भूमिकाओं में विभाजित करना बेहतर है: द स्काउट (The Scout - खोजकर्ता) और द जज (The Judge - निर्णायक)।

चरण 1: द स्काउट (उम्मीदवार पूल बनाना)

पहला काम यह ढूँढना है कि कौन सी संभावित पुस्तकें सूची में शामिल हो सकती हैं। लक्ष्य रिकॉल (सब कुछ ढूँढना) है, भले ही इसमें कुछ ऐसी पुस्तकें भी आ जाएँ जो पूरी तरह फिट न बैठती हों।

  • पुराना स्काउट: एक बुनियादी सर्च टूल का उपयोग करता था जो केवल पुस्तक के शीर्षक को देखता था। इसने कई प्रासंगिक पुस्तकों को छोड़ दिया, केवल लगभग 55% सही कोड ही ढूँढ पाया।
  • नया स्काउट (RASC+): लेखकों ने स्काउट को तीन सुपरपावर्स के साथ अपग्रेड किया:
    1. स्मार्टर सर्च: यह विषय के अर्थ को समझने के लिए एक अधिक उन्नत मस्तिष्क (Qwen3) का उपयोग करता है, न कि केवल कीवर्ड्स का।
    2. वोकैबुलरी एक्सपेंशन: यदि स्काउट को "हार्ट अटैक" के बारे में एक पुस्तक मिलती है, तो यह स्वचालित रूप से लाइब्रेरी के मैप की जाँच करता है कि क्या उसके पास "एंजाइना" या "कार्डियक अरेस्ट" के बारे में संबंधित पुस्तकें हैं, भले ही शीर्षक पूरी तरह से मेल न खाता हो।
    3. डिस्प्ले रेस्क्यू: कभी-कभी लाइब्रेरी कैटलॉग एक ही चीज़ के लिए अलग शब्दों का उपयोग करता है। स्काउट कोड के वास्तविक विवरण (description) द्वारा भी खोज करता है, न कि केवल शीर्षक द्वारा, ताकि पहली खोज में छूटी हुई चीजों को पकड़ा जा सके।
  • परिणाम: नया स्काउट 73% सही कोड ढूँढता है (55% से ऊपर)। यह उम्मीदवारों की एक बहुत बड़ी "शॉर्टलिस्ट" तैयार करता है।

चरण 2: द जज (निर्णय लेना)

अब जब स्काउट के पास संभावित उम्मीदवारों का एक बड़ा, अस्त-व्यस्त ढेर है, तो दूसरा काम यह चुनना है कि सटीक रूप से कौन से सही हैं। लक्ष्य प्रिसिजन (सटीकता) है।

  • पुराना जज: एक विशेष मेडिकल क्लासिफायर (SAPBert)। नए, बड़े ढेर को दिए जाने पर, यह भ्रमित हो गया। इसने बहुत अधिक गलत पुस्तकें चुनना शुरू कर दिया क्योंकि ढेर अधिक शोर भरा (noisy) था। इसका स्कोर थोड़ा गिर गया।
  • नया जज (GPT-5): लेखकों ने एक शक्तिशाली AI (GPT-5) को जज के रूप में इस्तेमाल किया।
    • प्रतिबंध: महत्वपूर्ण रूप से, जज को कोड बनाने की अनुमति नहीं है। यह केवल स्काउट द्वारा प्रदान की गई सूची को देख सकता है और कह सकता है कि "हाँ, यह इस सूची का हिस्सा है" या "नहीं, यह नहीं है।"
    • परिणाम: नया जज इस अस्त-व्यत ढेर को छाँटने में बहुत बेहतर है। इसने विस्तारित सूची से सही कोड सफलतापूर्वक चुने, और 54.9% का स्कोर प्राप्त किया (पुराने जज के 28.7% की तुलना में)।

यह क्यों मायने रखता है

यह पेपर दिखाता है कि इस "खोज और फिर चयन" वाले दृष्टिकोण का उपयोग करना, AI से "बस सूची लिखने" के लिए कहने से कहीं बेहतर है।

  • सुरक्षा सर्वोपरि: क्योंकि जज केवल उसी सूची से चुन सकता है जो स्काउट ने ढूँदी है, वह कभी भी फर्जी मेडिकल कोड नहीं बना सकता। यह वास्तविक लाइब्रेरी कैटलॉग से बंधा रहता है।
  • अज्ञात को संभालना: परीक्षण में "होल्ड-आउट" पब्लिशर्स (ऐसी लाइब्रेरी जिन्हें AI ने पहले कभी नहीं देखा था) शामिल थे। नए सिस्टम ने पुराने तरीकों की तुलना में इन अज्ञात लाइब्रेरीज़ को बहुत बेहतर तरीके से संभाला, जिससे यह साबित हुआ कि यह नई स्थितियों में भी काम कर सकता है।

निचोड़ (The Bottom Line)

यह पेपर प्रदर्शित करता है कि कार्य को एक हाई-रिकॉल स्काउट (जो सब कुछ संभवतः ढूँढ लेता है) और एक स्मार्ट, कंस्ट्रेंड जज (जो उस सूची में से सर्वश्रेष्ठ को चुनता है) में विभाजित करके, हम बहुत बेहतर मेडिकल कोड लिस्ट बना सकते हैं।

  • पुराना तरीका: AI याददाश्त से अनुमान लगाता है (उच्च त्रुटि, फर्जी कोड)।
  • नया तरीका (RASC+): AI एक विशाल जाल फैलाता है, और फिर उस जाल से सबसे अच्छी मछलियाँ सावधानी से चुनता है।

परिणाम यह है कि यह एक ऐसा सिस्टम है जो अधिक सुरक्षित है (कोई फर्जी कोड नहीं) और अधिक सटीक है (अधिक वास्तविक कोड ढूँढता है), जो मानव विशेषज्ञों के विकल्प के रूप में भ्रमित होने (hallucinate) के बजाय उनके लिए एक शक्तिशाली सहायक के रूप में कार्य करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →