← नवीनतम पेपर
🤖 AI

MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional

यह शोध पत्र MDIA को प्रस्तुत करता है, जो एक गैर-फाइन-ट्यून किए गए LLM पर 7-नोड स्पेशलिटी-रूटेड ग्राफ का उपयोग करने वाला एक मल्टी-एजेंट डायग्नोस्टिक सिस्टम है, जो हेल्थबेंच प्रोफेशनल (HealthBench Professional) बेंचमार्क पर मानक क्लिनिकल चैटबॉट्स की तुलना में काफी बेहतर प्रदर्शन करता है, जो यह दर्शाता है कि आर्किटेक्चरल डिज़ाइन और इंजन-लेवल फीचर्स एजेंटिक क्लिनिकल प्रदर्शन के महत्वपूर्ण चालक हैं, जबकि विभिन्न मूल्यांकन ग्रेडर मॉडल्स द्वारा उत्पन्न परिवर्तनशीलता को भी रेखांकित करता है।

मूल लेखक: Roberto Cruz, David Rey-Blanco

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roberto Cruz, David Rey-Blanco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल चिकित्सा रहस्य को सुलझाने की कोशिश कर रहे हैं। आप एक बहुत ही समझदार डॉक्टर से मामला देखने और उत्तर देने के लिए कह सकते हैं। या, आप विशेषज्ञों की एक सुपर-टीम बना सकते हैं जो एक-दूसरे से बात करती है, अपने तथ्यों की जाँच करती है, और आपको अंतिम रिपोर्ट सौंपने से पहले उसे दोबारा चेक करती है।

यह शोध पत्र उस सुपर-टीम के निर्माण का वर्णन करता है, जिसे MDIA कहा जाता है, और यह कि इसने HealthBench Professional नामक एक बहुत ही कठिन परीक्षण में कैसा प्रदर्शन किया।

यहाँ इसका विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. बड़ा विचार: टीमवर्क एक जीनियस से बेहतर है

अधिकांश लोगों का मानना था कि चिकित्सा प्रश्नों के उत्तर देने के लिए एक स्मार्ट AI प्राप्त करने का सबसे अच्छा तरीका बस AI को अधिक स्मार्ट बनाना (इसे अधिक प्रशिक्षित करना) है। लेकिन लेखकों ने पाया कि आप टीम को कैसे व्यवस्थित करते हैं यह केवल एक स्मार्ट व्यक्तिगत इकाई होने से अधिक महत्वपूर्ण है।

  • पुराना तरीका: एक AI अकेले सब कुछ करने की कोशिश करता है। यह एक एकल जनरल प्रैक्टिशनर (सामान्य चिकित्सक) से सर्जन, न्यूरोलॉजिस्ट और फार्मासिस्ट एक साथ होने की अपेक्षा करने जैसा है।
  • MDIA का तरीका: उन्होंने एक 7-चरणीय असेंबली लाइन (एक "ग्राफ") बनाई।
    1. प्रवेश (The Intake): एक रिसेप्शनिस्ट रोगी के सभी इतिहास को इकट्ठा करता है और दवाओं की सुरक्षा की जाँच करता है।
    2. राउटर (The Router): एक मैनेजर समस्या को देखता है और कहता है, "यह पेट से जुड़ी समस्या है, इसे गैस्ट्रो टीम के पास भेजें," या "यह मस्तिष्क की समस्या है, इसे न्यूरो टीम के पास भेजें।"
    3. विशेषज्ञ (The Specialists): तीन विशिष्ट विशेषज्ञ (गैस्ट्रो, आँख, न्यूरो) और एक सामान्य चिकित्सक मुख्य काम संभालते हैं।
    4. सिंथेसाइज़र (The Synthesizer): एक लेखक विशेषज्ञों के नोट्स को रोगी के लिए एक स्पष्ट उत्तर में बदल देता है।
    5. सत्यापनकर्ता (The Verifier): एक सुरक्षा निरीक्षक अंतिम उत्तर की जाँच करता है ताकि यह सुनिश्चित हो सके कि यह सुरक्षित है और बहुत लंबा नहीं है।

2. गुप्त नुस्खा: पूरी कहानी सुनना

लेखकों ने खोजा कि इन परीक्षणों को आमतौर पर कैसे चलाया जाता था उसमें एक बड़ा "बग" (त्रुटि) था।

  • समस्या: कल्पना कीजिए कि एक रोगी कहता है, "मेरे पेट में दर्द है।" फिर, अगले संदेश में, वह कहता है, "ओह, और मैंने यह विशिष्ट गोली भी ली है।"
  • गलती: अधिकांश परीक्षण प्रणालियाँ केवल पिछले संदेश ("मैंने यह गोली ली है") को पढ़ती हैं और पहले वाले ("मेरे पेट में दर्द है") को भूल जाती हैं। यह एक जासूस द्वारा अपराध स्थल को अनदेखा करने और केवल संदिग्ध के बहाने (alibi) को देखने जैसा है।
  • समाधान: MDIA को पूरी बातचीत को याद रखने के लिए डिज़ाइन किया गया था। जब उन्होंने परीक्षण को ठीक किया ताकि इसमें पूरी कहानी शामिल हो सके, तो स्कोर में भारी उछाल आया (लगभग 6 अंक)। यह इसलिए नहीं था कि AI स्मार्ट हो गया था; बल्कि इसलिए था क्योंकि परीक्षण ने अंततः इसे उस जानकारी का उपयोग करने की अनुमति दी जो उसके पास पहले से मौजूद थी।

3. परिणाम: "गोल्ड स्टैंडर्ड" को पछाड़ना

लेखकों ने अपने सिस्टम का परीक्षण वर्तमान "चैंपियन" (क्लिनिशियनों के लिए OpenAI का ChatGPT) और मानव डॉक्टरों की एक टीम के विरुद्ध किया।

  • स्कोर: MDIA ने 0.6272 का स्कोर प्राप्त किया।
  • तुलना:
    • मानव डॉक्टर (बेसलाइन): ~0.44
    • OpenAI का सर्वश्रेष्ठ सिस्टम: 0.59
    • MDIA: 0.63
  • सावधानी: पेपर स्वीकार करता है कि यह जीत "दिशात्मक" (directional) है, जिसका अर्थ है कि यह एक जीत है, लेकिन अंतर इतना कम है कि यह भाग्य या इस बात पर निर्भर हो सकता है कि परीक्षण को कैसे ग्रेड किया गया। यह एक दौड़ जीतने जैसा है जहाँ आप एक सेकंड के बहुत छोटे हिस्से से जीते हैं; आप जीते तो हैं, लेकिन मुकाबला बहुत कड़ा था।

4. "जज" की समस्या

यहाँ एक मोड़ है: पेपर में उनके सिस्टम का परीक्षण दो अलग-अलग "जजों" (उत्तरों को ग्रेड करने वाले AI मॉडल) का उपयोग करके किया गया।

  • जज A (GPT-5.4): MDIA को 0.6272 का स्कोर दिया।
  • जज B (Gemini 2.5 Pro): MDIA को 0.6585 का स्कोर दिया।
  • सबक: स्कोर इस पर निर्भर करता है कि कौन ग्रेडिंग कर रहा है। एक जज को लंबे, विस्तृत उत्तर पसंद आए; दूसरे ने छोटे उत्तरों को प्राथमिकता दी। लेखक तर्क देते हैं कि यह वास्तव में जानने के लिए कि एक AI कितना अच्छा है, आपको केवल एक नहीं, बल्कि कई जजों की आवश्यकता है।

5. इंजीनियरिंग "प्लंबिंग" मायने रखती है

अधिकांश सुधार नए गणित के साथ AI को "स्मार्टर" बनाने से नहीं आया। यह प्लंबिंग (व्यवस्था) को ठीक करने से आया:

  • सुरक्षा द्वार (Safety Gates): उन्होंने एक नियम जोड़ा जो AI को खतरनाक दवा संयोजनों (जैसे बुखार कम करने वाली दवा के साथ एक विशिष्ट पेट की दवा मिलाना) का सुझाव देने से रोकता है।
  • लंबाई नियंत्रण (Length Control): परीक्षण उन उत्तरों को दंडित करता है जो बहुत लंबे होते हैं। लेखकों ने AI को संक्षिप्त (गैर-जरूरी बातों को हटाना) होने के लिए प्रशिक्षित किया, बिना महत्वपूर्ण चिकित्सा तथ्यों को काटे। इससे उन अंकों की बचत हुई जो "शब्दों के बोझ" के कारण खो रहे थे।
  • विश्वसनीयता (Reliability): उन्होंने उन बग्स को ठीक किया जहाँ सिस्टम कभी-कभी क्रैश हो जाता था या खाली उत्तर देता था। इन "ग्लिच" को ठीक करने से प्रदर्शन में लगभग 3-4 अंकों की वृद्धि हुई।

सारांश

पेपर का दावा है कि आर्किटेक्चर (आप टीम को कैसे बनाते हैं) और इंजीनियरिंग (उपकरणों और नियमों को ठीक करना) उतने ही महत्वपूर्ण हैं जितना कि स्वयं मस्तिष्क (AI मॉडल)।

उन्होंने एक विशेष चिकित्सा टीम बनाई है जो, जब उन्हें बातचीत के पूर्ण संदर्भ के साथ दिया जाता है और निष्पक्ष रूप से ग्रेड किया जाता है, तो वे एक विशिष्ट, कठोर परीक्षण पर मानव डॉक्टरों और वर्तमान मार्केट लीडर दोनों से बेहतर प्रदर्शन कर सकती है। हालाँकि, वे चेतावनी देते हैं कि परिणाम इस बात के प्रति संवेदनशील हैं कि परीक्षण कैसे चलाया जाता है और कौन ग्रेडिंग कर रहा है, इसलिए हमें इसे अभी तक एक अंतिम, पूर्ण समाधान के रूप में नहीं मानना चाहिए। यह एक शक्तिशाली प्रोटोटाइप है जो दिखाता है कि चिकित्सा AI का भविष्य केवल एक बड़े मस्तिष्क में नहीं, बल्कि विशेषज्ञों की टीमों में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →