← नवीनतम पेपर
🧬 biology

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

यह शोध पत्र यह प्रदर्शित करता है कि DR. INFO, जो एक एजेंटिक RAG-आधारित चिकित्सा सहायक है, हेल्थबेंच हार्ड (HealthBench Hard) बेंचमार्क पर अग्रणी फ्रंटियर LLMs और प्रतिस्पर्धी क्लिनिकल AI सिस्टमों से काफी बेहतर प्रदर्शन करता है, जो उच्च-जोखिम वाले क्लिनिकल तर्क और संचार के आकलन के लिए रूब्रिक-संचालित, ओपन-एंडेड मूल्यांकनों की प्रभावकारिता को प्रमाणित करता है।

मूल लेखक: Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

प्रकाशित 2026-07-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को डॉक्टर बनना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, हमने इन रोबोट्स का परीक्षण बहुविकल्पीय क्विज़ (multiple-choice quizzes) के माध्यम से किया, जैसे कि वे जो आप हाई स्कूल की जीव विज्ञान परीक्षा में देखते हैं। आप पूछते, "फ्रांस की राजधानी क्या है?" या "कौन सी दवा सिरदर्द का इलाज करती है?" और रोबोट A, B, या C चुनता। यदि वह सही उत्तर देता, तो हम मान लेते थे कि वह वास्तविक लोगों की मदद करने के लिए तैयार है। लेकिन यहाँ एक पेंच है: वास्तविक जीवन कोई बहुविकल्पीय क्विज़ नहीं है। वास्तविक जीवन अव्यवस्थित, भ्रमित करने वाला और अधूरी जानकारियों से भरा होता है। एक मरीज डरा हुआ हो सकता है, किसी लक्षण का जिक्र करना भूल सकता है, या किसी सवाल को ऐसे तरीके से पूछ सकता है जो किसी सटीक बॉक्स में फिट न बैठता हो। यदि एक रोबोट केवल तथ्यों को रट लेता है लेकिन सुन नहीं पाता, सही फॉलो-अप सवाल नहीं पूछ पाता, या यह स्वीकार नहीं कर पाता कि वह अनिश्चित है, तो वह खतरनाक गलतियाँ कर सकता है। यहीं पर एक नए प्रकार के परीक्षण की आवश्यकता आती है, जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या रोबोट केवल पाठ्यपुस्तक के उत्तर जानता है या यह कि वह एक वास्तविक, उच्च-दबाव वाली बातचीत में कैसा व्यवहार करता है।

यह शोध पत्र एक कंपनी के बारे में है जिसका नाम Synduct है, जिन्होंने DR. INFO नामक एक मेडिकल रोबोट असिस्टेंट बनाया है। वे यह देखना चाहते थे कि क्या उनका रोबोट वास्तव में वास्तविक दुनिया के लिए तैयार है, इसलिए उन्होंने इसे HealthBench नामक एक नए, अधिक कठिन परीक्षण से गुजारा। पुराने क्विज़ के विपरीत, HealthBench 1,000 कठिन परिदृश्यों वाले एक विशाल रोल-प्लेइंग गेम की तरह है। इन परिदृश्यों में, एक इंसान मरीज (या डॉक्टर) की भूमिका निभाता है और एक पेचीदा सवाल पूछता है, और रोबोट को उसका जवाब देना होता है। फिर असली डॉक्टरों की एक टीम एक विस्तृत चेकलिस्ट (जिसे रूब्रिक कहा जाता है) के आधार पर रोबोट के उत्तर को ग्रेड देती है, जो इन चीजों को देखती है जैसे: क्या रोबate ने सच बोला? क्या उसने स्पष्टता की कमी होने पर और जानकारी मांगी? क्या वह शांत और स्पष्ट रहा? क्या उसने निर्देशों का पालन किया?

परिणाम एक बहुत बड़ा आश्चर्य थे। जब DR. INFO ने इस कठिन परीक्षण में भाग लिया, तो उसने 1.0 में से 0.68 का स्कोर प्राप्त किया। इसे समझने के लिए, शोध पत्र ने DR. INFO की तुलना वर्तमान में दुनिया के सबसे बेहतरीन, सबसे प्रसिद्ध AI मॉडल्स से की, जिसमें OpenAI का GPT-5 परिवार भी शामिल है। GPT-5 मॉडल्स ने बहुत कम स्कोर किया, जिसमें सबसे अच्छा संस्करण केवल 0.46 प्राप्त कर सका। DR. INFO ने केवल उन्हें हराया ही नहीं; बल्कि उसने उन्हें काफी पीछे छोड़ दिया, और एक ऐसा स्कोर हासिल किया जो शीर्ष प्रतिस्पर्धी की तुलना में 48% सापेक्ष वृद्धि (relative increase) को दर्शाता है। यह विशिष्ट कौशल जैसे कि अधिक संदर्भ (context) मांगने की आवश्यकता को पहचानने (स्कोर 0.62 बनाम दूसरे शीर्ष मॉडल का 0.16) और पूर्ण उत्तर देने में भी बेहतर था। टीम ने DR. INFO का परीक्षण अन्य मेडिकल रोबोट्स के खिलाफ भी किया जो समान कार्य करने के लिए डिज़ाइन किए गए हैं, और DR. INFO उन दौड़ में भी जीत गया, जिसने अपने प्रतिद्वंद्वियों के स्कोर (लगभग 0.49) के मुकाबले 0.72 का स्कोर किया।

हालाँकि, लेखक यह कहने में सावधान हैं कि रोबोट पूर्ण है या समस्या "हल" हो गई है। उन्होंने पाया कि जबकि DR. INFO निर्देशों का पालन करने और सटीक होने में बहुत अच्छा है, लेकिन बातचीत के पूर्ण संदर्भ को समझने और अपने उत्तरों को कितना पूर्ण बनाना है, इसमें अभी भी सुधार की गुंजाइश है। शोध पत्र सुझाव देता है कि यह नया परीक्षण करने का तरीका—केवल तथ्यों के बजाय व्यवहार को देखना—सुरक्षित, भरोसेमंद मेडिकल AI बनाने की कुंजी है। यह ऐसा ही है जैसे यह महसूस करना कि एक अच्छा ड्राइवर बनने के लिए, आपको केवल सड़क के नियमों को जानने की ही नहीं जरूरत है; आपको यह भी जानना होगा कि जब आपकी कार के सामने एक गिलहरी कूद जाए तो आपको कैसे प्रतिक्रिया देनी है। DR. INFO ऐसा लगता है कि अन्य रोबोटों की तुलना में गिलहरियों को संभालने में बेहतर सीख रहा है, लेकिन एक पूरी तरह से स्वायत्त चिकित्सा सहायक बनने की यात्रा अभी जारी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →