OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries
यह शोध पत्र यह प्रदर्शित करता है कि DR. INFO, जो एक एजेंटिक RAG-आधारित चिकित्सा सहायक है, हेल्थबेंच हार्ड (HealthBench Hard) बेंचमार्क पर अग्रणी फ्रंटियर LLMs और प्रतिस्पर्धी क्लिनिकल AI सिस्टमों से काफी बेहतर प्रदर्शन करता है, जो उच्च-जोखिम वाले क्लिनिकल तर्क और संचार के आकलन के लिए रूब्रिक-संचालित, ओपन-एंडेड मूल्यांकनों की प्रभावकारिता को प्रमाणित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को डॉक्टर बनना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, हमने इन रोबोट्स का परीक्षण बहुविकल्पीय क्विज़ (multiple-choice quizzes) के माध्यम से किया, जैसे कि वे जो आप हाई स्कूल की जीव विज्ञान परीक्षा में देखते हैं। आप पूछते, "फ्रांस की राजधानी क्या है?" या "कौन सी दवा सिरदर्द का इलाज करती है?" और रोबोट A, B, या C चुनता। यदि वह सही उत्तर देता, तो हम मान लेते थे कि वह वास्तविक लोगों की मदद करने के लिए तैयार है। लेकिन यहाँ एक पेंच है: वास्तविक जीवन कोई बहुविकल्पीय क्विज़ नहीं है। वास्तविक जीवन अव्यवस्थित, भ्रमित करने वाला और अधूरी जानकारियों से भरा होता है। एक मरीज डरा हुआ हो सकता है, किसी लक्षण का जिक्र करना भूल सकता है, या किसी सवाल को ऐसे तरीके से पूछ सकता है जो किसी सटीक बॉक्स में फिट न बैठता हो। यदि एक रोबोट केवल तथ्यों को रट लेता है लेकिन सुन नहीं पाता, सही फॉलो-अप सवाल नहीं पूछ पाता, या यह स्वीकार नहीं कर पाता कि वह अनिश्चित है, तो वह खतरनाक गलतियाँ कर सकता है। यहीं पर एक नए प्रकार के परीक्षण की आवश्यकता आती है, जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या रोबोट केवल पाठ्यपुस्तक के उत्तर जानता है या यह कि वह एक वास्तविक, उच्च-दबाव वाली बातचीत में कैसा व्यवहार करता है।
यह शोध पत्र एक कंपनी के बारे में है जिसका नाम Synduct है, जिन्होंने DR. INFO नामक एक मेडिकल रोबोट असिस्टेंट बनाया है। वे यह देखना चाहते थे कि क्या उनका रोबोट वास्तव में वास्तविक दुनिया के लिए तैयार है, इसलिए उन्होंने इसे HealthBench नामक एक नए, अधिक कठिन परीक्षण से गुजारा। पुराने क्विज़ के विपरीत, HealthBench 1,000 कठिन परिदृश्यों वाले एक विशाल रोल-प्लेइंग गेम की तरह है। इन परिदृश्यों में, एक इंसान मरीज (या डॉक्टर) की भूमिका निभाता है और एक पेचीदा सवाल पूछता है, और रोबोट को उसका जवाब देना होता है। फिर असली डॉक्टरों की एक टीम एक विस्तृत चेकलिस्ट (जिसे रूब्रिक कहा जाता है) के आधार पर रोबोट के उत्तर को ग्रेड देती है, जो इन चीजों को देखती है जैसे: क्या रोबate ने सच बोला? क्या उसने स्पष्टता की कमी होने पर और जानकारी मांगी? क्या वह शांत और स्पष्ट रहा? क्या उसने निर्देशों का पालन किया?
परिणाम एक बहुत बड़ा आश्चर्य थे। जब DR. INFO ने इस कठिन परीक्षण में भाग लिया, तो उसने 1.0 में से 0.68 का स्कोर प्राप्त किया। इसे समझने के लिए, शोध पत्र ने DR. INFO की तुलना वर्तमान में दुनिया के सबसे बेहतरीन, सबसे प्रसिद्ध AI मॉडल्स से की, जिसमें OpenAI का GPT-5 परिवार भी शामिल है। GPT-5 मॉडल्स ने बहुत कम स्कोर किया, जिसमें सबसे अच्छा संस्करण केवल 0.46 प्राप्त कर सका। DR. INFO ने केवल उन्हें हराया ही नहीं; बल्कि उसने उन्हें काफी पीछे छोड़ दिया, और एक ऐसा स्कोर हासिल किया जो शीर्ष प्रतिस्पर्धी की तुलना में 48% सापेक्ष वृद्धि (relative increase) को दर्शाता है। यह विशिष्ट कौशल जैसे कि अधिक संदर्भ (context) मांगने की आवश्यकता को पहचानने (स्कोर 0.62 बनाम दूसरे शीर्ष मॉडल का 0.16) और पूर्ण उत्तर देने में भी बेहतर था। टीम ने DR. INFO का परीक्षण अन्य मेडिकल रोबोट्स के खिलाफ भी किया जो समान कार्य करने के लिए डिज़ाइन किए गए हैं, और DR. INFO उन दौड़ में भी जीत गया, जिसने अपने प्रतिद्वंद्वियों के स्कोर (लगभग 0.49) के मुकाबले 0.72 का स्कोर किया।
हालाँकि, लेखक यह कहने में सावधान हैं कि रोबोट पूर्ण है या समस्या "हल" हो गई है। उन्होंने पाया कि जबकि DR. INFO निर्देशों का पालन करने और सटीक होने में बहुत अच्छा है, लेकिन बातचीत के पूर्ण संदर्भ को समझने और अपने उत्तरों को कितना पूर्ण बनाना है, इसमें अभी भी सुधार की गुंजाइश है। शोध पत्र सुझाव देता है कि यह नया परीक्षण करने का तरीका—केवल तथ्यों के बजाय व्यवहार को देखना—सुरक्षित, भरोसेमंद मेडिकल AI बनाने की कुंजी है। यह ऐसा ही है जैसे यह महसूस करना कि एक अच्छा ड्राइवर बनने के लिए, आपको केवल सड़क के नियमों को जानने की ही नहीं जरूरत है; आपको यह भी जानना होगा कि जब आपकी कार के सामने एक गिलहरी कूद जाए तो आपको कैसे प्रतिक्रिया देनी है। DR. INFO ऐसा लगता है कि अन्य रोबोटों की तुलना में गिलहरियों को संभालने में बेहतर सीख रहा है, लेकिन एक पूरी तरह से स्वायत्त चिकित्सा सहायक बनने की यात्रा अभी जारी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।