← नवीनतम पेपर
🤖 AI

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

यह शोध पत्र HealthAgentBench को प्रस्तुत करता है, जो विविध नैदानिक वर्कफ़्लो और माध्यमों में 54 यथार्थवादी, बहु-चरणीय स्वास्थ्य देखभाल कार्यों वाला एक व्यापक बेंचमार्क सुइट है, जो यह प्रकट करता है कि सबसे उन्नत फ्रंटियर एआई एजेंट भी वर्तमान में जटिल, एंड-टू-एंड चिकित्सा वातावरण में उच्च सफलता दर प्राप्त करने के लिए संघर्ष करते हैं।

मूल लेखक: Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wa
प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप बहुत बुद्धिमान, लेकिन अनुभवहीन इंटर्न के एक समूह को सिखाने की कोशिश कर रहे हैं कि एक वास्तविक अस्पताल में कैसे काम किया जाता है। अतीत में, आप उन्हें एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) के साथ परख सकते थे: "यहाँ एक मरीज की कहानी है; निदान (diagnosis) क्या है?"

लेकिन वास्तविक स्वास्थ्य सेवा कोई क्विज़ नहीं है। यह एक अराजक, अव्यवस्थित और बहु-चरणीय प्रक्रिया है जहाँ एक डॉक्टर को हजारों पन्नों के रिकॉर्ड्स को खंगालना पड़ता है, एक्स-रे के विशाल, उच्च-रिज़ॉल्यूशन स्कैन को देखना पड़ता है, डेटा की त्रुटियों की जाँच करनी पड़ती है, और यह पता लगाना पड़ता है कि क्या कोई मरीज किसी विशिष्ट शोध अध्ययन के लिए योग्य है।

HealthAgentBench एक नया, अत्यंत यथार्थवादी "प्रशिक्षण मैदान" है जिसे AI एजेंटों (कंप्यूटर प्रोग्राम जो सोच और कार्य कर सकते हैं) को केवल एक क्विज़ देने के बजाय, उन्हें वास्तविक दुनिया के अस्पताल के कार्यों पर परखने के लिए डिज़ाइन किया गया है।

यहाँ इस शोध पत्र का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: पुराने परीक्षण बहुत आसान थे

पिछले AI परीक्षणों को एक बंद ट्रैक पर ड्राइवर के प्रशिक्षण परीक्षा (driver's ed exam) की तरह समझें। कार (AI) को केवल एक सीधी रेखा में चलना था या एक मोड़ लेना था। यह सुरक्षित, अनुमानित और स्थिर था।

  • वास्तविकता: वास्तविक स्वास्थ्य सेवा निर्माण कार्य, पैदल यात्रियों और बिना GPS वाले एक तूफानी शहर में गाड़ी चलाने जैसी है। AI को फाइलें खोलनी पड़ती हैं, इमेज को ज़ूम करना पड़ता है, डेटाबेस से क्वेरी करनी पड़ती है, और अपनी गलतियों को सुधारना पड़ता है।
  • अंतराल (Gap): पुराने परीक्षण "संतृप्त" (saturated) थे, जिसका अर्थ है कि AI पहले ही उनमें महारत हासिल कर चुका था। वे अब एक अच्छे AI और एक बेहतरीन AI के बीच अंतर नहीं बता पा रहे थे। हमें एक कठिन टेस्ट की आवश्यकता थी।

2. समाधान: "हॉस्पिटल सिम्युलेटर"

शोधकर्ताओं ने HealthAgentBench बनाया है, जो AI एजेंटों के लिए एक वीडियो गेम सिमुलेशन की तरह है।

  • सेटअप: AI को "इस रिपोर्ट को ठीक करें" जैसा प्रॉम्प्ट देने के बजाय, वे इसे एक कंप्यूटर टर्मिनल (कमांड लाइन) और वास्तविक मरीज के डेटा का एक फोल्डर देते हैं।
  • मिशन: AI को खुद से यह समझना होगा कि कैसे समस्या को हल किया जाए। उसे तय करना होगा: "क्या मुझे इस एक्स-रे को ज़ूम करने की आवश्यकता है? क्या मुझे एक विशिष्ट टूल डाउनलोड करने की आवश्यकता है? क्या मुझे तीन साल पहले का मरीज का इतिहास पढ़ने की आवश्यकता है?"
  • कार्य (Tasks): इसमें 7 श्रेणियों में 54 अलग-अलग मिशन हैं।
    • जासूस (The Detective): मरीज के डेटा के एक विशाल स्प्रेडशीट में त्रुटियां खोजें (डेटा क्वालिटी ऑडिटिंग)।
    • रेडियोलॉजिस्ट (The Radiologist): एक 3D CT स्कैन या एक विशाल पैथोलॉजी स्लाइड (एक शहर के डिजिटल मानचित्र की तरह) को देखें और एक छोटे से ट्यूमर को खोजें।
    • शोधकर्ता (The Researcher): मरीज के नोट्स को पढ़ें और उन 50 विभिन्न चिकित्सा अनुसंधान अध्ययनों को खोजें जिनके लिए वे पात्र हो सकते हैं (क्लिनिकल ट्रायल मैचिंग)।
    • अनुवादक (The Translator): अस्त-व्यस्त अस्पताल रिकॉर्ड को एक स्वच्छ, मानकीकृत प्रारूप में बदलें (EHR फॉर्मेट कन्वर्जन)।

3. खेल के नियम

यह सुनिश्चित करने के लिए कि AI धोखाधड़ी न कर सके, शोधकर्ताओं ने सख्त नियम बनाए हैं:

  • कोई धोखाधड़ी नहीं: AI इंटरनेट पर उत्तर नहीं खोज सकता। "उत्तर कुंजी" (answer key) एक बंद बॉक्स में छिपी होती है जिसे केवल जज (verifier) ही देख सकता है।
  • कोई सहायता नहीं: निर्देश न्यूनतम हैं। AI को स्वयं रणनीति बनानी होगी।
  • पास/फेल: यह 90% सही होने के बारे में नहीं है; यह इस बारे में है कि पूरा काम सही ढंग से पूरा किया गया या नहीं। यदि आप स्प्रेडशीट में एक छोटी सी त्रुटि भी छोड़ देते हैं, तो आप पूरे कार्य में विफल हो जाते हैं।

4. परिणाम: AI संघर्ष करता है

शोधकर्ताओं ने इस सिम्युलेटर में 10 सबसे उन्नत AI मॉडल (OpenAI और Anthropic के नवीनतम संस्करणों सहित) का परीक्षण किया।

  • स्कोर: सबसे "स्मार्ट" AI (Codex GPT-5.5) भी केवल 42% कार्यों को पास कर सका।
    • उपमा: कल्पना कीजिए कि शीर्ष स्तर के मेडिकल छात्रों का एक समूह एक फाइनल परीक्षा दे रहा है। सबसे अच्छा छात्र भी केवल 42% प्रश्नों के सही उत्तर दे पाया। यह दर्शाता है कि यह टेस्ट बहुत कठिन है और AI को अभी लंबा रास्ता तय करना है।
  • कमजोरियाँ:
    • "भूसे के ढेर में सुई" (Needle in a Haystack) की समस्या: जब AI को विशाल डेटाबेस (जैसे 8,00,000 पंक्तियों का डेटा) में से कुछ त्रुटियां खोजनी थीं, तो वह भटक गया। यह एक सर्च इंजन के बिना 1,000 किताबों की लाइब्रेरी में एक विशिष्ट टाइपो खोजने जैसा है।
    • "विज़न" (Vision) की समस्या: मेडिकल इमेज (एक्स-रे, सीटी स्कैन, पैथोलॉजी स्लाइड्स) देखना सबसे कठिन हिस्सा था। AI अक्सर छोटी बारीकियों को मिस कर देता था या ऐसी चीजें देख लेता था जो वहां थीं ही नहीं। यह मोटे धुंधले चश्मे पहनकर दीवार में एक विशिष्ट दरार खोजने जैसा है।
    • "जटिल तर्क" (Complex Reasoning) की समस्या: जब किसी कार्य के लिए कई छोटे चरणों को जोड़ने की आवश्यकता थी (जैसे "त्रुटि खोजें, फिर कोड ठीक करें, फिर टेस्ट को फिर से चलाएं"), तो AI अक्सर भ्रमित हो जाता था।

5. विजेता और हारने वाले

  • सर्वश्रेष्ठ प्रदर्शन करने वाला: Codex GPT-5.5 मॉडल सबसे सफल था और सबसे अधिक "लागत-प्रभावी" (cost-effective) भी था (इसे चलाने में अन्य की तुलना में कम पैसा या समय लगा)।
  • चौंकाने वाला अंतर: OpenAI के मॉडल (GPT-5 श्रृंखला) आमतौर पर Anthropic (Claude Code) के मॉडलों की तुलना में मेडिकल इमेज पर बेहतर प्रदर्शन करते हैं, भले ही Anthropic के मॉडल कभी-कभी अधिक प्रयास करते थे (अधिक कदम उठाते थे और अधिक लागत खर्च करते थे)।
  • अच्छी खबर: AI डेटा पाइपलाइन बनाने (जैसे एक अव्यवस्थित स्प्रेडशीट को एक स्वच्छ डेटाबेस में व्यवस्थित करना) में काफी अच्छा था। वे यह काम लगभग पूरी तरह से कर सके। यह सुझाव देता है कि AI "डेटा सफाईकर्मी" (data janitor) के काम में अच्छा हो रहा है लेकिन "डॉक्टर" के काम (निदान और जटिल इमेज विश्लेषण) में संघर्ष कर रहा है।

6. निष्कर्ष

HealthAgentBench एक वास्तविकता की जांच (reality check) है। यह दिखाता है कि हालांकि AI स्मार्ट हो रहा है, लेकिन यह अभी भी एक पूर्ण स्वायत्त डॉक्टर या अस्पताल प्रशासक बनने के लिए तैयार नहीं है।

  • शोध पत्र का दावा है कि जटिल, वास्तविक दुनिया के परिदृश्यों में वर्तमान AI अभी भी गलतियाँ करने के प्रति बहुत संवेदनशील है।
  • यह शोधकर्ताओं को प्रगति मापने के लिए एक नया, कठिन मानक प्रदान करता है।
  • यह इस बात पर प्रकाश डालता है कि AI को स्वास्थ्य सेवा के लिए तैयार करने के लिए, हमें इसकी मेडिकल इमेज देखने की क्षमता और बिना भटके विशाल मात्रा में डेटा को नेविगेट करने की क्षमता में सुधार करने की आवश्यकता है।

संक्षेप में: AI एक बहुत ही बुद्धिमान इंटर्न है जो फाइलों को व्यवस्थित करने में बहुत अच्छा है, लेकिन उसे एक्स-रे देखने और अंतिम निर्णय लेने के लिए अभी भी एक मानव पर्यवेक्षक की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →