← नवीनतम पेपर
📄 health informatics

Multi-Model Clinical Validation of an AI-Powered Biomarker Analysis Framework: A Cross-Vendor Benchmark on 4,018 NHANES Patients

यह अध्ययन प्रदर्शित करता है कि एक मानकीकृत प्रॉम्प्ट-आधारित ढांचा 4,018 NHANES रोगियों के बायोमार्कर का विश्लेषण करते समय चार स्वतंत्र विक्रेताओं के पांच बड़े भाषा मॉडलों में नैदानिक-ग्रेड की सटीकता प्राप्त करता है, जो नैदानिक निर्णय सहायता के लिए विक्रेता-स्वतंत्र एआई प्रणालियों की व्यवहार्यता की पुष्टि करता है।

मूल लेखक: Shibakov, D.

प्रकाशित 2026-02-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shibakov, D.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही महत्वपूर्ण काम है: किसी मरीज के रक्त परीक्षण (ब्लड टेस्ट) के परिणामों की जांच करना ताकि यह देखा जा सके कि क्या उनमें मधुमेह (डायबिटीज), हृदय संबंधी समस्या या लिवर की समस्याओं जैसी कोई छिपी हुई स्वास्थ्य समस्याएं तो नहीं हैं। अतीत में, केवल मानव डॉक्टर ही इसे विश्वसनीय रूप से कर सकते थे। लेकिन अब, हमारे पास "AI डॉक्टर" (लार्ज लैंग्वेज मॉडल्स) हैं जो इन रिपोर्टों को पढ़ सकते हैं और पैटर्न पहचान सकते हैं।

बड़ा सवाल यह था: क्या यह मायने रखता है कि आप किस AI डॉक्टर को काम पर रखते हैं? यदि आप एक कंपनी के AI से दूसरी कंपनी के AI पर स्विच करते हैं, तो क्या निदान (डायग्नोसिस) वही रहेगा, या नया AI भ्रमित हो जाएगा?

यह शोध पत्र एक विशाल "ब्लाइंड टेस्ट" (बिना देखे स्वाद परखने जैसा परीक्षण) है AI डॉक्टरों के लिए। इसे उन्होंने कैसे किया, यहाँ सरल भाषा में समझाया गया है:

1. सेटअप: "यूनिवर्सल मेनू"

सभी AI से "अपना सर्वश्रेष्ठ करने" के लिए कहने के बजाय, शोधकर्ताओं ने उन्हें एक ही नुस्खा (निर्देशों का एक संरचित सेट, या "प्रॉम्प्ट्स") दिया। उन्होंने उन्हें एक राष्ट्रीय स्वास्थ्य सर्वेक्षण (NHANES) से 4,018 वास्तविक लोगों के मेडिकल रिकॉर्ड सौंपे।

इसे एक कुकिंग कॉम्पिटिशन की तरह समझें जहाँ पाँच अलग-अलग शेफ (AI मॉडल) को बिल्कुल समान सामग्री और एक ही रेसिपी कार्ड दिया गया है। लक्ष्य यह देखना नहीं था कि कौन सबसे अधिक रचनात्मक है, बल्कि यह देखना था कि वे निर्देशों का कितनी सटीकता से पालन करते हुए एक आदर्श व्यंजन (सही निदान) तैयार कर सकते हैं।

2. प्रतियोगी: "द बिग फाइव"

उन्होंने चार अलग-अलग टेक दिग्गजों के पाँच अलग-अलग AI मॉडल का परीक्षण किया:

  • Grok-3 (xAI से)
  • GPT-4o और GPT-4o-mini (OpenAI से)
  • Claude Haiku 4.5 (Anthropic से)
  • Gemini 2.0 Flash (Google से)

इनमें से कुछ "प्रीमियम" मॉडल (मास्टर शेफ) थे, और कुछ "इकोनॉमी" मॉडल (फास्ट-फूड शेफ) थे।

3. चुनौती: आठ स्वास्थ्य पैटर्न

AI को रक्त के आंकड़ों को देखना था और यह तय करना था कि क्या मरीज को आठ विशिष्ट स्थितियों में से कोई एक है, जैसे कि:

  • क्या उनका ब्लड शुगर बहुत अधिक है? (मधुमेह/डायबिटीज)
  • क्या उनका हृदय जोखिम में है?
  • क्या उनमें आयरन की कमी है? (एनीमिया)
  • क्या उनका लिवर संघर्ष कर रहा है?

4. परिणाम: एक आश्चर्यजनक विजेता

परिणाम आश्चर्यजनक रूप से अच्छे थे। सभी पाँचों AI ने शानदार प्रदर्शन किया। वे सभी इतने उच्च स्कोर प्राप्त करने में सफल रहे जिसे "क्लिनिकल ग्रेड" माना जा सके, जिसका अर्थ है कि वे एक वास्तविक अस्पताल में भरोसेमंद होने के लिए पर्याप्त सटीक थे।

  • चैंपियन: Grok-3 इस शो का स्टार था। यह लगभग पूर्ण था, जिसने लिवर के जोखिम और एनीमिया पर 100% स्कोर प्राप्त किया। यह एक ऐसे मास्टर शेफ की तरह था जिसने कभी एक भी व्यंजन नहीं जलाया।
  • रनर-अप: अन्य "प्रीमियम" मॉडल (जैसे GPT-4o) ने बहुत अच्छा प्रदर्शन किया, लेकिन "इकोनॉमी" मॉडल (सस्ते और तेज़ वाले) थोड़े कम सटीक थे। यह ऐसा ही था जैसे फास्ट-फूड शेफ का खाना भी स्वादिष्ट था, लेकिन मास्टर शेफ बस थोड़ा अधिक सटीक था।
  • सबसे कठिन व्यंजन: हृदय रोग के जोखिम की भविष्यवाणी करना सभी के लिए सबसे कठिन था, जैसे कि एक 'सुफ़ले' (soufflé) जिसे बनाना बहुत मुश्किल होता है। यहाँ तक कि सर्वश्रेष्ठ AI भी अन्य स्थितियों की तुलना में यहाँ थोड़ा संघर्ष करता दिखा।

5. लागत और "गोल्डन टिकट"

इस पूरे प्रयोग की लागत लगभग $59 USD थी। यह दो लोगों के साथ एक अच्छे डिनर से भी कम है!
सबसे महत्वपूर्ण बात? "नुस्खा" (फ्रेमवर्क) सभी के लिए काम कर गया।

बड़ी तस्वीर: यह क्यों मायने रखता है

कल्पना कीजिए कि आप एक अस्पताल बना रहे हैं। इस अध्ययन से पहले, आप AI का उपयोग करने से डर सकते थे क्योंकि आपने सोचा होगा, "यदि मैं Google के AI से OpenAI के AI पर स्विच करता हूँ, तो निदान बदल जाएगा, और मुझे अपना पूरा सिस्टम फिर से प्रशिक्षित करना होगा।"

यह शोध सिद्ध करता है कि आपको चिंता करने की आवश्यकता नहीं है। यदि आप एक ठोस, मानकीकृत प्रणाली (नुस्खा) बनाते हैं, तो आप जब चाहें AI "शेफ" को बदल सकते हैं और इससे आपका सिस्टम खराब नहीं होगा। आप नियमित जांच के लिए सबसे सस्ते AI का उपयोग कर सकते हैं और जटिल मामलों के लिए सबसे महंगे AI का, और परिणाम विश्वसनीय रहेंगे।

संक्षेप में: हमें चिकित्सा डेटा के लिए एक सार्वभौमिक अनुवादक मिल गया है। आप चाहे किसी भी AI से बात करें, यदि आप सही तरीके से सही सवाल पूछते हैं, तो वे सभी आपके स्वास्थ्य के बारे में आपको एक भरोसेमंद उत्तर दे सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →