← नवीनतम पेपर
💬 NLP

A Scalable Framework for Evaluating Health Language Models

यह शोध पत्र एडेप्टिव प्रिसाइज बोलियन रूब्रिक्स (Adaptive Precise Boolean rubrics) को प्रस्तुत करता है, जो एक स्केलेबल मूल्यांकन ढांचा है जो स्वास्थ्य-केंद्रित लार्ज लैंग्वेज मॉडल्स का अधिक कुशलता और विश्वसनीयता से आकलन करने के लिए लक्षित हाँ/नहीं प्रश्नों का उपयोग करता है, जिससे विशेषज्ञ और गैर-विशेषज्ञ दोनों रेटर्स के बीच सहमति में सुधार करते हुए मूल्यांकन के समय और लागत को कम किया जा सकता है।

मूल लेखक: Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwa
प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट डॉक्टर बनाया है। यह आपके मेडिकल रिकॉर्ड पढ़ सकता है, आपके स्मार्टवॉच डेटा को देख सकता है, और आपके सवालों के जवाब दे सकता है जैसे, "मुझे थकान क्यों महसूस हो रही है?" या "क्या मुझे अपना आहार बदलना चाहिए?"

लेकिन असली मरीजों से बात करने से पहले, आपको इसका परीक्षण करना होगा। आपको यह सुनिश्चित करना होगा कि यह सुरक्षित, सटीक और मददगार सलाह दे रहा है। यहीं से समस्या शुरू होती है: आप एक रोबोट के निबंध (essay) को ग्रेड कैसे देंगे?

पुराना तरीका: "अस्पष्ट शिक्षक" (The Vague Teacher)

परंपरागत रूप से, जब विशेषज्ञ इन AI डॉक्टरों का परीक्षण करते थे, तो वे एक लिकर्ट स्केल (Likert Scale) नामक विधि का उपयोग करते थे। कल्पना कीजिए कि एक शिक्षक एक छात्र के निबंध को 1 से 5 के पैमाने पर ग्रेड दे रहा है।

  • 1: बहुत बुरा।
  • 3: ठीक-ठाक, लेकिन कुछ बिंदु छूट गए हैं।
  • 5: एकदम सटीक।

समस्या क्या है? "ठीक-ठाक" एक व्यक्तिपरक (subjective) शब्द है। एक शिक्षक सोच सकता है कि 3 एक पास होने वाला ग्रेड है, जबकि दूसरा इसे फेल मान सकता है। यदि आप 100 विशेषज्ञों से एक ही AI उत्तर को ग्रेड देने के लिए कहें, तो वे सभी उसे अलग-अलग नंबर दे सकते हैं। यह कॉफी के कप के तापमान का अनुमान लगाने के लिए 100 लोगों से पूछने जैसा है; कुछ कहते हैं "गुनगुना," कुछ कहते हैं "गर्म," और कोई भी सटीक डिग्री पर सहमत नहीं होता। यह धीमा, महंगा और बड़े पैमाने पर करना कठिन है।

नया तरीका: "चेकलिस्ट जासूस" (The Checklist Detective)

इस शोध पत्र के लेखकों (Google Research और Vituity से) ने एक स्मार्ट तरीका निकाला है जिसे एडेप्टिव प्रिसाइज बुलीअन रूब्रिक्स (Adaptive Precise Boolean Rubrics) कहा जाता है।

इसे केवल एक अस्पष्ट ग्रेड के रूप में नहीं, बल्कि एक अत्यधिक विशिष्ट चेकलिस्ट के रूप में सोचें। उत्तर के बारे में "क्या यह उत्तर अच्छा है?" (जिसका उत्तर देना कठिन है) पूछने के बजाय, वे उत्तर को छोटे, सरल हाँ/नहीं (Yes/No) वाले प्रश्नों में तोड़ देते हैं।

उपमा: घर बनाना

  • पुराना तरीका (Likert): आप घर को देखते हैं और कहते हैं, "यह 5 में से लगभग 4 सितारा दिखता है।"
  • नया तरीका (Boolean): आपके पास एक चेकलिस्ट है:
    • क्या उन्होंने सही ईंटों का उपयोग किया? (हाँ/नहीं)
    • क्या छत वाटरप्रूफ है? (हाँ/नहीं)
    • क्या उन्होंने नींव के लिए सीमेंट की सही मात्रा का उपयोग किया? (हाँ/नहीं)
    • क्या दरवाजा बंद है? (हाँ/नहीं)

सरल "हाँ/नहीं" प्रश्न पूछकर, सभी लोग बहुत जल्दी सहमत हो जाते हैं। इसमें इस बात पर बहस करने की कोई गुंजाइश नहीं रहती कि क्या एक दीवार "थोड़ी सी टेढ़ी" है। या तो वह सीधी है या नहीं।

"एडेप्टिव" जादू: स्मार्ट फ़िल्टर

यहाँ एक चतुर मोड़ है। यदि आपके पास 100 प्रश्नों की एक चेकलिस्ट है, लेकिन AI केवल नींद के बारे में एक प्रश्न का उत्तर दे रहा है, तो ब्लड प्रेशर या कार के इंजन के बारे में प्रश्न देखना समय की बर्बादी है।

लेखकों ने एक "एडेप्टिव" (Adaptive) परत जोड़ी है। एक स्मार्ट फ़िल्टर की कल्पना करें जो उपयोगकर्ता के प्रश्न और AI के उत्तर को देखता है, और फिर केवल प्रासंगिक चेकलिस्ट आइटम ही दिखाता है

  • यदि उपयोगकर्ता मधुमेह (diabetes) के बारे में पूछता है, तो सिस्टम "हृदय गति" के प्रश्न छिपा देता है और केवल "ब्लड शुगर" और "इंसुलिन" के प्रश्न दिखाता है।
  • यदि उपयोगकर्ता नींद के बारे में पूछता है, तो यह मधुमेह के प्रश्नों को छिपा देता है।

यह एक व्यक्तिगत टूर गाइड की तरह है। यदि आप संग्रहालय देखने जा रहे हैं जहाँ पेंटिंग्स हैं, तो गाइड आपका समय मूर्तियों वाले कमरे को दिखाकर बर्बाद नहीं करता। वे केवल वही दिखाते हैं जो आपने पूछा है।

यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने इस नई पद्धति का परीक्षण वास्तविक स्वास्थ्य डेटा (WEAR-ME नामक अध्ययन से, जिसमें Fitbit उपयोगकर्ताओं और रक्त परीक्षणों का उपयोग किया गया था) पर किया। यहाँ उन्हें क्या मिला:

  1. सभी सहमत हैं: चाहे ग्रेड देने वाला एक चिकित्सा विशेषज्ञ हो या एक सामान्य व्यक्ति, चेकलिस्ट का उपयोग करके वे अस्पष्ट 1-5 स्केल की तुलना में बहुत अधिक बार सहमत हुए।
  2. दोगुनी तेजी: क्योंकि "एडेप्टिव" फ़िल्टर अप्रासंगिक प्रश्नों को हटा देता है, इसलिए मूल्यांकन में आधा समय लगा।
  3. गलतियों को बेहतर तरीके से पकड़ा: जब शोधकर्ताओं ने महत्वपूर्ण डेटा (जैसे रोगी का उच्च रक्तचाप छिपाकर) को हटाकर AI को चकमा दिया, तो नए चेकलिस्ट सिस्टम ने तुरंत नोटिस किया कि AI गलती कर रहा है। पुराना 1-5 स्केल अक्सर इन सूक्ष्म गलतियों को पकड़ने में विफल रहता था।

निष्कर्ष (The Bottom Line)

यह शोध पत्र AI डॉक्टरों को ग्रेड देने का एक ऐसा तरीका प्रस्तावित करता है जो तेज़, सस्ता और अधिक विश्वसनीय है। जटिल चिकित्सा निर्णयों को सरल "हाँ/नहीं" चेकलिस्ट में बदलकर और केवल उन्हीं प्रश्नों को पूछकर जो मायने रखते हैं, हम AI स्वास्थ्य उपकरणों के परीक्षण को बड़े पैमाने पर ले जा सकते हैं। यह सुनिश्चित करता है कि जब ये उपकरण अंततः आपके फोन या आपके डॉक्टर के पास पहुँचें, तो वे सुरक्षित, सटीक और वास्तव में मददगार हों।

संक्षेप में: यह अनुमान लगाना बंद करें कि AI "अच्छा" है या नहीं। यह जांचना शुरू करें कि क्या इसने वे विशिष्ट कार्य किए हैं जिन्हें करने के लिए इसे बनाया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →