← नवीनतम पेपर
💻 computer science

Rater choice determines measured fidelity: a multi-model evaluation of large language model raters for AI-generated plain-language biomedical summaries

यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल रेटर (LLM rater) का चयन एआई-जनरेटेड बायोमेडिकल सारांशों में मापी गई फिडेलिटी (fidelity) और सुरक्षा अनुपालन को महत्वपूर्ण रूप से प्रभावित करता है, जिसमें विभिन्न मॉडल त्रुटि दरों को चार के कारक (factor of four) से भिन्न रूप में उत्पन्न करते हैं और सारांश की गुणवत्ता के बारे में अलग-अलग निष्कर्षों की ओर ले जाते हैं।

मूल लेखक: Aditi Kishore¹

प्रकाशित 2026-08-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aditi Kishore¹

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ सबसे महत्वपूर्ण चिकित्सा खोजें जटिल भाषा की दीवार के पीछे बंद हैं। वैज्ञानिक शोध पत्र विशेषज्ञों के लिए लिखे जाते हैं, जो तकनीकी शब्दों और सघन डेटा से भरे होते हैं जिन्हें एक औसत व्यक्ति नहीं समझ सकता। फिर भी, अपनी स्थिति के लिए एक नए उपचार को समझने की कोशिश कर रहे रोगी के लिए, यह बाधा खतरनाक हो सकती है। यदि वे अध्ययन को नहीं पढ़ सकते, तो वे जोखिमों, सीमाओं या किसी थेरेपी के वास्तविक लाभों को नहीं जान सकते। इस अंतर को पाटने के लिए, शोधकर्ता और नियामक तेजी से "सरल-भाषा सारांशों" (plain-language summaries) पर भरोसा कर रहे हैं—जो जटिल अध्ययनों के संक्षिप्त, सरल विवरण हैं जिनका उद्देश्य आम जनता है। जैसे-जैसे चिकित्सा अनुसंधान का आयतन विस्फोट की तरह बढ़ रहा है, इन सारांशों को हाथ से लिखना असंभव होता जा रहा है। इसके बजाय, बड़े भाषा मॉडल (large language models) नामक शक्तिशाली कंप्यूटर प्रोग्रामों से यह काम करने के लिए कहा जा रहा है, जो सघन विज्ञान को सेकंडों में पठनीय गद्य में अनुवादित करते हैं। लेकिन एक महत्वपूर्ण प्रश्न बना हुआ है: यदि एक कंप्यूटर सारांश लिखता है, तो क्या दूसरे कंप्यूटर पर यह जांचने के लिए भरोसा किया जा सकता है कि वह सटीक है या नहीं?

एक हालिया अध्ययन ने इस प्रश्न का उत्तर देने के लिए चार अलग-अलग कृत्रिम बुद्धिमत्ता (AI) मॉडलों को परीक्षण के घेरे में रखकर उत्तर देने का प्रयास किया। शोधकर्ता, जिन्होंने सारांश उत्पन्न करने वाले उपकरण का निर्माण भी किया था, ने एक नियंत्रित वातावरण बनाया ताकि यह देखा जा सके कि क्या ये AI "जज" त्रुटियों को विश्वसनीय रूप से पकड़ सकते हैं। प्रक्रिया पचास वास्तविक, सहकर्मी-समीक्षित (peer-reviewed) चिकित्सा लेखों के साथ शुरू हुई जो पांच अलग-अलग बीमारियों से संबंधित थे। एक सारांशीकरण एप्लिकेशन, जिसे रोगियों या पेशेवरों जैसे विभिन्न दर्शकों के लिए सामग्री तैयार करने के लिए डिज़ाइन किया गया था, ने इन लेखों को 200 विशिष्ट सरल-भाषा अनुभागों में बदल दिया। लक्ष्य यह देखना था कि क्या सारांश मूल पाठ के प्रति वफादार हैं। ऐसा करने के लिए, चार अलग-अलग AI मॉडल—प्रत्येक एक अलग प्रकार का लार्ज लैंग्वेज मॉडल—को एक ही समान, सख्त चेकलिस्ट का उपयोग करके उन्हीं 196 सारांशों को ग्रेड करने के लिए कहा गया। यह चेकलिस्ट स्रोत पाठ पर आधारित थी, जिसका अर्थ था कि AI को दिए गए प्रत्येक प्रश्न का संबंध मूल लेख के एक विशिष्ट तथ्य से था, जैसे कि "क्या सारांश ने इस विशिष्ट दुष्प्रभाव का उल्लेख किया?" या "क्या इसने अध्ययन की सीमाओं को सही ढंग से बताया?"

परिणामों ने एक चौंकाने वाली विसंगति का खुलासा किया। जब चार AI मॉडलों ने एक ही सारांशों को ग्रेड किया, तो वे सहमत नहीं हुए। वास्तव में, त्रुटियों की संख्या मापने में उनके बीच चार गुना का अंतर था। दो मॉडल बहुत सख्त थे, जिन्होंने पाठ में बड़ी संख्या में त्रुटियां पाईं, जबकि अन्य दो बहुत उदार थे, जिन्होंने अक्सर लगभग कोई त्रुटि नहीं पाई। अंतर इतना बड़ा था कि यह चर्चा की जा रही बीमारी के प्रकार या सारांश के लक्षित दर्शक से भी अधिक महत्वपूर्ण था। एक मॉडल ने विशेष रूप रूप से पाया कि आधे से अधिक सारांशों में कोई प्राथमिक त्रुटि नहीं थी, जबकि सबसे सख्त मॉडल ने लगभग हर एक में त्रुटियां पाईं। यह विचलन यादृच्छिक शोर (random noise) नहीं था; यह यह दर्शाता था कि मॉडल के संचालन में एक विशिष्ट दोष था। उदार मॉडल केवल वही देख रहे थे जो सारांश में मौजूद था, वे उन चीजों को पहचानने में विफल रहे जो वहां होनी चाहिए थीं लेकिन गायब थीं। वे यह नोटिस करने में विफल रहे कि जब एक महत्वपूर्ण सुरक्षा चेतावनी या अध्ययन की सीमा को पूरी तरह से छोड़ दिया गया था।

सूचनाओं के छूट जाने की यह विफलता रोगी सुरक्षा के लिए गंभीर निहितार्थ रखती है। अध्ययन मुख्य रूप से "सुरक्षा-महत्वपूर्ण चूक" (safety-critical omissions) पर केंद्रित था, जैसे कि यह चेतावनी कि किसे दवा नहीं लेनी चाहिए या कौन से खतरनाक दुष्प्रभाव हो सकते हैं। मूल लेखों में, अट्ठाईस अनुभागों में कम से कम एक सुरक्षा कथन शामिल था। सबसे सख्त AI मॉडल ने पाया कि इन 29 में से 22 सारांशों ने उस सुरक्षा जानकारी को छोड़ दिया था। हालांकि, सबसे उदार मॉडल ने इनमें से केवल चार खतरनाक चूकों को पहचाना। जब शोधकर्ता ने AI के परिणामों की तुलना एक मानव विशेषज्ञ से की, जिसने उन्हीं सारांशों के एक छोटे नमूने को ग्रेड किया था, तो पैटर्न स्पष्ट हो गया। मानव विशेषज्ञ ने एक ऐसी त्रुटि दर पाई जो सख्त और उदार AI मॉडलों के बीच में थी। सख्त AI मॉडल मानव के निर्णय से निकटता से मेल खाता था, जबकि उदार मॉडल उन आधे से अधिक त्रुटियों को पकड़ने में लगातार विफल रहे जो मानव ने पाई थीं। यह सुझाव देता है कि सुरक्षा की जांच के लिए उदार AI पर भरोसा करना सुरक्षा की झूठी भावना दे सकता है, जिससे खतरनाक सारांश बिना पता चले गुणवत्ता द्वार से गुजर सकते हैं।

अध्ययन ने एक छिपी हुई तकनीकी समस्या को भी उजागर किया जो तस्वीर को और अधिक जटिल बनाती है। परीक्षण के दौरान, कुछ AI मॉडल कोई उत्तर देने में विफल रहे, जिससे खाली प्रतिक्रियाएं प्राप्त हुईं। अध्ययन में उपयोग किए गए कंप्यूटर कोड में, इन खाली प्रतिक्रियाओं को गलती से पूर्ण स्कोर मान लिया गया, जैसे कि मॉडल ने पाठ को पढ़ा हो और उसे त्रुटिहीन पाया हो। जब शोधकर्ता ने इन विशिष्ट परीक्षणों को दोबारा चलाया, तो उन्होंने पाया कि कई "पूर्ण" स्कोर वास्तव में मौन विफलताएं थीं जहां मॉडल ने हार मान ली थी। भले ही इन विफलताओं को ध्यान में रखा गया, निष्कर्ष वही रहा: उदार मॉडल व्यवस्थित रूप से त्रुटियों का कम पता लगा रहे थे। अध्ययन का निष्कर्ष है कि कोई भी सार्वभौमिक रूप से विश्वसनीय AI जज नहीं है। एक मॉडल जो एक कार्य या एक प्रकार के पाठ के लिए अच्छा काम करता है, वह दूसरे के लिए पूरी तरह विफल हो सकता है। यह जानने का एकमात्र तरीका कि क्या कोई AI चिकित्सा सारांशों की जांच के लिए भरोसेमंद है, उसे उस विशिष्ट सामग्री के विरुद्ध मानव मानक के खिलाफ परखना है जिसका वह ग्रेडिंग करेगा। इस सत्यापन के बिना, जज के रूप में किस AI का उपयोग किया जाए, इसका चुनाव इस निष्कर्ष को बदल सकता है कि क्या कोई सारांश पढ़ने के लिए सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →