← नवीनतम पेपर
💬 NLP

Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

यह शोध पत्र तथ्यों के साथ शब्दशः उद्धरण (verbatim quotes) संलग्न करके, बारह बड़े भाषा मॉडलों (large language models) की सत्यापन योग्य नैदानिक उत्तर उत्पन्न करने की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि अधिकांश मॉडल 90% से अधिक दावों के साथ सफलतापूर्वक उद्धरण संलग्न कर सकते हैं, फिर भी ये उद्धरण अक्सर उन दावों के विवरण को पूरी तरह से पुष्ट करने में विफल रहते हैं जिनके वे साथ चलते हैं।

मूल लेखक: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक चिकित्सा की उच्च-दांव वाली दुनिया में, समय अक्सर सबसे दुर्लभ संसाधन होता है। जब एक डॉक्टर को किसी जटिल रोगी मामले का सामना करना पड़ता है, तो उन्हें ऐसे उत्तरों की आवश्यकता होती है जो न केवल सटीक हों, बल्कि तुरंत भरोसेमंद भी हों। वर्षों से, आर्टिफिशियल इंटेलिजेंस ने मदद करने का वादा किया है, यह प्रस्ताव देते हुए कि वह विशाल चिकित्सा साहित्य को स्पष्ट, पठनीय सलाह में संकलित कर सकता है। हालाँकि, एक निरंतर समस्या इन उपकरणों पर साया बनाए हुए है: तथ्यों को गढ़ने की प्रवृत्ति, जिसे "हैलुसिनेशन" (hallination) या भ्रम कहा जाता है। एक ऐसे क्षेत्र में जहाँ एक एकल त्रुटि रोगी को नुकसान पहुँचा सकती है, एक डॉक्टर केवल कंप्यूटर के शब्दों पर भरोसा नहीं कर सकता। उन्हें हर कथन के स्रोत को सत्यापित करने में सक्षम होना चाहिए। पारंपरिक रूप से, जब कोई एआई (AI) उद्धरण के साथ उत्तर प्रदान करता है, तो वह उद्धरण अक्सर एक व्यापक दस्तावेज़ की ओर संकेत करता है, जैसे कि पूरी मेडिकल गाइडलाइन या शोध पत्र। यह व्यस्त चिकित्सक को उस विशिष्ट वाक्य को खोजने के लिए सैकड़ों पन्नों में भटकने के लिए मजबूर करता है जो दावे का समर्थन करता है, एक ऐसी प्रक्रिया जो एक कुशल सहायक होने के उद्देश्य को ही विफल कर देती है। लक्ष्य, इसलिए, ऐसे सिस्टम बनाना है जो न केवल स्रोत की ओर इशारा करें, बल्कि अपने काम को सिद्ध भी करें, यानी दावे के ठीक बगल में उस स्रोत के सटीक शब्दों को प्रदर्शित करें।

जॉन्स हॉपकिन्स यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने यह परीक्षण करने के लिए हाथ लगाया कि क्या वर्तमान आर्टिफिशियल इंटेलिजेंस मॉडल वास्तव में ऐसा कर सकते हैं। उन्होंने हृदय रोग, रक्तचाप, कोलेस्ट्रॉल और मधुमेह से संबंधित चार प्रमुख चिकित्सा दिशानिर्देशों (guidelines) का उपयोग करके नैदानिक प्रश्नों के उत्तर देने के लिए एक विशेष प्रणाली बनाई। मॉडलों को केवल जानकारी का सारांश बनाने देने के बजाय, शोधकर्ताओं ने उन्हें निर्देश दिया कि वे अपने उत्तरों को वाक्य-दर-वाक्य निर्मित करें, और अपने द्वारा किए गए प्रत्येक तथ्यात्मक दावे के साथ मूल दिशानिर्देश से एक सीधा, शब्द-दर-शब्द उद्धरण संलग्न करें। यह देखने के लिए कि क्या यह काम करता है, उन्होंने एक कठोर परीक्षण ढांचा बनाया जो एक डिजिटल ऑडिटर (लेखा परीक्षक) की तरह कार्य करता था। इस प्रणाली ने प्रत्येक उत्तर को उसके घटक दावों में विभाजित किया और तीन विशिष्ट मानकों के विरुद्ध उनकी जाँच की: पहला, क्या मॉडल ने दावे के साथ उद्धरण संलग्न किया? दूसरा, क्या संलग्न उद्धरण मूल दिशानिर्देश के पाठ की एक सटीक, शब्दशः प्रति थी, जिसमें कोई परिवर्तन या पैराफ्रेसिंग (भावार्थ परिवर्तन) नहीं किया गया था? और तीसरा, क्या उस विशिष्ट उद्धरण में वास्तव में इतना पर्याप्त विवरण शामिल था कि वह दावे को सच साबित कर सके, बिना पाठक को कहीं और देखने की आवश्यकता पड़े?

शोधकर्ताओं ने 222 कृत्रिम नैदानिक प्रश्नों का उपयोग करके बारह अलग-अलग लार्ज लैंग्वेज मॉडल्स का परीक्षण किया, जो शक्तिशाली, जटिल प्रणालियों से लेकर छोटी, तेज़ प्रणालियों तक विस्तृत थे। परिणामों ने यह खुलासा किया कि ये मॉडल वास्तव में क्या कर सकते हैं और वास्तविक विश्वसनीयता के लिए क्या आवश्यक है, इसके बीच एक महत्वपूर्ण अंतर है। अधिकांश उन्नत मॉडल पहले दो चरणों में आश्चर्यजनक रूप से अच्छे थे। उन्होंने अपने 90 प्रतिशत से अधिक दावों के साथ सफलतापूर्वक उद्धरण संलग्न किए, और कई मामलों में, उनके द्वारा दिए गए उद्धरण मूल पाठ के सटीक मिलान थे। हालाँकि, प्रणाली अंतिम, सबसे महत्वपूर्ण चरण में नाटकीय रूप से विफल रही: दावे को सिद्ध करना। उदाहरण के लिए, एक मॉडल एक आदर्श उद्धरण प्रदान कर सकता है जिसमें कहा गया हो कि एक दवा एक विशिष्ट समूह के लिए "पसंदीदा" है, लेकिन फिर वह उस उद्धरण का उपयोग यह दावा करने के लिए कर सकता है कि वह दवा सभी के लिए "अनिवार्य" है। एक उल्लेखनीय मामले में, क्लॉड ओपस 5 (Claude Opus 5) नामक एक शीर्ष-स्तरीय मॉडल ने अपने 98 प्रतिशत दावों के साथ एक शब्दशः उद्धरण संलग्न करने में सफलता प्राप्त की, फिर भी केवल 37.1 प्रतिशत दावे केवल उन उद्धरणों द्वारा पूरी तरह से पुष्ट किए जा सकते थे। उद्धरण मौजूद थे, और वे सटीक थे, लेकिन वे बिंदु को सिद्ध करने के लिए अपर्याप्त थे।

अध्ययन ने यह भी रेखांकित किया कि मॉडल का आकार और प्रकार बहुत मायने रखता है। छोटे, हल्के मॉडल अक्सर अपने दावों के साथ उद्धरण संलग्न करने में विफल रहे, या उन्होंने ऐसे उद्धरण प्रदान किए जो मूल पाठ की सटीक प्रतियां नहीं थे, जिससे उनकी सत्यापन दर गिर गई। परीक्षण किए गए सबसे छोटे मॉडलों में से एक, क्लॉड हाइकु (Claude Haiku) केवल लगभग 25 प्रतिशत दावों का ही पूर्ण समर्थन कर सका। इसके विपरीत, सबसे बड़े मॉडलों ने बहुत बेहतर प्रदर्शन किया, जहाँ सर्वश्रेष्ठ प्रणालियों ने लगभग 75 प्रतिशत दावों को सटीक, पर्याप्त साक्ष्य के साथ समर्थित किया। शोधकर्ताओं ने पाया कि विफलता का प्राथमिक कारण यह नहीं था कि मॉडल झूठ बोल रहे थे या चीजें बना रहे थे, बल्कि यह था कि वे सही साक्ष्य चुनने में संघर्ष कर रहे थे। वे अक्सर एक ऐसा उद्धरण चुन लेते थे जो विषय से संबंधित तो था लेकिन जिसमें पूरे वाक्य को पुष्ट करने के लिए आवश्यक विशिष्ट विवरण नहीं थे। यह परीक्षण करने के लिए कि क्या साक्ष्य वास्तव में उपलब्ध था, शोधकर्ताओं ने एक अलग एआई को मूल दस्तावेजों में उन उद्धरणों को खोजने के लिए कहा जो दावों का पूर्ण समर्थन कर सकते थे। उन्होंने पाया कि कई मॉडलों के लिए, गायब साक्ष्य वहीं मौजूद था जिसे उन्होंने पहले ही पढ़ लिया था; मॉडल बस सही हिस्सों को निकालने और संलग्न करने में विफल रहे।

अंततः, यह कार्य प्रदर्शित करता है कि हालांकि आर्टिफिशियल इंटेलिजेंस चिकित्सा संबंधी जानकारी प्राप्त करने और उसे प्रारूपित करने में तेजी से सक्षम हो रहा है, लेकिन यह नैदानिक सेटिंग में मानवीय निरीक्षण के बिना पूरी तरह से भरोसेमंद होने के लिए अभी तैयार नहीं है। एक सुसंगत उत्तर उत्पन्न करने की क्षमता, एक सत्यापन योग्य उत्तर बनाने की क्षमता से भिन्न है। अध्ययन दिखाता है कि वर्तमान मॉडल अक्सर सत्यापन के लिए कच्चा माल प्रदान कर सकते हैं, लेकिन वे अक्सर उन्हें एक पूर्ण, स्व-निहित प्रमाण के रूप में संयोजित करने में विफल रहते हैं। आगे का मार्ग ऐसे सिस्टम की मांग करता है जो न केवल स्रोतों का हवाला दें, बल्कि यह भी सुनिश्चित करें कि उनकी सलाह का प्रत्येक शब्द मूल दिशानिर्देशों से एक विशिष्ट, पर्याप्त और अपरिवर्तित साक्ष्य द्वारा समर्थित हो। जब तक मॉडल लगातार एक उद्धरण रखने और एक बिंदु को सिद्ध करने के बीच के अंतर को पाटने में सक्षम नहीं होते, तब तक सत्यापन की जिम्मेदारी पूरी तरह से मानव चिकित्सक के हाथों में रहेगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →