← नवीनतम पेपर
📄 health informatics

Citation reliability of frontier large language models in medical writing and its automated verification

यह अध्ययन प्रकट करता है कि जहाँ अत्याधुनिक लार्ज लैंग्वेज मॉडल्स अविश्वसनीय चिकित्सा उद्धरणों का एक महत्वपूर्ण अनुपात उत्पन्न करते हैं—जो मुख्य रूप से निर्माण के बजाय गलत आरोपण के माध्यम से होता है—वहीं एक स्वचालित चेन-ऑफ-वेरिफिकेशन प्रणाली इन त्रुटियों का विशेषज्ञ-स्तर की सटीकता के साथ पता लगा सकती है, जो एआई-सहायता प्राप्त चिकित्सा लेखन में उद्धरण अखंडता सुनिश्चित करने के लिए एक व्यवहार्य समाधान प्रदान करती है।

मूल लेखक: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

प्रकाशित 2026-09-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

आधुनिक चिकित्सा पद्धति में, एक शोध पत्र या समीक्षा लेख लिखना एक कठोर प्रक्रिया है जो पूर्ण सटीकता की मांग करती है। लेखकों को न केवल जटिल चिकित्सा ज्ञान का संश्लेषण करना चाहिए, बल्कि हर दावे को साक्ष्य के एक विशिष्ट, मौजूदा स्रोत से भी जोड़ना चाहिए। ये स्रोत संदर्भ (साइटेशन) होते हैं, जो वैज्ञानिक खोज के पदचिह्नों के रूप में कार्य करते हैं, जो पाठकों को मूल अध्ययनों तक वापस ले जाते हैं जो एक नए विचार का समर्थन करते हैं। दशकों से, यह प्रक्रिया एक मानवीय प्रयास रही है, जिसमें नामों, तिथियों और जर्नल शीर्षकों की सावधानीपूर्वक जांच की आवश्यकता होती है ताकि यह सुनिश्चित हो सके कि एक संदर्भ वास्तव में मौजूद है और वही कहता है जो लेखक दावा करता है। हालाँकि, प्रयोगशाला और पुस्तकालय में एक नया उपकरण आया है: लार्ज लैंग्वेज मॉडल। ये शक्तिशाली कंप्यूटर प्रोग्राम हैं जिन्हें विशाल मात्रा में टेक्स्ट पर प्रशिक्षित किया गया है जो सेकंडों में लेख लिख सकते हैं, निष्कर्षों का सारांश निकाल सकते हैं और संदर्भों की सूचियाँ बना सकते हैं। जबकि वे गति और दक्षता का वादा करते हैं, एक महत्वपूर्ण प्रश्न उभरा है: क्या इन मशीनों पर सही पदचिह्न खोजने के लिए भरोसा किया जा सकता है, या वे कभी-कभी उन्हें खुद ही बना लेती हैं?

यह प्रश्न केवल अकादमिक नहीं है; यह चिकित्सा अखंडता के मूल को छूता है। यदि एक कंप्यूटर चिकित्सा समीक्षा लिखता है और इसमें एक ऐसा संदर्भ शामिल करता है जो वास्तविक दिखता है लेकिन गलत अध्ययन की ओर संकेत करता है, या इससे भी बुरा, ऐसे अध्ययन की ओर जो कभी अस्तित्व में ही नहीं था, तो पूरा तर्क ढह सकता है। इस घटना को 'हलुसिनेशन' (hallucination) कहा जाता है, जो कि शुरुआती कंप्यूटर मॉडलों की एक ज्ञात कमजोरी रही है। लेकिन जैसे-जैसे ये उपकरण विकसित हुए हैं, तेज़ हुए हैं और वास्तविक समय में इंटरनेट खोजने की क्षमता से लैस हुए हैं, यह स्पष्ट नहीं हो पाया है कि क्या उन्होंने अंततः सही ढंग से उद्धृत करना सीख लिया है। चिकित्सा समुदाय को यह जानने की आवश्यकता है कि क्या ये नए, उन्नत मॉडल गंभीर शोध में उपयोग के लिए पर्याप्त विश्वसनीय हैं, और यदि वे नहीं हैं, तो क्या उनकी गलतियों को प्रकाशित होने से पहले पकड़ने का कोई व्यावहारिक तरीका है।

शोधकर्ताओं की एक टीम ने तीन सबसे उन्नत कंप्यूटर मॉडलों को एक सख्त परीक्षण में डालकर इन प्रश्नों का उत्तर देने का प्रयास किया। उन्होंने प्रत्येक मॉडल को कार्डियोलॉजी (हृदय और रक्त वाहिकाओं के अध्ययन) के क्षेत्र के नौ अलग-अलग विषयों पर लघु चिकित्सा समीक्षाओं की एक श्रृंखला लिखने के लिए कहा। विषय सामान्य स्थितियों से लेकर दुर्लभ प्रक्रियाओं तक विस्तृत थे, जिससे कई प्रकाशित अध्ययनों वाले विषयों और बहुत कम अध्ययनों वाले विषयों का मिश्रण सुनिश्चित हुआ। प्रत्येक मॉडल को लगभग 600 से 900 शब्दों की समीक्षा लिखने और प्रत्येक लेख के लिए ठीक तीस संदर्भ शामिल करने का निर्देश दिया गया, जिससे कुल 270 समीक्षाएं और 8,000 से अधिक साइटेशन बने। महत्वपूर्ण रूप से, शोधकर्ताओं ने मॉडलों को उनके अंतर्निहित वेब सर्च टूल्स का उपयोग करने की अनुमति दी, जो यह दर्शाता है कि एक उपयोगकर्ता वास्तविक दुनिया के परिवेश में उनका उपयोग कैसे करेगा। लक्ष्य यह देखना था कि इन हजारों साइटेशन्स में से कितने वास्तव में सही थे।

परिणामों ने महत्वपूर्ण भिन्नता और निरंतर त्रुटि का परिदृश्य प्रकट किया। जब शोधकर्ताओं ने आधिकारिक मेडिकल डेटाबेस के विरुद्ध प्रत्येक साइटेशन की जांच की, तो उन्होंने पाया कि मॉडल पूर्ण नहीं थे। एक मॉडल, GPT-5.5, सबसे अच्छा प्रदर्शन कर रहा था, जिसने लगभग 11.5 प्रतिशत मामलों में समस्याग्रस्त साइटेशन उत्पन्न किए। हालाँकि, अन्य दो मॉडल, Claude Opus 4.8 और Gemini 3.5 Flash ने अपने लगभग 30 प्रतिशत साइटेशन्स में त्रुटियां कीं। इसका अर्थ है कि कम सटीक मॉडलों द्वारा उत्पन्न प्रत्येक दस संदर्भों में से लगभग तीन त्रुटिपूर्ण थे। शोधकर्ताओं ने यह भी जांचा कि क्या मॉडल उन विषयों के साथ अधिक संघर्ष करते हैं जिनमें कम प्रकाशित अध्ययन होते हैं, क्योंकि उन्हें डर था कि उपलब्ध जानकारी की कमी कंप्यूटर को भ्रमित कर सकती है। उन्होंने पाया कि हालांकि अधिक साहित्य वाले विषयों के लिए त्रुटि दर थोड़ी कम थी, लेकिन अंतर इतना मजबूत नहीं था कि इसे एक निश्चित नियम माना जा सके। मॉडलों ने विषय पर कितनी भी जानकारी उपलब्ध हो, हर स्तर पर गलतियां कीं।

शायद सबसे अधिक खुलासा करने वाली खोज स्वयं गलतियों की प्रकृति थी। शोधकर्ता उम्मीद कर रहे थे कि उन्हें कई ऐसे मामले मिलेंगे जहाँ कंप्यूटर ने सीधे तौर पर एक फर्जी लेख बना दिया होगा, जो भ्रम (hallucination) का एक क्लासिक रूप है। इसके बजाय, उन्होंने पाया कि अधिकांश त्रुटियां कहीं अधिक सूक्ष्म थीं। लगभग 77 प्रतिशत समस्याग्रस्त साइटेशन 'गलत आरोपण' (misattribution) के मामले थे। इन मामलों में, कंप्यूटर ने एक वास्तविक चिकित्सा लेख के लिए एक वैध पहचानकर्ता प्रदान किया, लेकिन वह लेख वह नहीं था जिसका मॉडल दावा कर रहा था। यह ऐसा था जैसे कंप्यूटर ने पुस्तकालय में एक वास्तविक पुस्तक ढूंढ ली हो लेकिन उसे गलत शेल्फ पर रख दिया हो, और उस पर किसी दूसरी पुस्तक का शीर्षक लिख दिया हो। इस प्रकार की त्रुटि विशेष रूप से खतरनाक है क्योंकि यह पहली नज़र में सही लगती है; एक मानव पाठक एक वैध संख्या देख सकता है और मान सकता है कि संदर्भ भरोसेमंद है, केवल बाद में पता चलता है कि स्रोत उस बिंदु का समर्थन नहीं करता है जिसे बनाया जा रहा है। वास्तविक निर्माण (fabrication), जहाँ कंप्यूटर एक ऐसा लेख बनाता है जो अस्तित्व में ही नहीं है, आश्चर्यजनक रूप से दुर्लभ था, जो त्रुटियों के 1 प्रतिशत से भी कम था।

इन सूक्ष्म त्रुटियों को पकड़ने के लिए मानवीय व्यवस्थित जांच की आवश्यकता को पहचानते हुए, शोधकर्ताओं ने सत्यापन के लिए 'चेन-ऑफ-वेरिफिकेशन' (Chain-of-Verification) नामक एक नई विधि का परीक्षण किया। यह दृष्टिकोण कंप्यूटर मॉडल का ही उपयोग करता है, लेकिन एक अलग तरीके से। केवल संदर्भों को सूचीबद्ध करने के लिए मॉडल से पूछने के बजाय, सिस्टम कार्य को छोटे, स्वतंत्र प्रश्नों की एक श्रृंखला में तोड़ देता है। यह मॉडल से शीर्षक और लेखक के आधार पर लेख खोजने, फिर यह जांचने के लिए कहता है कि क्या जर्नल और वर्ष मेल खाते हैं, और अंत में पुष्टि करने के लिए कि क्या पहचानकर्ता सही दस्तावेज़ की ओर संकेत करता है। मॉडल को अपनी स्मृति पर भरोसा करने के बजाय डेटाबेस के विरुद्ध प्रत्येक जानकारी को अलग-अलग सत्यापित करने के लिए मजबूर करके, सिस्टम अपनी गलतियों को पकड़ सकता है। जब शोधकर्ताओं ने इस पद्धति का परीक्षण मानव विशेषज्ञ द्वारा सावधानीपूर्वक जांच किए गए संदर्भों के सेट के विरुद्ध किया, तो स्वचालित प्रणाली उल्लेखनीय रूप से प्रभावी सिद्ध हुई। इसने समस्याग्रस्त साइटेशन्स में से 96.8 प्रतिशत को सही ढंग से पहचाना, जिसमें गलत आरोपण और निर्माण के सभी मामले शामिल थे, जबकि शायद ही कभी किसी सही साइटेशन को त्रुटि के रूप में चिह्नित किया।

अध्ययन यह निष्कर्ष निकालता है कि हालांकि चिकित्सा लेखन के नवीनतम पीढ़ी के उपकरण शक्तिशाली हैं, वे अभी तक बिना पर्यवेक्षण के भरोसेमंद होने के लिए तैयार नहीं हैं। सबसे आम विफलता फर्जी तथ्य बनाना नहीं है, बल्कि वास्तविक तथ्यों को गलत लेबल करना है, एक ऐसी गलती जिसे पता लगाने के लिए एक विशिष्ट प्रकार की जांच की आवश्यकता होती है। शोधकर्ताओं ने पाया कि एक स्वचालित सत्यापन प्रक्रिया मानव विशेषज्ञ के समान सटीकता के साथ यह जांच कर सकती है। यह सुझाव देता है कि AI-सहायता प्राप्त चिकित्सा लेखन का भविष्य मानव और मशीन के बीच चुनाव नहीं होगा, बल्कि एक साझेदारी होगी जहाँ मशीन सामग्री का मसौदा तैयार करेगी और एक विशेष सत्यापन प्रणाली यह सुनिश्चित करेगी कि प्रत्येक साइटेशन सत्य की ओर संकेत करे। जब तक ऐसा सत्यापन मानक अभ्यास नहीं बन जाता, तब तक इन मॉडलों द्वारा उत्पन्न साइटेशन्स को सावधानी के साथ लिया जाना चाहिए, क्योंकि वे पाठकों को सत्य के गलत स्रोत की ओर ले जा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →