Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study
यह अध्ययन मात्रात्मक रूप से प्रकट करता है कि व्यापक रूप से उपयोग किए जाने वाले मुफ्त-संस्करण वाले बड़े भाषा मॉडल सटीक चिकित्सा साहित्य संदर्भों को पुनर्प्राप्त करने के दौरान महत्वपूर्ण परिवर्तनशीलता और पूर्ण विफलता की उच्च दर (47.8%) प्रदर्शित करते हैं, जो एआई द्वारा जनरेट किए गए ग्रंथ सूची डेटा के मानवीय सत्यापन की महत्वपूर्ण आवश्यकता को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र हैं जो एक रिसर्च पेपर लिखने की कोशिश कर रहे हैं। आप एक सुपर-स्मार्ट, सर्वज्ञानी रोबोट लाइब्रेरियन से मदद के लिए 10 किताबों की सूची माँगते हैं। रोबोट आपको शीर्षक, लेखक और लाइब्रेरी कॉल नंबर के साथ एक सूची थमाता है। आप खुश होकर पढ़ना शुरू करते हैं। लेकिन फिर, आपको एहसास होता है: आधी किताबें वास्तव में मौजूद ही नहीं हैं। कुछ में सही शीर्षक है लेकिन गलत लेखक। कुछ में सही लेखक है लेकिन गलत वर्ष। कुछ कॉल नंबर खाली शेल्फों की ओर ले जाते हैं।
यह बिल्कुल वैसा ही है जैसा जेनी गाओ और लांजिंग झांग द्वारा की गई एक नई स्टडी में पाया गया, जब उन्होंने मेडिकल रिसर्च पेपर्स खोजने के दौरान AI "लाइब्रेरियन" (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) का परीक्षण किया।
यहाँ उनके निष्कर्षों का विवरण दिया गया, जिसे रोजमर्रा की भाषा में अनुवादित किया गया है:
बड़ा प्रयोग: "रोबोट लाइब्रेरियन" टेस्ट
शोधकर्ताओं ने पांच लोकप्रिय फ्री AI टूल्स को परखने का फैसला किया: Grok, ChatGPT, Google Gemini, Perplexity, और DeepSeek।
उन्होंने चार प्रसिद्ध जर्नल्स (जैसे New England Journal of Medicine और JAMA) से 40 वास्तविक, उच्च गुणवत्ता वाले मेडिकल आर्टिकल्स चुने। उन्होंने प्रत्येक AI से पूछा: "यह इस लेख का सारांश है। कृपया मुझे इस विषय से संबंधित 10 अन्य महत्वपूर्ण पेपर खोज कर दें, और मुझे उनके सटीक विवरण (जैसे DOI, PubMed ID और लिंक) दें ताकि मैं उन्हें ढूँढ सकूँ।"
AI टूल्स ने कुल 2,000 संदर्भ (references) जेनरेट किए। शोधकर्ताओं ने सख्त लाइब्रेरियन की तरह काम किया, और हर एक की जांच की कि क्या वह वास्तविक और सही था।
चौंकाने वाले परिणाम: "हैलुसिनेशन" (भ्रम) की समस्या
परिणाम उन लोगों के लिए डरावने थे जो अपना होमवर्क करने के लिए AI पर भरोसा कर रहे थे:
- "पूर्ण विफलता" की दर: लगभग 48% बार, AI ने एक ऐसा संदर्भ दिया जो पूरी तरह से बेकार था। या तो वह एक नकली पेपर था जिसका अस्तित्व ही नहीं था, या विवरण इतने गलत थे कि आप उस पेपर को ढूँढ ही नहीं सकते थे। यह ऐसा है जैसे कोई रोबोट आपको एक खजाने के नक्शे के साथ दे रहा हो जो एक ऐसे खेत में दबा हुआ है जिसका अस्तित्व ही नहीं है।
- "औसत" स्कोर: यदि आप AI को 0 से 1 का स्कोर देते हैं (जहाँ 1 पूर्ण है), तो औसत स्कोर केवल 0.29 था। यह एक फेल ग्रेड है।
- विजेता और हारने वाले:
- Grok "ऑनर स्टूडेंट" था, जिसने सबसे अधिक सही विवरण दिए (हालांकि इसने भी गलतियाँ कीं)।
- Google Gemini "संघर्ष करने वाला छात्र" था, जिसने ज्यादातर समय विवरण गलत दिए।
- ChatGPT और Perplexity बीच में थे, लेकिन फिर भी पूर्णता से बहुत दूर थे।
ऐसा क्यों हुआ?
स्टडी में पाया गया कि रोबोट क्यों भ्रमित हुए इसके दो मुख्य कारण थे:
- "जर्नल" कारक: AI के लिए New England Journal of Medicine (NEJM) के पेपर्स के सही विवरण ढूँढना British Medical Journal (BMJ) की तुलना में कठिन था। शोधकर्ताओं को संदेह है कि ऐसा इसलिए है क्योंकि NEJM के एब्स्ट्रैक्ट्स (abstracts) छोटे होते हैं और उनमें AI को सही पेपर खोजने के लिए कम जानकारी मिलती है। यह ऐसा है जैसे किसी भीड़ में किसी विशिष्ट व्यक्ति को ढूंढना जब आपके पास केवल उनका पहला नाम है बनाम उनके पास उनका पूरा नाम और पता है।
- "आत्मविश्वास" का जाल: AI टूल्स बहुत आत्मविश्वासी थे। वे आपको शीर्षक, तारीख और लिंक के साथ एक एकदम सही दिखने वाली सूची देंगे। लेकिन अक्सर, लिंक टूटे हुए होते हैं या तारीखें गलत होती हैं। इसे "रेफरेंशियल हेलुसिनेशन" (Referential Hallucination) कहा जाता है। AI आपकी मदद करने के लिए इतना उत्सुक है कि वह ऐसे तथ्य बना देता है जो सच लगते हैं लेकिन वास्तव में काल्पनिक होते हैं।
"डबल-चेक" काम नहीं आया
शोधकर्ताओं ने एक चतुर ट्रिक आजमाई। AI द्वारा सूची देने के बाद, उन्होंने उससे पूछा: "कृपया इन नंबरों और लिंक्स को दोबारा चेक करें ताकि सुनिश्चित हो सके कि वे वास्तविक हैं।"
क्या इससे मदद मिली? नहीं। AI ने बस अपने ही गलतियों को पूरे आत्मविश्वास के साथ दोबारा चेक किया। यह वैसा ही है जैसे किसी ऐसे व्यक्ति से उसकी बनाई कहानी को सत्यापित करने के लिए कहना जिसने खुद कहानी बनाई हो; वह बस अपनी झूठ को और अधिक आत्मविश्वास के साथ दोहरा देगा।
मुख्य सीख: AI को एक गाइड के रूप में उपयोग करें, गुरु के रूप में नहीं
तो, इसका आपके लिए क्या अर्थ है?
- AI एक बेहतरीन विचार मंथन (brainstorming) पार्टनर है: यह आपको विषयों के बारे में सोचने या सामान्य विचार खोजने में मदद कर सकता है।
- AI एक बहुत बुरा फैक्ट-चेकर है: आप मेडिकल या वैज्ञानिक शोध के लिए "रसीदें" (वास्तविक लिंक, तारीखें और आईडी) देने के लिए इस पर भरोसा नहीं कर सकते।
- स्वर्ण नियम: यदि कोई AI आपको कोई संदर्भ देता है, तो आपको स्वयं उस पेपर को ढूँढना होगा और सत्यापित करना होगा कि वह मौजूद है। AI की सूची को सीधे अपने काम में कॉपी-पेस्ट न करें।
संक्षेप में: लार्ज लैंग्वेज मॉडल्स उन उत्साही टूर गाइड्स की तरह हैं जो दुनिया के बारे में बहुत कुछ जानते हैं लेकिन कभी-कभी ऐसे लैंडमार्क बना देते हैं जो वहां हैं ही नहीं। यदि आप उनके नक्शे का आँख मूंदकर पालन करते हैं, तो आप एक ऐसे खेत में खो सकते जिसका अस्तित्व ही नहीं है। मेडिकल रिसर्च के दौरान नेविगेट करते समय हमेशा अपना खुद का कंपास (मानवीय सत्यापन) साथ रखें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।