← नवीनतम पेपर
📊 statistics

Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study

यह अध्ययन मात्रात्मक रूप से प्रकट करता है कि व्यापक रूप से उपयोग किए जाने वाले मुफ्त-संस्करण वाले बड़े भाषा मॉडल सटीक चिकित्सा साहित्य संदर्भों को पुनर्प्राप्त करने के दौरान महत्वपूर्ण परिवर्तनशीलता और पूर्ण विफलता की उच्च दर (47.8%) प्रदर्शित करते हैं, जो एआई द्वारा जनरेट किए गए ग्रंथ सूची डेटा के मानवीय सत्यापन की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

मूल लेखक: Jenny Gao (College of Arts and Science, New York University, New York, NY), Yongfeng Zhang (Department of Computer Sciences, School of Arts & Sciences, Rutgers University, Piscataway, NJ), Mary L Disi
प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jenny Gao (College of Arts and Science, New York University, New York, NY), Yongfeng Zhang (Department of Computer Sciences, School of Arts & Sciences, Rutgers University, Piscataway, NJ), Mary L Disis (UW Medicine Cancer Vaccine Institute University of Washington, Seattle, WA), Lanjing Zhang (Department of Chemical Biology, Ernest Mario School of Pharmacy, Rutgers University, Piscataway, NJ, Department of Pathology, Princeton Medical Center, Plainsboro, NJ, Rutgers Cancer Institute, New Brunswick, NJ)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र हैं जो एक रिसर्च पेपर लिखने की कोशिश कर रहे हैं। आप एक सुपर-स्मार्ट, सर्वज्ञानी रोबोट लाइब्रेरियन से मदद के लिए 10 किताबों की सूची माँगते हैं। रोबोट आपको शीर्षक, लेखक और लाइब्रेरी कॉल नंबर के साथ एक सूची थमाता है। आप खुश होकर पढ़ना शुरू करते हैं। लेकिन फिर, आपको एहसास होता है: आधी किताबें वास्तव में मौजूद ही नहीं हैं। कुछ में सही शीर्षक है लेकिन गलत लेखक। कुछ में सही लेखक है लेकिन गलत वर्ष। कुछ कॉल नंबर खाली शेल्फों की ओर ले जाते हैं।

यह बिल्कुल वैसा ही है जैसा जेनी गाओ और लांजिंग झांग द्वारा की गई एक नई स्टडी में पाया गया, जब उन्होंने मेडिकल रिसर्च पेपर्स खोजने के दौरान AI "लाइब्रेरियन" (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) का परीक्षण किया।

यहाँ उनके निष्कर्षों का विवरण दिया गया, जिसे रोजमर्रा की भाषा में अनुवादित किया गया है:

बड़ा प्रयोग: "रोबोट लाइब्रेरियन" टेस्ट

शोधकर्ताओं ने पांच लोकप्रिय फ्री AI टूल्स को परखने का फैसला किया: Grok, ChatGPT, Google Gemini, Perplexity, और DeepSeek

उन्होंने चार प्रसिद्ध जर्नल्स (जैसे New England Journal of Medicine और JAMA) से 40 वास्तविक, उच्च गुणवत्ता वाले मेडिकल आर्टिकल्स चुने। उन्होंने प्रत्येक AI से पूछा: "यह इस लेख का सारांश है। कृपया मुझे इस विषय से संबंधित 10 अन्य महत्वपूर्ण पेपर खोज कर दें, और मुझे उनके सटीक विवरण (जैसे DOI, PubMed ID और लिंक) दें ताकि मैं उन्हें ढूँढ सकूँ।"

AI टूल्स ने कुल 2,000 संदर्भ (references) जेनरेट किए। शोधकर्ताओं ने सख्त लाइब्रेरियन की तरह काम किया, और हर एक की जांच की कि क्या वह वास्तविक और सही था।

चौंकाने वाले परिणाम: "हैलुसिनेशन" (भ्रम) की समस्या

परिणाम उन लोगों के लिए डरावने थे जो अपना होमवर्क करने के लिए AI पर भरोसा कर रहे थे:

  • "पूर्ण विफलता" की दर: लगभग 48% बार, AI ने एक ऐसा संदर्भ दिया जो पूरी तरह से बेकार था। या तो वह एक नकली पेपर था जिसका अस्तित्व ही नहीं था, या विवरण इतने गलत थे कि आप उस पेपर को ढूँढ ही नहीं सकते थे। यह ऐसा है जैसे कोई रोबोट आपको एक खजाने के नक्शे के साथ दे रहा हो जो एक ऐसे खेत में दबा हुआ है जिसका अस्तित्व ही नहीं है।
  • "औसत" स्कोर: यदि आप AI को 0 से 1 का स्कोर देते हैं (जहाँ 1 पूर्ण है), तो औसत स्कोर केवल 0.29 था। यह एक फेल ग्रेड है।
  • विजेता और हारने वाले:
    • Grok "ऑनर स्टूडेंट" था, जिसने सबसे अधिक सही विवरण दिए (हालांकि इसने भी गलतियाँ कीं)।
    • Google Gemini "संघर्ष करने वाला छात्र" था, जिसने ज्यादातर समय विवरण गलत दिए।
    • ChatGPT और Perplexity बीच में थे, लेकिन फिर भी पूर्णता से बहुत दूर थे।

ऐसा क्यों हुआ?

स्टडी में पाया गया कि रोबोट क्यों भ्रमित हुए इसके दो मुख्य कारण थे:

  1. "जर्नल" कारक: AI के लिए New England Journal of Medicine (NEJM) के पेपर्स के सही विवरण ढूँढना British Medical Journal (BMJ) की तुलना में कठिन था। शोधकर्ताओं को संदेह है कि ऐसा इसलिए है क्योंकि NEJM के एब्स्ट्रैक्ट्स (abstracts) छोटे होते हैं और उनमें AI को सही पेपर खोजने के लिए कम जानकारी मिलती है। यह ऐसा है जैसे किसी भीड़ में किसी विशिष्ट व्यक्ति को ढूंढना जब आपके पास केवल उनका पहला नाम है बनाम उनके पास उनका पूरा नाम और पता है।
  2. "आत्मविश्वास" का जाल: AI टूल्स बहुत आत्मविश्वासी थे। वे आपको शीर्षक, तारीख और लिंक के साथ एक एकदम सही दिखने वाली सूची देंगे। लेकिन अक्सर, लिंक टूटे हुए होते हैं या तारीखें गलत होती हैं। इसे "रेफरेंशियल हेलुसिनेशन" (Referential Hallucination) कहा जाता है। AI आपकी मदद करने के लिए इतना उत्सुक है कि वह ऐसे तथ्य बना देता है जो सच लगते हैं लेकिन वास्तव में काल्पनिक होते हैं।

"डबल-चेक" काम नहीं आया

शोधकर्ताओं ने एक चतुर ट्रिक आजमाई। AI द्वारा सूची देने के बाद, उन्होंने उससे पूछा: "कृपया इन नंबरों और लिंक्स को दोबारा चेक करें ताकि सुनिश्चित हो सके कि वे वास्तविक हैं।"

क्या इससे मदद मिली? नहीं। AI ने बस अपने ही गलतियों को पूरे आत्मविश्वास के साथ दोबारा चेक किया। यह वैसा ही है जैसे किसी ऐसे व्यक्ति से उसकी बनाई कहानी को सत्यापित करने के लिए कहना जिसने खुद कहानी बनाई हो; वह बस अपनी झूठ को और अधिक आत्मविश्वास के साथ दोहरा देगा।

मुख्य सीख: AI को एक गाइड के रूप में उपयोग करें, गुरु के रूप में नहीं

तो, इसका आपके लिए क्या अर्थ है?

  • AI एक बेहतरीन विचार मंथन (brainstorming) पार्टनर है: यह आपको विषयों के बारे में सोचने या सामान्य विचार खोजने में मदद कर सकता है।
  • AI एक बहुत बुरा फैक्ट-चेकर है: आप मेडिकल या वैज्ञानिक शोध के लिए "रसीदें" (वास्तविक लिंक, तारीखें और आईडी) देने के लिए इस पर भरोसा नहीं कर सकते।
  • स्वर्ण नियम: यदि कोई AI आपको कोई संदर्भ देता है, तो आपको स्वयं उस पेपर को ढूँढना होगा और सत्यापित करना होगा कि वह मौजूद है। AI की सूची को सीधे अपने काम में कॉपी-पेस्ट न करें।

संक्षेप में: लार्ज लैंग्वेज मॉडल्स उन उत्साही टूर गाइड्स की तरह हैं जो दुनिया के बारे में बहुत कुछ जानते हैं लेकिन कभी-कभी ऐसे लैंडमार्क बना देते हैं जो वहां हैं ही नहीं। यदि आप उनके नक्शे का आँख मूंदकर पालन करते हैं, तो आप एक ऐसे खेत में खो सकते जिसका अस्तित्व ही नहीं है। मेडिकल रिसर्च के दौरान नेविगेट करते समय हमेशा अपना खुद का कंपास (मानवीय सत्यापन) साथ रखें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →