Misinformation Exposure in the Chinese Web: A Cross-System Evaluation of Search Engines, LLMs, and AI Overviews
यह शोध एक वास्तविक दुनिया के क्वेरी डेटासेट को पेश करते हुए चीनी वेब में पारंपरिक खोज इंजनों, स्टैंडअलोन एलएलएम (LLMs) और एआई ओवरव्यू की तथ्यात्मक विश्वसनीयता का मूल्यांकन करता है, जो महत्वपूर्ण सटीकता असमानताओं को प्रकट करता है और चीनी उपयोगकर्ताओं के गलत सूचनाओं के क्षेत्रीय जोखिम का अनुमान लगाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप चीन के एक विशाल, हलचल भरे पुस्तकालय में हैं, लेकिन किताबों के बजाय, यहाँ की अलमारियाँ डिजिटल उत्तरों से भरी हुई हैं। आपके पास एक सरल प्रश्न है: "क्या यह सच है कि पानी पीने से जुकाम ठीक हो जाता है?" या "क्या मुझे इस मेडिकल टेस्ट से पहले उपवास करने की आवश्यकता है?"
अतीत में, आप एक लाइब्रेरियन (सर्च इंजन) से पूछते कि आपको कुछ किताबें दिखा दे ताकि आप खुद उत्तर ढूँढ सकें। आज, आप एक सुपर-स्मार्ट रोबोट (AI) से कह सकते हैं कि वह आपके लिए किताबें पढ़ ले और आपको सीधे उत्तर बता दे।
यह शोध पत्र इन सूचना प्राप्त करने के विभिन्न तरीकों का एक विशाल, वैज्ञानिक "स्वाद परीक्षण" (taste test) है। शोधकर्ता यह देखना चाहते थे कि: कौन अधिक बार सच बोलता है? और कौन सबसे अधिक गलतियाँ करता है?
यहाँ उनके निष्कर्षों का सरल विवरण दिया गया है:
1. तीन दावेदार
शोधकर्ताओं ने तीन प्रकार के "सूचना मार्गदर्शकों" के बीच एक दौड़ आयोजित की:
- पारंपरिक लाइब्रेरियन (सर्च इंजन): ये क्लासिक सर्च टूल्स हैं जैसे Baidu, Sogou और Bing China। ये आपको सीधे उत्तर नहीं देते; ये आपको लिंक्स की एक सूची (जैसे एक मेनू) देते हैं और उम्मीद करते हैं कि आप सही वाला चुन लेंगे।
- एकल प्रतिभाशाली (Standalone LLMs): ये चैटबॉट्स (जैसे Qwen या DeepSeek) हैं जिनसे आप सीधे बात करते हैं। वे लाइब्रेरी में देखने के बजाय अपने स्वयं के "मस्तिष्क" से उत्तर देने की कोशिश करते हैं।
- हाइब्रिड कंसीयज (AI ओवरव्यू): यह नवीनतम फीचर है (जैसे Baidu का AI ओवरव्यू) जहाँ सर्च इंजन एक रोबोट का उपयोग शीर्ष लिंक्स को पढ़ने के लिए करता है और फिर आपके लिए एक साफ बॉक्स में उत्तर का सारांश प्रस्तुत करता है।
2. परीक्षण: 12,000 वास्तविक प्रश्न
शोधकर्ताओं ने केवल काल्पनिक प्रश्न नहीं बनाए। उन्होंने लाखों चीनी लोगों के वास्तविक सर्च लॉग्स को खंगाला और 12,161 वास्तविक "हाँ या ना" वाले प्रश्न निकाले जो लोग वास्तव में पूछ रहे थे।
- उदाहरण: "क्या कुपोषण से निकट दृष्टि दोष (nearsightedness) होता है?"
- इसके बाद उन्होंने तीनों दावेदारों से इन प्रश्नों के उत्तर पूछे और जाँच की कि किसने सही उत्तर दिया।
3. परिणाम: कोई भी पूर्ण नहीं है
बड़ी बात यह है कि यहाँ तक कि सबसे स्मार्ट सिस्टम भी काफी गलतियाँ करते हैं।
- सर्वश्रेष्ठ प्रदर्शन करने वाला: "हाइब्रिड कंसीयज" (Baidu AI Overview) सबसे सटीक था, जिसने लगभग 70% उत्तर सही दिए।
- मध्यम श्रेणी: पारंपरिक सर्च इंजन और एकल चैटबॉट्स लगभग 60-65% के आसपास रहे।
- सबसे खराब प्रदर्शन करने वाला: एक ओपन-सोर्स मॉडल (LLaMA) ने केवल लगभग 45% सही उत्तर दिए।
"तीन में से एक" की समस्या: सबसे अच्छा सिस्टम भी अभी भी लगभग प्रत्येक 3 या 4 प्रश्नों में से 1 का गलत उत्तर देता है। इसका मतलब है कि यदि आप कोई चिकित्सा प्रश्न पूछते हैं, तो पूरी तरह से गलत लेकिन आत्मविश्वास से भरा उत्तर मिलने की काफी संभावना है।
4. "हाँ" बनाम "ना" का जाल
शोधकर्ताओं ने कुछ मजेदार और खतरनाक पैटर्न पाए:
- "ना" का पूर्वाग्रह (Bias): कुछ सर्च इंजन (जैसे इस अध्ययन में Bing) "हाँ" कहने से डरते थे। यदि आपने पूछा, "क्या यह दवा सुरक्षित है?", तो वे अक्सर "नहीं" कह देते थे, भले ही वह सुरक्षित हो, केवल सावधानी बरतने के लिए।
- "हाँ" का पूर्वाग्रह: अन्य सिस्टम सहमत होने के लिए बहुत उत्सुक थे।
- विषय संबंधी समस्या: रोबोट "शॉपिंग" या "खेल" के बारे में सवालों के जवाब देने में बेहतरीन थे लेकिन "स्वास्थ्य" या "प्रौद्योगिकी" में बहुत खराब थे। यह एक ऐसे शेफ की तरह है जो एक बेहतरीन बर्गर तो बना सकता है लेकिन हर बार उसकी सब्जियां जला देता है।
5. खतरे का मानचित्र: किसे सबसे अधिक नुकसान पहुँचता है?
यह अध्ययन का सबसे महत्वपूर्ण हिस्सा है। शोधकर्ताओं ने अपने सटीकता डेटा को इस मानचित्र के साथ जोड़ा कि लोग स्वास्थ्य संबंधी जानकारी कहाँ खोज रहे हैं (जिसे "Baidu Index" कहा जाता है)।
उन्होंने एक भौगोलिक असमानता की खोज की:
- तटीय शहर: समृद्ध, पूर्वी तटीय प्रांतों (जैसे ग्वांगडोंग और झेजियांग) के लोग स्वास्थ्य संबंधी जानकारी बहुत अधिक खोजते हैं। क्योंकि वे बहुत अधिक खोज करते हैं, और क्योंकि AI सिस्टम गलतियाँ करते हैं, इसलिए ये क्षेत्र गलत सूचनाओं के प्रति सबसे अधिक संवेदनशील हैं।
- आंतरिक क्षेत्र: मध्य और पश्चिमी प्रांतों के लोग कम खोज करते हैं, इसलिए वे कम गलत उत्तरों के संपर्क में आते हैं क्योंकि वे कम सवाल पूछते हैं।
रूपक (Metaphor): एक धुंधली सड़क की कल्पना करें। सबसे अधिक गाड़ी चलाने वाले लोग (तटीय शहर) वे हैं जिनके दुर्घटनाग्रस्त होने की संभावना सबसे अधिक होती है क्योंकि वे सड़क पर अधिक समय बिताते हैं और छिपे हुए गड्ढे (गलत उत्तर) से टकरा सकते हैं। सिस्टम किसी एक जगह पर खराब नहीं हैं; वे हर जगह खराब हैं, लेकिन जो लोग सबसे अधिक उन पर निर्भर हैं, वे ही सबसे अधिक कष्ट सहते हैं।
6. मुख्य निष्कर्ष
यह शोध पत्र चेतावनी देता है कि हालांकि AI बहुत प्रभावशाली ढंग से बोलने में सक्षम है, यह एक विश्वसनीय भविष्यवक्ता (oracle) नहीं है।
- उपयोगकर्ताओं के लिए: जो पहला उत्तर आपको मिले उस पर भरोसा न करें, विशेष रूप से स्वास्थ्य या धन के मामले में। यदि कोई AI "हाँ" कहता है, तो उसकी दोबारा जाँच करें।
- दुनिया के लिए: हम एक ऐसी डिजिटल दुनिया बना रहे हैं जहाँ "सत्य" इस पर निर्भर करता है कि आप किस रोबोट से पूछ रहे हैं और आप कहाँ रहते हैं। हमें बेहतर उपकरणों की आवश्यकता है जो इस बारे में पारदर्शी हों कि वे क्या जानते हैं और वे किस चीज़ का अनुमान लगा रहे हैं।
संक्षेप में: AI एक सहायक है, लेकिन यह अभी भी एक छात्र है जिसने अभी तक स्नातक (graduation) नहीं किया है। यह स्मार्ट है, लेकिन यह गलतियाँ करता है, और इसकी गलतियाँ उन लोगों को प्रभावित करती हैं जिन्हें उत्तरों की सबसे अधिक आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।