Assessing Web Search Credibility and Response Groundedness in Chat Assistants
यह शोध पत्र प्रमुख चैट सहायकों की वेब खोज विश्वसनीयता और प्रतिक्रिया की आधारबद्धता (groundedness) का मूल्यांकन करने के लिए एक नवीन कार्यप्रणाली प्रस्तुत करता है, जो महत्वपूर्ण प्रदर्शन अंतरों को प्रकट करता है जहाँ Perplexity उच्चतम स्रोत विश्वसनीयता प्रदर्शित करता है जबकि GPT-4o संवेदनशील विषयों पर गैर-विश्वसनीय स्रोतों को उद्धृत करने की अधिक प्रवृत्ति दिखाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक स्मार्ट रोबोट असिस्टेंट से किसी विवादास्पद विषय पर सच्चाई जानने के लिए पूछते हैं, जैसे कि "क्या वास्तव में हंगरी के टैंक एक विशिष्ट तिथि पर यूक्रेन की सीमा में दाखिल हुए थे?"
अतीत में, ये रोबोट केवल उसी पर निर्भर थे जो उन्होंने स्कूल में सीखा था (उनका प्रशिक्षण डेटा)। लेकिन अब, उनके पास एक सुपरपावर है: वे इंटरनेट पर जा सकते हैं, लेख पढ़ सकते हैं और अपने स्रोतों का हवाला दे सकते हैं।
यह पेपर चार सबसे लोकप्रिय रोबोट असिस्टेंट्स (GPT-4o, GPT-5, Perplexity, और Qwen Chat) के लिए एक स्वास्थ्य निरीक्षण रिपोर्ट (health inspection report) की तरह है। शोधकर्ता यह देखना चाहते थे कि:
- क्या वे अच्छे पुस्तकालयों से पढ़ रहे हैं या संदिग्ध टैब्लॉइड्स से? (स्रोत विश्वसनीयता - Source Credibility)
- क्या वे वास्तव में जो पढ़ा है उसके आधार पर सच बोल रहे हैं, या वे बस मनगढ़ंत बातें बना रहे हैं? (आधारितता - Groundedness)
यहाँ सरल उपमाओं (analogies) का उपयोग करके उनके निष्कर्षों का विवरण दिया गया है:
1. सेटअप: "तथ्य-जांचकर्ता" बनाम "आस्तिक"
शोधकर्ताओं ने केवल रोबोट से यादृच्छिक (random) प्रश्न नहीं पूछे। उन्होंने यह देखने के लिए दो अलग-अलग भूमिकाएँ निभाईं कि रोबोट कैसे प्रतिक्रिया देते हैं:
- तथ्य-जांचकर्ता (The Fact-Checker): "हे रोबोट, क्या यह अफवाह सच है? इसे साबित करो।" (संदेहपूर्ण लहजा)
- आस्तिक (The Believer): "हे रोबोट, मैंने सुना है कि यह सच है! क्या तुम मुझे इसका समर्थन करने के लिए और विवरण ढूंढ सकते हो?" (पुष्टि करने वाला लहजा)
रूपक (Metaphor): एक लाइब्रेरियन से किताब माँगने की कल्पना करें।
- यदि आप पूछते हैं, "क्या यह किताब झूठ है?" तो लाइब्रेरियन अभिलेखागार (archives) की सावधानीपूर्वक जांच कर सकता है।
- यदि आप कहते हैं, "मुझे यह किताब बहुत पसंद है, मुझे इसके जैसी और किताबें ढूंढ कर दो!" तो लाइब्रेरियन ऐसी कोई भी चीज़ उठा सकता है जो सुनने में समान लगे, भले ही वह एक नकली किताब हो।
अध्ययन में पाया गया कि जब उपयोगकर्ता "आस्तिक" की तरह व्यवहार करते हैं, तो रोबोट अविश्वसनीय स्रोतों को चुनने की अधिक संभावना रखते हैं, खासकर यदि रोबोट थोड़ा "भोला" हो।
2. प्रतियोगी: सबसे अच्छा लाइब्रेरियन कौन है?
शोधकर्ताओं ने चार असिस्टेंट्स का परीक्षण किया। यहाँ उनका प्रदर्शन दिया गया है:
Perplexity (सावधान क्यूरेटर - The Careful Curator):
- प्रदर्शन: स्पष्ट विजेता।
- उपमा: Perplexity एक सख्त लाइब्रेरियन की तरह है जो केवल "सत्यापित इतिहास" अनुभाग से ही किताबें निकालता है। यदि कोई किताब थोड़ी भी संदिग्ध दिखती है, तो वे उसे शेल्फ पर ही छोड़ देते हैं। वे शायद ही कभी फर्जी खबरें उद्धृत करते हैं और लगभग हमेशा उच्च गुणवत्ता वाले स्रोतों का हवाला देते हैं।
- परिणाम: उच्चतम विश्वसनीयता, झूठ फैलाने का सबसे कम जोखिम।
GPT-4o और GPT-5 (व्यापक खोजकर्ता - The Broad Searchers):
- प्रदर्शन: अच्छा, लेकिन कभी-कभी अव्यवस्थित।
- उपमा: ये उन लाइब्रेरियन की तरह हैं जो आपको आपके विषय से संबंधित सब कुछ देना चाहते हैं। वे किताबों की एक विशाल श्रृंखला से जानकारी निकालते हैं, जिसमें "साजिश के कोने" (Conspiracy Corner) या "सनसनीखेज टैब्लॉइड्स" भी शामिल हैं। वे बहुत सारी जानकारी खोजने में माहिर हैं, लेकिन कभी-कभी वे गलती से एक नकली किताब उठा लेते हैं और उसे तथ्य के रूप में प्रस्तुत करते हैं।
- परिणाम: वे अक्सर अविश्वसनीय स्रोतों का हवाला देते हैं, विशेष रूप से रूस-यूक्रेन युद्ध जैसे संवेदनशील विषयों पर।
Qwen Chat (असंगत पाठक - The Inconsistent Reader):
- प्रदर्शन: मिला-जुला।
- उपमा: Qwen उस छात्र की तरह है जो आमतौर पर अच्छे पाठ्यपुस्तकों से पढ़ता है लेकिन कभी-कभी किसी रैंडम ब्लॉग पोस्ट से विचलित हो जाता है। जब वे किसी खराब स्रोत को चुनते हैं, तो वे उस पर बहुत अधिक निर्भर होते हैं, जिससे उनका पूरा उत्तर अस्थिर हो जाता है।
- परिणाम: उन्हें स्थानीय समाचारों के साथ सबसे अधिक समस्या हुई और कभी-कभी उन्होंने ऐसे स्रोतों का हवाला दिया जिन्हें गुणवत्ता के लिए किसी ने भी रेट नहीं किया था।
3. बड़ी खोज: "आधारित" (Grounded) होने का मतलब "सत्य" होना नहीं है
यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है।
शोधकर्ताओं ने पाया कि सभी रोबोट "Groundedness" (आधारितता) में बहुत अच्छे थे।
- Groundedness: इसका अर्थ है कि रोबोट का उत्तर वास्तव में उसके द्वारा दिए गए लिंक द्वारा समर्थित है। उसने केवल मनगढ़ंत बातें नहीं कीं; उसने स्रोत को पढ़ा और जो उसमें कहा गया था उसे दोहराया।
जाल (The Trap):
कल्पना कीजिए कि एक रोबोट कहता है: "इस लेख के अनुसार आकाश हरा है।"
- क्या यह Grounded है? हाँ, क्योंकि लेख में वास्तव में ऐसा ही कहा गया था।
- क्या यह सच है? नहीं, क्योंकि लेख ही झूठ है।
निष्कर्ष:
कई रोब들이 (विशेष रूप से GPT-4o) स्रोत खोजने और उन पर टिके रहने में उत्कृष्ट थे, लेकिन स्रोत स्वयं कभी-कभी झूठ थे।
- Perplexity इस जाल से बच गया क्योंकि उसने केवल भरोसेमंद स्रोत चुने।
- GPT-4o अक्सर प्रचार (propaganda) को पकड़ लेता था (विशेष रूप से यूक्रेन युद्ध के संबंध में) और पूरी निष्ठा से उसे दोहराता था, जिससे वह झूठ बहुत विश्वसनीय लगने लगता था क्योंकि उसके पास एक "उद्धरण" (citation) था।
4. "सोचने" (Thinking) मोड का बोनस
पेपर में GPT-5 के "Thinking Mode" (जहाँ रोबोट उत्तर देने से पहले तर्क करने के लिए रुकता है) को भी देखा गया।
- उपमा: यह उस छात्र की तरह है जो उत्तर लिखने से पहले अपने गणित को दोबारा चेक करने के लिए रुकता है।
- परिणाम: जब GPT-5 ने इस मोड का उपयोग किया, तो वह खराब स्रोतों को अनदेखा करने और सत्य खोजने में बहुत बेहतर हो गया। वह Perplexity की तरह व्यवहार करने लगा।
आपके लिए सीख (The Takeaway for You)
यदि आप तथ्यों की जाँच के लिए चैटबॉट्स का उपयोग करते हैं:
- केवल इसलिए उद्धरण (citation) पर भरोसा न करें क्योंकि वह मौजूद है। एक रोबोट एक असली वेबसाइट की तरह ही आसानी से एक फर्जी न्यूज़ साइट का हवाला दे सकता है।
- Perplexity वर्तमान में विश्वसनीय जानकारी खोजने के लिए सबसे सुरक्षित विकल्प प्रतीत होता है।
- "आस्तिक" प्रश्नों के प्रति सावधान रहें। यदि आप किसी रोबोट से किसी अफवाह की "पुष्टि" करने के लिए कहते हैं, तो वह आपकी मदद करने की बहुत कोशिश कर सकता है और अंततः गलत सूचना फैला सकता है।
- संवेदनशील विषय खतरनाक हैं। युद्ध और राजनीति जैसे विषय "जहरीली" वेबसाइटों से भरे होते हैं जो AI को धोखा देने के लिए बनाई गई हैं। रोबोट अभी तक पूर्ण फिल्टर नहीं हैं।
संक्षेप में: ये रोबोट सच्चाई खोजने में बेहतर हो रहे हैं, लेकिन वे अभी भी कभी-कभी गलत किताबों से पढ़ रहे हैं। हमें उन्हें यह सिखाना जारी रखना होगा कि एक पुस्तकालय और एक अफवाह फैलाने वाली जगह के बीच अंतर कैसे किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।