← नवीनतम पेपर
💻 computer science

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

यह अध्ययन वेब गेटकीपिंग में एक बढ़ते असंतुलन को प्रकट करता है जहाँ प्रतिष्ठित समाचार साइटें robots.txt और सक्रिय उपायों के माध्यम से एआई (AI) क्रॉलर्स को तेजी से ब्लॉक कर रही हैं, जबकि दुष्प्रचार साइटें काफी हद तक खुली बनी हुई हैं, जो संभावित रूप से लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए उपलब्ध प्रशिक्षण डेटा को विकृत कर सकती हैं।

मूल लेखक: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

प्रकाशित 2026-08-13
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरी लाइब्रेरी है जहाँ हर किताब, लेख और ब्लॉग पोस्ट सूचना का एक टुकड़ा है जिसे पढ़ा जाना बाकी है। वर्षों से, "रोबोट्स" (विशेष कंप्यूटर प्रोग्राम) इस डिजिटल दुनिया के पुस्तकालयाध्यक्ष (लाइब्रेरियन) रहे हैं, जो किताबों की नकल करने के लिए चुपचाप गलियारों में घूमते रहते हैं ताकि सर्च इंजन हमें उन्हें खोजने में मदद कर सकें। लेकिन हाल ही में, एक नए प्रकार का लाइब्रेरियन आया है: आर्टिफिशियल इंटेलिजेंस (AI) रोबोट। ये केवल एक किताब नहीं ढूँढ रहे हैं; ये सब कुछ एक साथ पढ़ने की कोशिश कर रहे हैं ताकि यह सीख सकें कि कैसे लिखा जाए, सवालों के जवाब दिए जाएं और हमसे बातचीत की जाए। इसे प्रबंधित करने के लिए, वेबसाइट मालिकों के पास एक सरल, स्वैच्छिक संकेत है जिसे वे अपने दरवाजे पर robots.txt के रूप में लगा सकते हैं। इसे "प्रवेश निषेध" या "कृपया अंदर आएं" के संकेत की तरह समझें जो इन डिजिटल लाइब्रेरियनों के लिए है। यदि कोई वेबसाइट मालिक इस संकेत पर लिखता है "AI की अनुमति नहीं है", तो विनम्र AI रोबोट को सुनने और दूर रहने की उम्मीद की जाती है। लेकिन बड़ा सवाल यह है कि क्या सभी वेबसाइटें ये संकेत लगाती हैं? और यदि वे ऐसा करती हैं, तो क्या वे इन्हें समान कारणों से लगाती हैं? जैसे-जैसे AI अधिक स्मार्ट और शक्तिशाली होता जा रहा है, यह समझना महत्वपूर्ण हो जाता है कि कौन उनके दरवाजे खोल रहा है और कौन उन्हें बंद कर रहा है, क्योंकि यही तय करता है कि AI किस तरह की जानकारी से सीखता है।

यह शोध पत्र, जिसका शीर्षक "Is Misinformation More Open?" है, एक डिजिटल जासूसी कहानी की तरह कार्य करता है, जो यह जांच करता है कि दो बहुत अलग समूह की वेबसाइटें इन "प्रवेश निषेध" संकेतों के साथ कैसे व्यवहार करती हैं। शोधकर्ताओं ने दो समूहों को देखा: "प्रतिष्ठित" समाचार साइटें (गंभीर, तथ्य-जांच करने वाले पत्रकार) और "गलत सूचना" (misinformation) वाली साइटें (वे स्थान जो झूठी या भ्रामक कहानियाँ फैला रहे हैं)। वे यह देखना चाहते थे कि क्या गंभीर समाचार संगठन AI रोबोटों को दूर रहने के लिए कहने में गलत समाचार साइटों की तुलना में बेहतर थे।

निष्कर्ष एक आश्चर्यजनक और स्पष्ट अंतर प्रकट करते हैं। शोधकर्ताओं ने पाया कि प्रतिष्ठित समाचार वेबसाइटें AI रोबोटों के लिए "प्रवेश निषेध" का संकेत लगाने में बहुत अधिक सक्षम हैं। वास्तव में, इन भरोसेमंद साइटों में से 60.0% ने स्पष्ट रूप से अपनी robots.txt फाइलों में कम से कम एक AI क्रॉलर को बाहर रहने के लिए कहा। इसके बिल्कुल विपरीत, केवल 9.1% गलत सूचना वाली साइटों ने ऐसा किया। यह ऐसा है जैसे गंभीर पुस्तकालय नए AI छात्रों के लिए अपने दरवाजे बंद कर रहे हैं, जबकि फर्जी समाचार प्रचारक अपने दरवाजे पूरी तरह खुले छोड़ रहे हैं। औसतन, एक प्रतिष्ठित समाचार साइट ने 15.5 अलग-अलग AI रोबोटों को सूचीबद्ध किया जिन्हें वह अपने पास नहीं चाहती थी, जबकि गलत सूचना वाली साइटों ने एक से भी कम सूचीबद्ध किया।

अध्ययन ने यह भी देखा कि क्या इन वेबसाइटों ने वास्तव में अपने संकेतों को लागू किया या केवल उन्हें लिख दिया। उन्होंने पाया कि प्रतिष्ठित समाचार वेबसाइटों ने न केवल नियम लिखे बल्कि उन AI रोबोटों को सक्रिय रूप से रोका भी जो चुपके से घुसने की कोशिश कर रहे थे, जिससे उनके लिखित नियमों और उनके कार्यों के बीच तालमेल बना रहा। गलत सूचना वाली साइटें कम सुसंगत थीं; हालांकि कुछ ने उन्हें ब्लॉक किया, लेकिन कई ने उन्हें लिखना भी जरूरी नहीं समझा। शोधकर्ताओं ने समय के साथ बदलावों को भी देखा, सितंबर 2023 से मई 2025 तक के स्नैपशॉट देखे। उन्होंने देखा कि प्रतिष्ठित समाचार वेबसाइटें तेजी से अपने दरवाजे बंद करना सीख रही थीं, जिसमें AI को रोकने वाली साइटों की संख्या केवल कुछ वर्षों में 23% से बढ़कर लगभग 60% हो गई। दूसरी ओर, गलत सूचना वाली साइटें काफी हद तक निष्क्रिय बनी रहीं, और उन्होंने शायद ही कभी अपने संकेतों को अपडेट किया।

लेखकों का सुझाव है कि यह बढ़ता हुआ अंतर एक अजीब स्थिति पैदा करता है: जैसे-जैसे "अच्छे" स्रोत अपनी सामग्री की रक्षा के लिए अपने दरवाजे बंद करना शुरू करते हैं, AI रोबोटों को उन "बुरे" स्रोतों को पढ़ने में अधिक समय बिताना पड़ सकता है जो अभी भी खुले हैं। इसका मतलब यह हो सकता है कि AI सटीक समाचारों के बजाय गलत सूचनाओं से अधिक सीखता है, केवल इसलिए क्योंकि गलत सूचना वाली साइटों तक पहुँचना आसान है। यह शोध यह दावा नहीं करता है कि इसने पहले ही AI को बर्बाद कर दिया है, लेकिन यह एक वास्तविक जोखिम की ओर इशारा करता है: यदि हम इस बात पर ध्यान नहीं देते कि कौन अपने दरवाजे खोल रहा है, तो AI का भविष्य झूठ की नींव पर खड़ा हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →