← नवीनतम पेपर
💬 NLP

What Does 99% Accuracy Measure? A Reproducible Audit of Shortcut Learning in a Widely Used Fake News Corpus

यह शोध पत्र यह प्रदर्शित करता है कि ISOT/Kaggle फेक न्यूज कॉर्पस पर व्यापक रूप से उद्धृत 99% सटीकता, वास्तविक सत्यता का पता लगाने के बजाय मेटाडेटा और स्रोत पूर्वाग्रहों से प्राप्त शॉर्टकट लर्निंग के कारण उत्पन्न एक भ्रम है, क्योंकि मॉडल विषय-विहीन परिदृश्यों या LIAR जैसे स्वतंत्र बेंचमार्क पर सामान्यीकरण करने में विफल रहते हैं।

मूल लेखक: Yuvraj Verma

प्रकाशित 2026-09-23✓ Author reviewed ⓘ
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuvraj Verma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल युग में, झूठी कहानियों के फैलने की गति अक्सर सच्चाई से अधिक होती है, जिससे समाचार लेखों में झूठ को पकड़ पाने वाले कंप्यूटर प्रोग्राम बनाने की एक दौड़ शुरू हो गई है। वैज्ञानिकों ने लंबे समय से यह आशा की है कि इन प्रोग्रामों को वास्तविक और फर्जी समाचारों के हजारों उदाहरण खिलाकर, मशीनें अंतर को समझना सीख लेंगी, और अंततः दुष्प्रचार के विरुद्ध विश्वसनीय रक्षक बन जाएंगी। प्रचलित धारणा यह रही है कि यदि कोई कंप्यूटर प्रोग्राम एक परीक्षण में लगभग पूर्ण सटीकता के साथ फर्जी समाचारों की सही पहचान कर सकता है, तो उसने धोखे के सूक्ष्म संकेतों को समझ लिया है। हालाँकि, यह विश्वास एक नाजुक धारणा पर टिका है: कि कंप्यूटर सच्चाई का निर्णय लेने के लिए कहानी को वास्तव में पढ़ रहा है, न कि केवल इस बात पर ध्यान दे रहा है कि कहानी कैसे प्रकाशित की गई थी।

एक हालिया जांच इस धारणा को चुनौती देती है, जो समाचार लेखों के एक व्यापक रूप से उपयोग किए जाने वाले संग्रह की जांच करती है जिसने अनगिनत पहचान प्रणालियों के लिए प्रशिक्षण आधार के रूप में कार्य किया है। शोधकर्ताओं ने मानक परीक्षण पद्धति को बुद्धिमत्ता के माप के रूप में नहीं, बल्कि एक मापने वाले यंत्र के रूप में इस्तेमाल किया ताकि यह देखा जा सके कि कंप्यूटर वास्तव में क्या देख रहा था। उन्होंने पाया कि इन प्रणालियों द्वारा रिपोर्ट किए गए उच्च स्कोर तथ्यों को सत्यापित करने की क्षमता को नहीं दर्शाते हैं। इसके बजाय, प्रोग्राम एक छिपे हुए शॉर्टकट का फायदा उठा रहे हैं: वे कहानी की सामग्री के बजाय प्रकाशन की विशिष्ट शैली और स्रोत को पहचानना सीख रहे हैं। अध्ययन से पता चलता है कि इन प्रानों को परखने वाला बेंचमार्क मौलिक रूप से त्रुटिपूर्ण है, जो मशीनों को दावे की सच्चाई के बजाय प्रकाशक की पहचान को पहचानने के लिए पुरस्कृत करता है।

शोधकर्ताओं ने चालीस हजार से अधिक समाचार लेखों वाले एक विशाल डेटासेट का विश्लेषण करके शुरुआत की, जो वास्तविक और फर्जी लेबल वाले लेखों के बीच समान रूप से विभाजित था। यह संग्रह वर्षों से फर्जी समाचार डिटेक्टरों को प्रशिक्षित करने और परीक्षण करने के लिए मानक रहा है, जिसमें अधिकांश प्रणालियाँ नब्बे प्रतिशत से अधिक सटीकता दर रिपोर्ट करती हैं। इन नंबरों का वास्तविक अर्थ समझने के लिए, टीम ने सामान्य जटिलता को हटा दिया और डेटा का ऑडिट करने के लिए एक सरल, पारदर्शी विधि का उपयोग किया। उन्होंने कंप्यूटर मॉडल को एक प्रोब (जांच उपकरण) के रूप में माना, और व्यवस्थित रूप से सूचना के विभिन्न हिस्सों को हटाकर यह देखा कि कौन से हिस्से सफलता को संचालित कर रहे थे।

पहला और सबसे चौंकाने वाला निष्कर्ष यह था कि कंप्यूटर को एक पूर्ण स्कोर प्राप्त करने के लिए समाचार लेखों को पढ़ने की बिल्कुल भी आवश्यकता नहीं थी। डेटासेट में "विषय" (subject) नामक एक क्षेत्र शामिल था, जिसमें लेख का विषय सूचीबद्ध था, जैसे कि "राजनीति" या "विश्व समाचार"। शोधकर्ताओं ने पाया कि वास्तविक लेख लगभग विशेष रूप से विषयों के एक सेट के साथ टैग किए गए थे, जबकि फर्जी लेख पूरी तरह से अलग सेट के साथ टैग किए गए थे। इनमें कोई ओवरलैप नहीं था। जब उन्होंने केवल इन विषय टैगों को देखने और टेक्स्ट को पूरी तरह से अनदेखा करने वाला एक मॉडल बनाया, तो इसने एक पूर्ण स्कोर प्राप्त किया। इसने सिद्ध किया कि बेंचमार्क आंशिक रूप से टूटा हुआ था; लेबल मेटाडेटा के साथ इतने मजबूती से जुड़े हुए थे कि एक मशीन समाचार कहानी का एक भी शब्द समझे बिना समस्या को हल कर सकती थी।

इन स्पष्ट शॉर्टकटों को हटाने के बाद भी, परिणाम संदिग्ध रूप से उच्च बने रहे। शोधकर्ताओं ने अन्य सूक्ष्म संकेतों को भी हटाया, जैसे कि समाचार एजेंसियों के नाम जो लगभग सभी वास्तविक लेखों में दिखाई देते थे लेकिन फर्जी लेखों में लगभग नहीं थे, और उन्होंने लेखों की डुप्लिकेट प्रतियों को भी हटा दिया जो गलती से प्रशिक्षण और परीक्षण दोनों सेटों में दिखाई दे रहे थे। इन परिवर्तनों ने कंप्यूटर के स्कोर को कम कर दिया, लेकिन बहुत मामूली रूप से, जिससे यह लगभग पूर्ण स्तर से गिरकर अभी भी बहुत उच्च स्तर पर आ गया। इससे पता चला कि कंप्यूटर केवल एक या दो स्पष्ट ट्रिक्स पर निर्भर नहीं था, बल्कि उसने एक व्यापक, अधिक विस्तृत पैटर्न सीख लिया था।

आगे की जांच से पता चला कि यह पैटर्न कहानी के तथ्यों के बारे में नहीं था, बल्कि लेखन की शैली के बारे में था। वास्तविक लेख पेशेवर समाचार वायरों से आते थे और एक सख्त, औपचारिक प्रारूप का पालन करते थे, जबकि फर्जी लेख विभिन्न वेबसाइटों से आते थे और अलग-अलग परंपराओं का उपयोग करते थे, जैसे कि वीडियो या छवियों के बारे में विशिष्ट वाक्यांश। कंप्यूटर ने दावों की सत्यता के बजाय इन दो "आवाजों" के बीच अंतर करना सीख लिया। इसका परीक्षण करने के लिए, शोधकर्ताओं ने उन सबसे आम शब्दों को हटाने का प्रयास किया जिनका कंप्यूटर अपने निर्णयों के लिए उपयोग करता था। शीर्ष एक हजार सबसे महत्वपूर्ण शब्दों को हटाने के बाद भी, कंप्यूटर की अंतर करने की क्षमता में बहुत कम बदलाव आया। संकेत लेखन की पूरी शैली में फैला हुआ था, जिससे कुछ बुरे शब्दों को हटाकर इसे ठीक करना असंभव हो गया।

यह वास्तविक परीक्षण कि क्या कंप्यूटर ने कुछ उपयोगी सीखा है, तब आया जब शोधकर्ताओं ने खेल के नियम बदल दिए। उन्होंने कंप्यूटर को पूरी तरह से अलग विषयों और स्रोतों के समाचार लेखों को वर्गीकृत करने के लिए कहा, जिन्हें उसने पहले कभी नहीं देखा था। इस नए वातावरण में, कंप्यूटर का प्रदर्शन ढह गया। स्कोर जो लगभग पूर्ण थे, वे रैंडम गेसिंग (यादृच्छिक अनुमान) के स्तर तक गिर गए। कंप्यूटर ने फर्जी समाचारों को पहचानना नहीं सीखा था; उसने प्रकाशकों के एक विशिष्ट समूह को पहचानना सीख लिया था। जब वे प्रकाशक चले गए, तो कंप्यूटर खो गया।

यह विफलता तब और भी अधिक स्पष्ट हो गई जब शोधकर्ताओं ने मानव भाषा को गहराई से समझने के लिए डिज़ाइन किए गए एक अधिक उन्नत, शक्तिशाली कंप्यूटर मॉडल का उपयोग किया। हालांकि इस परिष्कृत मॉडल ने मूल परीक्षण पर थोड़ा बेहतर प्रदर्शन किया, लेकिन नए, अलग विषयों का सामना करने पर यह और भी बुरी तरह विफल रहा। यह मूल प्रकाशकों की विशिष्ट शैली को पहचानने में इतना अच्छा हो गया था कि वह बदलाव आने पर अनुकूलित नहीं हो सका। अध्ययन ने दिखाया कि अधिक कंप्यूटिंग शक्ति जोड़ने से मशीन को सच सीखने में मदद नहीं मिली; इसने केवल शॉर्टकट को अधिक कुशलता से याद करने में मदद की।

शोधकर्ताओं ने निष्कर्ष निकाला कि पिछले अध्ययनों में रिपोर्ट किए गए उच्च सटीकता स्कोर भ्रामक थे। वे झूठ पकड़ने की क्षमता को नहीं, बल्कि प्रकाशकों के एक समूह को दूसरे से अलग करने की क्षमता को माप रहे थे। कंप्यूटर मॉडल स्मार्ट नहीं हो रहे थे; वे डेटा में मौजूद खामियों का फायदा उठाने में बेहतर हो रहे थे। यह अध्ययन इस क्षेत्र में काम करने वाले किसी भी व्यक्ति के लिए एक स्पष्ट मार्ग प्रदान करता है: फर्जी समाचारों का पता लगाने वाले सिस्टम पर भरोसा करने से पहले, आपको यह जांचना होगा कि क्या यह केवल मेटाडेटा या स्रोत को पढ़ रहा है, न कि कहानी को। इस जांच को करने के उपकरण सरल और सस्ते हैं, जिनमें केवल कुछ मिनट का कंप्यूटर समय लगता है, फिर भी यह सुनिश्चित करने के लिए आवश्यक हैं कि हम जिस तकनीक का निर्माण कर रहे हैं वह वास्तव में उस समस्या को हल कर रही है जिसे संबोधित करने के लिए उसे बनाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →