← नवीनतम पेपर
🤖 machine learning

Early Detection of Misinformation for Infodemic Management: A Domain Adaptation Approach

यह शोध पत्र इन्फोडेमिक्स के दौरान गलत सूचनाओं का शीघ्र पता लगाने के लिए एक नवीन डोमेन अनुकूलन दृष्टिकोण प्रस्तावित करता है जो सैद्धांतिक और अनुभवजन्य रूप से मौजूदा अत्याधुनिक विधियों से बेहतर प्रदर्शन करने के लिए कोवेरिएट और कॉन्सेप्ट दोनों बदलावों को संबोधित करने की आवश्यकता को प्रदर्शित करता है।

मूल लेखक: Minjia Mao, Xiaohang Zhao, Xiao Fang

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minjia Mao, Xiaohang Zhao, Xiao Fang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "सूचना का सुनामी" (The Information Tsunami)

कल्पना कीजिए कि एक शहर में एक भीषण तूफान आता है। अचानक, हजारों लोग तूफान के बारे में खबरें चिल्लाने लगते हैं। कुछ लोग सच चिल्ला रहे हैं ("पुल टूट गया है!"), लेकिन कई लोग झूठ चिल्ला रहे हैं ("यह तूफान एक धोखा है!" या "जीवित रहने के लिए ब्लीच पिएं!")। सच और झूठ के इस मिश्रण के सैलाब को इन्फोडेमिक (infodemic) कहा जाता है।

यह शोध पत्र इस तूफान की बिल्कुल शुरुआत पर केंद्रित है। इस शुरुआती चरण में, कोई नहीं जानता कि कौन सच बोल रहा है और कौन झूठ। यहाँ तक कि विशेषज्ञ भी भ्रमित हैं क्योंकि स्थिति नई है। चूंकि अभी तक किसी ने जानकारी की पुष्टि नहीं की है, इसलिए सारी खबरें "अनलेबल" (unlabeled) हैं। यह बिना छँटाई किए गए मेल के ढेर जैसा है जहाँ आप नहीं जानते कि कौन सा पत्र बिल है और कौन सा कचरा।

पुराना तरीका: बिना शिक्षक के सीखने की कोशिश करना

आमतौर पर, कंप्यूटर "लेबल वाले" उदाहरणों (जहाँ एक इंसान ने पहले ही "सच" या "झंड" मार्क कर दिया हो) का अध्ययन करके फर्जी खबरों को पहचानना सीखते हैं। लेकिन एक शुरुआती इन्फोडेमिक में, आपके पास वे लेबल नहीं होते।

इसलिए, शोधकर्ताओं ने एक अलग तरकीब आजमाई: डोमेन अडैप्टेशन (Domain Adaptation)

  • उपमा: कल्पना कीजिए कि आप फर्जी खेल (sports) की खबरों को पहचानना सीखना चाहते हैं, लेकिन आपने कभी खेल देखा ही नहीं है। हालाँकि, आप फर्जी राजनीति (politics) की खबरों को पहचानने में विशेषज्ञ हैं। आप खेल की फर्जी खबरें पकड़ने के लिए अपनी राजनीति के ज्ञान का उपयोग करने की कोशिश करते हैं।
  • खामी: पुराने तरीकों ने ऐसा करने की कोशिश की, लेकिन वे विफल रहे। क्यों? क्योंकि राजनीति और खेल अलग हैं। इस्तेमाल किए जाने वाले शब्द अलग हैं, और झूठ रचने का तरीका भी अलग है।
    • कोवेरिएट शिफ्ट (शब्दों का अंतर - Covariate Shift): राजनीति में, झूठ गुस्से वाले या औपचारिक शब्दों का उपयोग कर सकता है। खेल में, झूठ स्लैंग (slang) का उपयोग कर सकता है। पुराने तरीकों ने इन शब्दों के अंतर को अनदेखा करने की कोशिश की, लेकिन वे पर्याप्त नहीं था।
    • कॉन्सेप्ट शिफ्ट (तर्क का अंतर - Concept Shift): यह वह बड़ी समस्या है जिसे यह पेपर ठीक करता है। राजनीति में, एक झूठ ऐसी हेडलाइन हो सकती है जो कहानी से मेल नहीं खाती। खेल में, एक झूठ भावनात्मक अतिशयोक्ति का एक विशिष्ट प्रकार हो सकता है। झूठ क्या है, इसके "नियम" विषय के आधार पर बदल जाते हैं। पुराने तरीकों ने इसे अनदेखा कर दिया; उन्होंने माना कि राजनीति का झूठ खेल के झूठ जैसा ही दिखेगा। ऐसा नहीं है।

नया समाधान: "रूप बदलने वाला जासूस" (DACA)

लेखकों ने DACA (डोमेन अडैप्टेशन विद कॉन्सेप्ट अलाइनमेंट) नामक एक नया तरीका बनाया है। इसे एक ऐसे जासूस के रूप में सोचें जो केवल तथ्यों को याद नहीं करता, बल्कि एक दुनिया के झूठ के तर्क (logic) को दूसरी दुनिया में अनुवाद करना सीखता है।

जासूस तीन विशेष उपकरणों (मॉड्यूल्स) का उपयोग करता है:

  1. अनुवादक (Covariate Alignment):

    • यह क्या करता है: यह डोमेन के बीच सतही अंतरों को अनदेखा करना सीखता है। यह समझ जाता है कि राजनीति में "गुस्से वाले शब्द" और खेल में "स्लैंग" दोनों ही झूठ के संकेत हो सकते हैं। यह विशिष्ट शब्दावली को हटा देता है ताकि कंप्यूटर समाचार की अंतर्निहित संरचना को देख सके।
    • उपमा: यह एक अनुवादक की तरह है जो इस बात पर ध्यान नहीं देता कि आप फ्रेंच बोल रहे हैं या स्पेनिश, बल्कि केवल वाक्य के अर्थ पर ध्यान केंद्रित करता है।
  2. लॉजिक मैचर (Concept Alignment) — पेपर का सबसे बड़ा नवाचार:

    • यह क्या करता है: यह असली 'सीक्रेट सॉस' है। पुराने तरीके अनुवाद पर ही रुक जाते थे। यह नया टूल समझता है कि झूठ की परिभाषा बदल जाती है। यह सोर्स डोमेन (जैसे, राजनीति) के एक समाचार और टारगेट डोमेन (जैसे, COVID) के एक समाचार के बीच "निकटतम मिलान" ढूंढता है।
    • यह कैसे काम करता है: यह पूछता है: "यदि यह राजनीतिक हेडलाइन एक झूठ है, तो COVID लेख में एक समान झूठ कैसा दिखेगा?" यह केवल शब्दों को नहीं, बल्कि झूठ के कॉन्सेप्ट्स को मिलाता है।
    • उपमा: कल्पना कीजिए कि आप एक बच्चे को "खराब सेब" पहचानना सिखा रहे हैं। आप उसे रसोई से एक कुचला हुआ सेब दिखाते हैं। फिर, आप उसे बगीचे से एक कुचला हुआ सेब दिखाते हैं। पुराना तरीका बस कहता, "देखो, दोनों लाल हैं।" नया तरीका कहता है, "देखो, दोनों में एक ही जगह पर चोट (bruise) का निशान है, भले ही एक चमकदार हो और दूसरा धुंधला।" यह केवल रंग को नहीं, बल्कि चोट को मिलाता है।
  3. शिक्षक (Classification Module):

    • यह क्या करता है: एक बार जब जासूस शब्दों का अनुवाद कर लेता है और तर्क को मिला लेता है, तो यह मॉड्यूल बस निर्णय लेता है: "सच" या "झूठ"।

परिणाम: खेल जीतना

शोधकर्ताओं ने वास्तविक डेटा (COVID-19 महामारी से) और राजनीति एवं मनोरंजन समाचारों (सोर्स डेटा) का उपयोग करके इस नए जासूस का पुराने तरीकों के साथ परीक्षण किया।

  • परिदृश्य: उन्होंने कंप्यूटर को राजनीति और मनोरंजन से लेबल की गई खबरें दीं, लेकिन COVID से कोई भी लेबल वाली खबर नहीं दी। उनसे COVID की फर्जी खबरें खोजने के लिए कहा गया।
  • परिणाम: नया तरीका (DACA) अन्य सभी तरीकों की तुलना में काफी बेहतर था।
    • इसने अधिक फर्जी खबरें पकड़ीं (उच्च "रिकॉल/Recall")।
    • इसने असली खबरों को फर्जी बताने में कम गलतियाँ कीं (उच्च "प्रिसिजन/Precision")।
    • इसने तब भी काम किया जब शुरुआत में COVID का जीरो लेबल वाला डेटा उपलब्ध था।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि "कॉन्सेप्ट शिफ्ट" (तर्क के अंतर) की समस्या को ठीक करके, यह विधि संकट के दौरान बहुत पहले ही गलत सूचनाओं को पहचान सकती है।

  • लाभ: यदि आप किसी झूठ को वायरल होने से पहले पकड़ सकते हैं, तो आप इसे फैलने से रोक सकते हैं।
  • सीमा: पेपर नोट करता है कि यह एक "कंटेंट-बेस्ड" (सामग्री आधारित) विधि है। यह लेख के टेक्स्ट को देखता है। यह अभी तक यह नहीं देखता है कि लेख कैसे फैलता है (किसने साझा किया, यह कितनी तेजी से वायरल हुआ), हालांकि लेखक सुझाव देते हैं कि यह भविष्य का अपग्रेड हो सकता है।

संक्षेप में: इस पेपर ने एक स्मार्ट AI बनाया है जो न केवल अलग-अलग विषयों (जैसे राजनीति से स्वास्थ्य) के बीच शब्दों का अनुवाद करता है, बल्कि झूठ रचने के तर्क को भी अनुवाद करना सीखता है, जिससे यह संकट के समय फर्जी खबरों को तब भी पहचान पाता है जब उसने उस विशिष्ट संकट का पहले से लेबल किया हुआ कोई उदाहरण नहीं देखा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →