← नवीनतम पेपर
💻 computer science

AVTF-Net: Attention-Guided Visual–Textual Fusion with AlexNet and BERT for Multimodal Fake News Detection

यह शोध पत्र AVTF-Net का प्रस्ताव करता है, जो एक मल्टीमॉडल डीप लर्निंग फ्रेमवर्क है जो क्रॉस-मोडल विसंगतियों को पकड़ने के लिए एक संशोधित एलेक्सनेट (AlexNet) और फाइन-ट्यून्ड बर्ट (BERT) को अर्ली फ्यूजन और अटेंशन मैकेनिज्म के साथ एकीकृत करता है, जिससे Fakeddit डेटासेट पर 95.80% सटीकता के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Asad Ur Rehman

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Asad Ur Rehman

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे बाजार की तरह है जहाँ लोग लगातार खबरें चिल्लाकर सुना रहे हैं। कभी-कभी ये कहानियाँ सच होती हैं, लेकिन अक्सर, बुरे इरादे वाले लोग एक झूठ को एक ऐसी तस्वीर के साथ जोड़कर भीड़ को धोखा देने की कोशिश करते हैं जो असली दिखती है। यह वैसा ही है जैसे कोई जलती हुई इमारत की फोटो दिखाते हुए चिल्ला रहा हो, "देखो! शहर में आग लग गई है!" जबकि वह इमारत वास्तव में ठीक है।

यह शोध पत्र एक नए "जासूस" AVTF-Net को पेश करता है जिसे इन चालों को पकड़ने के लिए बनाया गया है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: एक जासूस काफी नहीं है

अधिकांश पुराने जमाने के फैक्ट-चेकर्स (तथ्य-जांचकर्ता) उन जासूसों की तरह हैं जो या तो केवल समाचार लेख (टेक्स्ट) पढ़ते हैं या केवल तस्वीरों (इमेज) को देखते हैं।

  • यदि वे केवल टेक्स्ट पढ़ते हैं, तो वे यह पहचानने में चूक सकते हैं कि फोटो नकली है।
  • यदि वे केवल फोटो देखते हैं, तो वे यह समझने में चूक सकते हैं कि कैप्शन झूठ बोल रहा है।
  • अंतराल (The Gap): फर्जी खबरें अक्सर दोनों के बीच के बेमेल (mismatch) पर निर्भर करती हैं। एक असली फोटो के साथ फर्जी कैप्शन, या एक फर्जी फोटो के साथ विश्वसनीय कहानी।

समाधान: दो विशेषज्ञों की जासूसी टीम

लेखकों ने एक ऐसा सिस्टम बनाया है जो अलग-अलग काम करने के बजाय, मिलकर काम करने वाले दो विशिष्ट विशेषज्ञों का उपयोग करता है।

  1. इमेज एक्सपर्ट (संशोधित AlexNet): इसे एक अनुभवी कला समीक्षक (art critic) के रूप में सोचें। यह तस्वीरों को देखता है और पैटर्न, किनारों और बनावट (textures) को पहचानना सीखता है। इसे बहुत अच्छी तरह से इस तरह ट्यून किया गया है कि यह एक जटिल छवि को उसके द्वारा देखी गई चीजों के एक सरल "सारांश" में बदल सके।
  2. टेक्स्ट एक्सपर्ट (BERT): इसे एक शानदार भाषाविद् (linguist) के रूप में समझें। यह हेडलाइंस और पोस्ट को पढ़ता है, न केवल शब्दों को, बल्कि उनके पीछे के संदर्भ (context) और भाव (feeling) को भी समझता है। यह जानता है कि एक मजाक और एक गंभीर दावे के बीच क्या अंतर है।

गुप्त मंत्र: "अर्ली फ्यूजन" (Early Fusion) रणनीति

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। कई पुराने सिस्टम में, इमेज एक्सपर्ट और टेक्स्ट एक्सपर्ट अकेले काम करते हैं, अपने स्वयं के अनुमान लगाते हैं, और फिर बॉस अंत में उनके जवाबों को जोड़ता है (जैसे दो लोग अलग-अलग वोट करते हैं)।

AVTF-Net कुछ अलग करता है: यह दोनों विशेषज्ञों को तुरंत एक ही मेज पर बैठने के लिए मजबूर करता है।

  • उपमा (Analogy): कल्पना करें कि इमेज एक्सपर्ट और टेक्स्ट एक्सपर्ट दो जासूस हैं। अलग-अलग रिपोर्ट लिखने और जज को सौंपने के बजाय, उन्हें जांच के दौरान ही एक-दूसरे से बात करने के लिए मजबूर किया जाता है।
  • वे शुरुआत में ही अपने नोट्स को एक एकल, विशाल "केस फाइल" में मिला देते हैं।
  • फिर, एक विशेष अटेंशन मॉड्यूल (Attention Module) एक स्पॉटलाइट की तरह काम करता है। यह संयुक्त केस फाइल को स्कैन करता है और कहता है, "हे, यहाँ देखो! टेक्स्ट 'शांतिपूर्ण विरोध' कह रहा है, लेकिन फोटो में दंगा दिख रहा है। यह बेमेल होना संदिग्ध है!" यह विरोधाभासों को उजागर करता है और उबाऊ, मेल खाने वाले हिस्सों को अनदेखा कर देता है।

प्रशिक्षण का मैदान (The Training Ground)

टीम ने इस जासूस को Fakeddit नामक एक विशाल डेटासेट पर प्रशिक्षित किया। यह रेडिट (Reddit) पोस्ट की एक विशाल लाइब्रेरी की तरह है, जहाँ प्रत्येक पोस्ट में एक तस्वीर और एक कहानी होती है, और किसी ने पहले ही उन्हें "सच", "फर्जी", "व्यंग्य (Satire)", या "मिश्रित (Mixed)" के रूप में लेबल कर दिया है।

परिणाम: जासूस कितना अच्छा है?

जब उन्होंने AVTF-Net का अन्य तरीकों के विरुद्ध परीक्षण किया:

  • सटीकता (Accuracy): इसने 95.8% बार सही उत्तर दिया।
  • तुलना:
    • केवल टेक्स्ट वाले जासूसों ने लगभग 89% सही बताया।
    • केवल इमेज वाले जासूसों ने लगभग 81% सही बताया।
    • यहाँ तक कि एक "वोटिंग" सिस्टम (जहाँ दो अलग-अलग मॉडल अनुमान लगाते हैं और फिर वोट करते हैं) भी 93.7% सही था।
  • विजेता: दोनों विशेषज्ञों को जल्दी मिलाने और उन्हें एक-दूसरे से बात करने देने से, AVTF-Net उन सूक्ष्म झूठों को पकड़ने में सर्वश्रेष्ठ बन गया जो दूसरों को चकमा देते हैं।

यह क्यों महत्वपूर्ण है (शोध पत्र के अनुसार)

शोध पत्र का दावा है कि यह सिस्टम बेहतर है क्योंकि यह केवल टेक्स्ट या इमेज को नहीं देखता है; यह देखता है कि वे एक साथ कैसे फिट होते हैं। यह यह समझने जैसा है कि धूप वाले समुद्र तट की तस्वीर बर्फबारी की कहानी से मेल नहीं खाती।

लेखक कहते हैं कि यह मॉडल इनके लिए तैयार है:

  • कंटेंट वेरिफिकेशन: यह जांचना कि कोई कहानी वास्तविक है या नहीं।
  • मिसइन्फॉर्मेशन मॉनिटरिंग: ऑनलाइन फैलने वाले झूठों पर नज़र रखना।
  • ऑटोमेटेड मॉडरेशन: सोशल मीडिया साइटों को संदिग्ध पोस्ट को स्वचालित रूप से फ्लैग करने में मदद करना।

संक्षेप में, AVTF-Net यह सुनिश्चित करके तथ्य-जांच करने का एक स्मार्ट तरीका है कि किसी खबर के फर्जी होने का निर्णय लेने से पहले तस्वीर और कहानी एक-दूसरे से सहमत हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →