← नवीनतम पेपर
💬 NLP

Hybrid Feature Combinations with CNN for Bangla Fake News Classification

यह शोध प्रदर्शित करता है कि BanFakeNews-2.0 डेटासेट पर बंगाली फर्जी समाचारों का पता लगाने के लिए केवल व्यक्तिगत विशेषताओं का उपयोग करने की तुलना में, सिमेंटिक (semantic), सांख्यिकीय (statistical) और कैरेक्टर-लेवल (character-level) विशेषताओं को संयोजित करना एक कन्वेल्शनल न्यूरल नेटवर्क (CNN) मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Md Gulzar Hussain, Babe Sultana, Md Rinku Ali

प्रकाशित 2026-05-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Md Gulzar Hussain, Babe Sultana, Md Rinku Ali

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट बांग्लादेश में एक विशाल, हलचल भरे बाजार की तरह है जहाँ लोग अपनी दैनिक खबरें प्राप्त करने के लिए जाते हैं। जबकि अधिकांश स्टॉल ताज़ा, ईमानदार जानकारी बेचते हैं, कुछ "फेक न्यूज" (झूठी खबरें) बेच रहे हैं—ऐसी अफवाहें और झूठ जो समुदाय के लिए वास्तविक समस्या पैदा कर सकते हैं। इस शोध पत्र के लेखक एक जासूसों की टीम की तरह हैं जो एक सुपर-स्मार्ट सुरक्षा गार्ड (एक कंप्यूटर प्रोग्राम) बनाने की कोशिश कर रहे हैं ताकि वे कहानियाँ फैलाने से पहले इन झूठ बोलने वालों को पहचान सकें।

यहाँ एक सरल विवरण दिया गया है कि उन्होंने अपने गार्ड को कैसे बनाया और उन्होंने क्या खोजा:

समस्या: बहुत सारे सुराग, लेकिन सही नहीं

शोधकर्ताओं ने समाचार लेखों के एक विशाल ढेर (लगभग 61,000 लेख) से शुरुआत की, जो BanFakeNews-2.0 नामक एक डेटासेट से लिए गए थे। कुछ असली थे, और कुछ नकली।

कंप्यूटर को अंतर बताने के लिए सिखाने हेतु, आपको मानवीय भाषा को उन नंबरों में अनुवादित करना होता है जिन्हें कंप्यूटर समझ सके। इसे एक व्यक्ति का वर्णन एक पुलिस स्केच आर्टिस्ट को करने की कोशिश करने जैसा समझें। आप उसका वर्णन इस प्रकार कर सकते हैं:

  • उनके द्वारा उपयोग किए जाने वाले शब्द (जैसे कि पेपर में "FastText" या "Word2Vec")।
  • शब्द कितनी बार आते हैं (जैसे कि "TF-IDF")।
  • अक्षरों का आकार (जैसे कि "Character-level features")।
  • वाक्य की संरचना (जैसे कि "Statistical features"—वाक्य कितने लंबे हैं, कितने कॉमा लगे हैं, आदि)।

समस्या यह है कि यदि आप स्केच आर्टिस्ट को हर संभव विवरण (हर शब्द, हर कॉमा, हर अक्षर का आकार) दे देते हैं, तो वे भ्रमित या अभिभूत हो सकते हैं। कुछ विवरण महत्वपूर्ण होते हैं, जबकि अन्य केवल शोर (noise) होते हैं।

समाधान: "हाइब्रिड" जासूस

शोधकर्ता संकेतों का एक आदर्श मिश्रण खोजना चाहते थे। उन्होंने केवल एक प्रकार का विवरण नहीं चुना; उन्होंने इन विवरणों को एक रेसिपी के अवयवों (ingredients) की तरह मिलाने के लिए छह अलग-अलग तरीकों का परीक्षण किया।

उन्होंने एक विशेष कंप्यूटर मस्तिष्क का उपयोग किया जिसे CNN (Convolutional Neural Network) कहा जाता है। आप CNN को एक मल्टी-लेंस कैमरे के रूप में देख सकते हैं। केवल एक लेंस के माध्यम से समाचार लेख को देखने के बजाय, इस कैमरे में कई लेंस हैं:

  1. एक लेंस शब्दों के अर्थ को देखता है।
  2. दूसरा लेंस वाक्यों की संरचना को देखता है।
  3. तीसरा लेंस अक्षरों के सूक्ष्म विवरणों को देखता है।

ये लेंस नोट्स एकत्र करने के लिए अलग-अलग काम करते हैं, और फिर वे अंतिम निर्णय लेने के लिए अपने नोट्स को मिलाते हैं: "नकली" या "असली"।

प्रयोग: जीतने वाली रेसिपी खोजना

टीम ने यह देखने के लिए कई परीक्षण किए कि कौन सा संयोजन (combination) सबसे अच्छा काम करता है।

  • एकल अवयव (Single Ingredients): जब उन्होंने केवल एक प्रकार के सुराग का उपयोग किया (जैसे केवल शब्दों के अर्थ को देखना), तो कंप्यूटर ठीक-ठाक था, लेकिन वह बहुत सारी फर्जी खबरें छोड़ देता था। यह एक ऐसे सुरक्षा गार्ड की तरह था जो केवल आईडी चेक करता है लेकिन व्यक्ति के व्यवहार को अनदेखा कर देता है।
  • मिश्रण (The Mix): जब उन्होंने सभी अवयवों को मिलाया—शब्दों के अर्थ, शब्दों की आवृत्ति, अक्षरों के पैटर्न और सांख्यिकीय संरचना—तो कंप्यूटर बहुत अधिक सटीक हो गया।

परिणाम: एक बेहतर गार्ड

पेपर का दावा है कि "हाइब्रिड" दृष्टिकोण (सब कुछ एक साथ उपयोग करना) स्पष्ट विजेता था।

  • सबसे अच्छा कॉम्बो: सबसे सफल रेसिपी में TF-IDF (शब्दों का महत्व), Word2Vec (शब्द का अर्थ), FastText (शब्दों का आकार), Character-level विवरण और Statistical विशेषताएं शामिल थीं।
  • स्कोर: इस पूर्ण मिश्रण के साथ, कंप्यूटर ने लगभग 91% सटीकता प्राप्त की।
  • बड़ी जीत: सबसे महत्वपूर्ण सुधार Recall में हुआ। जासूसी के शब्दों में, "Recall" यह है कि आप बुरे लोगों को पकड़ने में कितने अच्छे हैं। केवल एक सुराग का उपयोग करने पर, कंप्यूटर लगभग आधी फर्जी खबरें छोड़ देता था। पूरे मिश्रण का उपयोग करने पर, उसने उन्हें काफी अधिक पकड़ा (पकड़ने की दर को लगभग 55% से बढ़ाकर 61% कर दिया)।

निष्कर्ष

मुख्य निष्कर्ष सरल है: किसी समस्या को देखने के केवल एक तरीके पर भरोसा न करें।

ठीक वैसे ही जैसे एक जासूस को किसी संदिग्ध को पकड़ने के लिए एक साथ उसकी आईडी चेक करने, उसकी कहानी सुनने और उसके बॉडी लैंग्वेज को देखने की आवश्यकता होती है, कंप्यूटर को फर्जी खबरों को पकड़ने के लिए समाचारों को हर कोण से (शब्दों, संरचना और सांख्यिकी) देखने की आवश्यकता होती है। इन विभिन्न "फीचर" प्रकारों को मिलाकर, शोधकर्ताओं ने बांग्ला भाषा में झूठ पकड़ने के लिए एक बहुत अधिक प्रभावी उपकरण बनाया है।

नोट: यह पेपर सख्ती से इस विशिष्ट कंप्यूटर मॉडल और डेटासेट पर केंद्रित है। यह दावा नहीं करता है कि इस तकनीक का वर्तमान में अस्पताल, अदालत या अन्य वास्तविक दुनिया के अनुप्रयोगों के बाहर उपयोग किया जा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →