← नवीनतम पेपर
💬 NLP

A Multi-View Media Profiling Suite: Resources, Evaluation, and Analysis

यह शोध पत्र MBFC-2025 डेटासेट और एक मल्टी-व्यू मीडिया प्रोफाइलिंग सुइट पेश करता है जो समाचार आउटलेट्स में राजनीतिक पूर्वाग्रह और तथ्यात्मकता का पता लगाने के लिए अत्याधुनिक परिणाम प्राप्त करने हेतु विविध निरूपणों (representations) और संलयन रणनीतियों (fusion strategies) का लाभ उठाता है।

मूल लेखक: Muhammad Arslan Manzoor, Dilshod Azizov, Daniil Orel, Umer Siddique, Zain Muhammad Mujahid, Yufang Hou, Preslav Nakov

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Arslan Manzoor, Dilshod Azizov, Daniil Orel, Umer Siddique, Zain Muhammad Mujahid, Yufang Hou, Preslav Nakov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट समाचार आउटलेट्स का एक विशाल, हलचल भरा शहर है। कुछ विश्वसनीय, अच्छी तरह से प्रकाशित पुस्तकालयों की तरह हैं; अन्य जंगली अफवाहें बेचने वाले शोर-शराबे वाले बाजारों की तरह हैं। लंबे समय तक, यह पता लगाने के लिए कि कौन सा क्या है, एक मानव जासूस को हर लेख को पढ़ने, हर स्रोत की जांच करने और निर्णय लेने की आवश्यकता थी। यह धीमा, महंगा और एक साथ हजारों समाचार साइटों के लिए करना असंभव है।

यह शोध पत्र एक नया "मल्टी-व्यू मीडिया प्रोफाइलिंग सूट" (Multi-View Media Profiling Suite) पेश करता है, जो अनिवार्य रूप से एक उच्च-तकनीकी जासूसी टीम है जिसे इन समाचार आउटलेट्स का स्वचालित रूप से प्रोफाइल बनाने के लिए डिज़ाइन किया गया है। केवल एक तरीके से समाचार स्रोत को आंकने के बजाय, यह टीम शहर को पांच अलग-अलग कोणों से एक साथ देखती है।

यहाँ बताया गया है कि उन्होंने अपने जासूसी टूलकिट को सरल शब्दों में कैसे बनाया:

1. नया मानचित्र (डेटा)

सबसे पहले, टीम को एक बेहतर मानचित्र की आवश्यकता थी। पिछले मानचित्रों में केवल लगभग 900 समाचार आउटलेट शामिल थे। टीम ने MBFC-2025 नामक एक विशाल नया मानचित्र बनाया, जो लगभग 2,600 समाचार आउटलेट्स को कवर करता है। उन्होंने राजनीतिक पूर्वाग्रह के लिए (जैसे "बहुत वामपंथी" से "बहुत दक्षिणपंथी") और सत्यनिष्ठा के लिए ("बहुत उच्च" से "बहुत निम्न") 5-पॉइंट स्केल पर लेबल करने के लिए "मीडिया बायस/फैक्ट चेक" (Media Bias/Fact Check) नामक एक समूह के विशेषज्ञ रेटिंग का उपयोग किया।

2. पांच जासूसी लेंस (दृष्टिकोण)

एक समाचार आउटलेट को समझने के लिए, टीम ने केवल समाचार नहीं पढ़ा। उन्होंने इसे पांच अलग-अलग "लेंस" या दृष्टिकोणों के माध्यम से देखा:

  • लेंस 1: दर्शकों का ओवरलैप (Alexa Graph)। कल्पना करें कि पूछना, "जब लोग इस समाचार साइट पर जाते हैं, तो वे और किन लोगों के पास जाते हैं?" यदि द न्यूयॉर्क टाइम्स के पाठक अक्सर द वॉशिंगटन पोस्ट भी देखते हैं, तो सिस्टम उनके बीच एक रेखा खींच देता है। यह समान आउटलेट्स को एक साथ समूहबद्ध करने में मदद करता है।
  • लेंस 2: लिंक का जाल (Hyperlink Graph)। यह देखता है कि कौन किसे लिंक करता है। यदि फॉक्स न्यूज सीएनएन को लिंक करता है, या इसके विपरीत, तो यह एक संबंध बनाता है। यह ऐसा है जैसे देखना कि पार्टी में कौन किसके साथ दोस्त है।
  • लेंस 3: एआई की अंतर्दृक (LLM-Graph)। टीम ने एक स्मार्ट एआई (एक लार्ज लैंग्वेज मॉडल) से पूछा: "यदि मैं इस समाचार साइट को पसंद करता हूँ, तो मुझे और कौन सी 5 साइटें पसंद आ सकती हैं?" एआई के सुझाव एक नया मानचित्र बनाते हैं जो सिमेंटिक समानता पर आधारित है, भले ही साइटें स्पष्ट रूप से एक-दूसरे से लिंक न करती हों।
  • लेंस 4: आउटलेट की आवाज़ (लेख)। यह समाचार आउटलेट द्वारा लिखा गया वास्तविक टेक्स्ट है। सिस्टम उनके लेखों के लहजे और फ्रेमिंग का विश्लेषण करता है।
  • लेंस 5: सार्वजनिक रिकॉर्ड (विकिपीडिया)। यह इस बात को देखता है कि दूसरों ने विकिपीडिया पर उस समाचार आउटलेट के बारे में क्या लिखा है। यह आउटलेट की प्रतिष्ठा का ऐतिहासिक संदर्भ और सारांश प्रदान करता है।

3. मस्तिष्क (फ्यूजन रणनीति)

इन पांच दृष्टिकोणों को जोड़ना एक कठिन काम है। कभी-कभी "दर्शक" वाला दृश्य एक बात कहता है, लेकिन "लिंक" वाला दृश्य दूसरी बात कहता है।

  • पुराना तरीका (Static Fusion): कल्पना करें कि एक समिति है जहाँ हर कोई वोट देता है, और आप बस उनका औसत ले लेते हैं। यदि कोई भ्रमित है, तो औसत गड़बड़ा जाता है।
  • नया तरीका (RL-Based Fusion): लेखकों ने कुछ अधिक स्मार्ट आज़माया। उन्होंने एक रीइन्फोर्समेंट लर्निंग (RL) एजेंट का उपयोग किया। इस एजेंट को एक ऑर्केस्ट्रा के स्मार्ट कंडक्टर (संचालक) के रूप में सोचें। हर वाद्य यंत्र को एक ही वॉल्यूम पर बजाने देने के बजाय, कंडक्टर संगीत सुनता है और तय करता है, "अभी, वायलिन (लेख वाला दृश्य) सबसे महत्वपूर्ण भूमिका निभा रहा है, इसलिए मैं इसकी आवाज़ बढ़ा दूँगा। ड्रम (लिंक वाला दृश्य) आज थोड़े बेसुरे हैं, इसलिए मैं उन्हें कम कर दूँगा।"

यह "कंडक्टर" गतिशील रूप से सीखता है कि प्रत्येक विशिष्ट समाचार आउटलेट के लिए किस दृश्य पर सबसे अधिक भरोसा करना है, बजाय इसके कि एक ही नियम का उपयोग हर जगह किया जाए।

4. परिणाम (उन्होंने क्या पाया)

टीम ने दो डेटासेट पर अपने सिस्टम का परीक्षण किया: छोटा, पुराना वाला (ACL-2020) और उनका नया, बड़ा वाला (MBFC-2025)।

  • राजनीतिक पूर्वाग्रह को पहचानना आसान है: यह नीले रंग की कारों के समुद्र में लाल कार को पहचानने जैसा है; उपयोग की जाने वाली भाषा अक्सर बहुत स्पष्ट होती है। सिस्टम इसमें बहुत अच्छा था, जिसने अत्याधुनिक परिणाम (अब तक के सर्वश्रेष्ठ स्कोर) प्राप्त किए।
  • तथ्यात्मकता (Factuality) अधिक कठिन है: यह निर्धारित करना कि कोई कहानी सच है या नहीं, घास के ढेर में सुई खोजने जैसा है। इसके लिए गहरे संदर्भ की आवश्यकता होती है। सिस्टम ने अच्छा प्रदर्शन किया, लेकिन यह पूर्वाग्रह को पहचानने की तुलना में कठिन है।
  • कंडक्टर जीतता है: "स्मार्ट कंडक्टर" (RL-आधारित फ्यूजन) ने लगातार पुराने "औसत वोटिंग" तरीकों से बेहतर प्रदर्शन किया। इसने साबित कर दिया कि यह गतिशील रूप से तय करना कि किस जानकारी पर भरोसा किया जाए, सब कुछ एक साथ मिलाने से बेहतर है।
  • अधिक दृश्य हमेशा बेहतर नहीं होते: दिलचस्प बात यह है कि बहुत अधिक दृश्य जोड़ने से कभी-कभी सिस्टम भ्रमित हो जाता है। सबसे अच्छे परिणाम अक्सर 2 या 3 मजबूत दृष्टिकोणों को मिलाने से आते थे, न कि हर एक डेटा को मिश्रण में डालने से।

सारांश

संक्षेप में, इस शोध पत्र ने समाचार आउटलेट्स का एक विशाल नया डेटाबेस बनाया और एक स्मार्ट सिस्टम बनाया जो उनके दर्शकों, उनके लिंक, उनकी एआई-समानता, उनके लेखन और उनकी प्रतिष्ठा को देखकर उनका प्रोफाइल बनाता है। मुख्य नवाचार एक "स्मार्ट कंडक्टर" है जो विभिन्न संकेतों को गतिशील रूप से वजन (weigh) करने के लिए सीखता है, जिसके परिणामस्वरूप समाचार पूर्वाग्रह और सत्यनिष्ठा का अब तक का सबसे सटीक स्वचालित प्रोफाइलिंग प्राप्त होता है।

महत्वपूर्ण नोट: लेखक स्पष्ट रूप से कहते हैं कि उनका कार्य स्रोत-स्तरीय (source-level) प्रोफाइलिंग (एक समाचार संगठन के रूप में पूरे संगठन का निर्णय लेना) पर केंद्रित है। वे चेतावनी देते हैं कि इसका उपयोग व्यापक संदर्भ के बिना व्यक्तिगत लेखों या विशिष्ट दावों को आंकने के लिए नहीं किया जाना चाहिए, और उनका वर्तमान डेटा मुख्य रूप से अमेरिका-केंद्रित राजनीतिक श्रेणियों पर केंद्रित है। वे यह भी नोट करते हैं कि हालांकि उन्होंने मानचित्र बनाने में एआई का उपयोग किया है, लेकिन अंतिम सिस्टम अनुसंधान और विश्लेषण के लिए डिज़ाइन किया गया है, न कि उपयोगकर्ताओं के लिए सामग्री को फ़िल्टर करने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →