← नवीनतम पेपर
💬 NLP

Ideology Prediction of German Political Texts

यह शोध पत्र जर्मन ग्रंथों की राजनीतिक दिशा को निरंतर बाएं-से-दाएं स्पेक्ट्रम पर अनुमानित करने के लिए एक ट्रांसफार्मर-आधारित दृष्टिकोण प्रस्तावित करता है, जो चार अलग-अलग कॉर्पोरा पर प्रयोगों के माध्यम से यह प्रदर्शित करता है कि पूर्वाग्रह अनुमान में उच्च सटीकता प्राप्त करने के लिए मॉडल आर्किटेक्चर और डोमेन-विशिष्ट प्रशिक्षण डेटा, मॉडल के आकार जितने ही महत्वपूर्ण हैं।

मूल लेखक: Sinclair Schneider, Florian Steuber, Joao A. G. Schneider, Gabi Dreo Rodosek

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sinclair Schneider, Florian Steuber, Joao A. G. Schneider, Gabi Dreo Rodosek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: टेक्स्ट के लिए एक राजनीतिक दिशा-सूचक (Political Compass)

कल्पना कीजिए कि आपके पास एक विशाल, अदृश्य पैमाना है जो बाएँ (-1) से दाएँ (+1) तक फैला हुआ है। सुदूर बाएँ वे लोग हैं जो बड़ी सरकार और सामाजिक परिवर्तन चाहते हैं; सुfar दाएँ वे हैं जो परंपरा और सीमित सरकार चाहते हैं; और बीच में मध्यमपंथी हैं।

आमतौर पर, कंप्यूटर इस पैमाने का उपयोग करने में खराब होते हैं। वे चीजों को बक्सों में वर्गीकृत करने में बहुत अच्छे हैं (जैसे "बाएँ," "केंद्र," या "दाएँ"), लेकिन उन्हें यह कहने में कठिनाई होती है कि "यह टेक्स्ट केंद्र से थोड़ा बाएँ है," या "वह वाला बहुत अधिक दाएँ है।"

यह पेपर एक नया कंप्यूटर प्रोग्राम (एक "ट्रांसफॉर्मर मॉडल") पेश करता है जो केवल टेक्स्ट को बक्सों में नहीं डालता। इसके बजाय, यह राजनीतिक विचारों के लिए एक जीपीएस (GPS) की तरह काम करता है। यह टेक्स्ट के एक टुकड़े को लेता है—जैसे कोई समाचार लेख, भाषण, या ट्वीट—और उसे बाएँ-से-दाएँ वाले पैमाने पर एक सटीक निर्देशांक (coordinate) देता है।

उन्होंने मानचित्र कैसे बनाया

कंप्यूटर को राजनीति पढ़ना सिखाने के लिए, शोधकर्ताओं ने केवल अनुमान नहीं लगाया। उन्होंने चार अलग-अलग "शब्दकोशों" का उपयोग करके एक विशाल प्रशिक्षण पुस्तकालय बनाया:

  1. संसद का रिकॉर्ड (Bundestag): उन्होंने जर्मन राजनेताओं के हजारों वास्तविक भाषण लिए। चूंकि हमें पता है कि प्रत्येक राजनेता किस पार्टी से संबंधित है, इसलिए कंप्यूटर ने विशिष्ट शब्दों और लहजों को विशिष्ट पार्टियों के साथ जोड़ना सीखा।
  2. मतदाता मार्गदर्शिका (Wahl-O-Mat): यह एक लोकप्रिय जर्मन वेबसाइट है जहाँ मतदाता यह देखने के लिए प्रश्नों के उत्तर देते हैं कि कौन सी पार्टी उनके विचारों से मेल खाती है। शोधकर्ताओं ने पार्टियों द्वारा दिए गए आधिकारिक उत्तरों का उपयोग किया। इसने कंप्यूटर को एक स्पष्ट "ग्राउंड ट्रुथ" दिया कि प्रत्येक पार्टी वास्तव में क्या मानती है।
  3. समाचार पत्रों का संग्रह: उन्होंने 33 विभिन्न जर्मन समाचार पत्रों से लाखों लेख एकत्र किए, जो बहुत वामपंथी से लेकर बहुत दक्षिणपंथी तक फैले हुए थे।
  4. ट्विटर (X) फीड: उन्होंने जर्मन राजनेताओं के पाँच लाख से अधिक ट्वीट्स एकत्र किए ताकि यह देखा जा सके कि वे छोटे, अनौपचारिक रूप में कैसे सुनाई देते हैं।

"जादुई ट्रिक" (डेटा संवर्धन/Data Enrichment):
यह सुनिश्चित करने के लिए कि कंप्यूटर केवल उन्हीं शब्दों को याद न कर ले जो उसे दिए गए हैं, उन्होंने एक दूसरे AI का उपयोग किया ताकि एक ही राजनीतिक बयान को अलग-अलग "आवाजों" में फिर से लिखा जा सके। उन्होंने AI से पूछा कि एक नीति को एक बच्चे, एक किशोर, एक वयस्क, या एक सोशल मीडिया इन्फ्लुएंसर की तरह कैसे समझाया जाए। इसने कंप्यूटर को केवल शब्दों को नहीं, बल्कि शब्दों के पीछे के विचार को पहचानने में सक्षम बनाया।

यह "जीपीएस" कैसे काम करता है

यह प्रणाली संभावनाओं (probabilities) की एक सूची को पैमाने पर एक एकल संख्या में बदलने के लिए एक चतुर ज्यामितीय ट्रिक का उपयोग करती है।

  1. पार्टी वेक्टर्स (Party Vectors): कल्पना कीजिए कि छह प्रमुख जर्मन राजनीतिक पार्टियाँ एक दिशा में इशारा करने वाली कम्पास की सुइयों की तरह हैं।
    • सुदूर-वामपंथी पार्टी सीधे बाएँ इशारा करती है।
    • सुदूर-दक्षिणपंथी पार्टी सीधे दाएँ इशारा करती है।
    • उदारवादी पार्टी सीधे ऊपर (केंद्र) इशारा करती है।
    • अन्य पार्टियाँ विशिष्ट कोणों पर बीच में इशारा करती हैं।
  2. गणना: जब कंप्यूटर एक नया टेक्स्ट पढ़ता है, तो वह पूछता है: "यह वामपंथी पार्टी जैसा कितना लगता है? दक्षिणपंथी पार्टी जैसा कितना?"
    • यह उन उत्तरों को लेता है और उन्हें पार्टी के कम्पास की दिशा से गुणा करता है।
    • फिर, यह एक बड़े "परिणाम तीर" (result arrow) को बनाने के लिए उन सभी छोटे तीरों को जोड़ देता है।
  3. स्कोर: उस अंतिम बड़े तीर की दिशा कंप्यूटर को राजनीतिक स्कोर बताती है। यदि तीर थोड़ा बाएँ इशारा करता है, तो स्कोर -0.3 है। यदि तीर बहुत अधिक दाएँ इशारा करता है, तो स्कोर +0.8 है।

उन्होंने क्या पाया

शोधकर्ताओं ने यह देखने के लिए 13 अलग-अलग कंप्यूटर मॉडल का परीक्षण किया कि कौन सा सबसे अच्छा "अनुवादक" है।

  • विशेषज्ञ बनाम सामान्यज्ञ: एक मॉडल, जिसे DeBERTa-large कहा जाता है, विशेष रूप से जर्मन टेक्स्ट पर प्रशिक्षित किया गया था। यह राजनीतिक भाषणों और आधिकारिक दस्तावेजों (इन-डोमेन टेस्ट) को समझने में सर्वश्रेष्ठ था।
  • गिरगिट (The Chameleon): दूसरा मॉडल, Gemma2-2B, छोटा था लेकिन कई भाषाओं के मिश्रण पर प्रशिक्षित था। आश्चर्यजनक रूप से, यह नए प्रकार के टेक्स्ट को समझने में सबसे अच्छा था जिसे उसने पहले नहीं देखा था, जैसे कि रैंडम समाचार लेख या ट्वीट (आउट-ऑफ-डोमेन टेस्ट)।
  • आकार सब कुछ नहीं है: उन्होंने पाया कि एक विशाल कंप्यूटर मॉडल (अरबों पैरामीटर वाला) होने का मतलब हमेशा यह नहीं होता कि वह अधिक स्मार्ट है। कभी-कभी, एक छोटा, अच्छी तरह से प्रशिक्षित मॉडल बेहतर काम करता है।

सटीकता:
यह प्रणाली आश्चर्यजनक रूप से अच्छी है। जब उन्होंने समाचार पत्रों की मानवीय रेटिंग के साथ इसके स्कोर की तुलना की, तो कंप्यूटर केवल लगभग 8.5% ही गलत था। यह लगभग एक मानक जनमत सर्वेक्षण के समान सटीक है।

इसका उपयोग कहाँ किया जा सकता है (और कहाँ नहीं)

यह पेपर इस उपकरण के कुछ व्यावहारिक उपयोग सुझाता है:

  • ब्राउज़र प्लगइन्स: कल्पना कीजिए कि एक प्लगइन है जो आपके द्वारा पढ़े जाने वाले हर समाचार लेख के ऊपर एक छोटा बार दिखाता है, जो बताता है कि वह बाएँ की ओर झुका हुआ है या दाएँ।
  • रुझानों को ट्रैक करना: आप देख सकते हैं कि किसी विशिष्ट विषय का राजनीतिक स्वर एक सप्ताह या एक महीने में कैसे बदलता है।
  • इको चैंबर्स (Echo Chambers) खोजना: यह लोगों को यह समझने में मदद कर सकता है कि क्या वे केवल एक पक्ष के समाचार पढ़ रहे हैं।

सीमाएँ (कमियाँ):

  • यह मस्तिष्क नहीं है: कंप्यूटर एक पैटर्न मैचर है, दार्शनिक नहीं। यह नहीं समझ सकता कि कोई कुछ क्यों कह रहा है। यदि कोई राजनेता किसी कट्टरपंथी विचार की आलोचना करने के लिए उसका उद्धरण देता है, तो कंप्यूटर को लग सकता है कि राजनेता उस विचार का समर्थन करता है।
  • संदर्भ मायने रखता है: यह जर्मन टेक्स्ट के साथ सबसे अच्छा काम करता है। यह अमेरिकी राजनीति या अन्य संस्कृतियों को नहीं समझता क्योंकि "पैमाना" विशेष रूप से जर्मन पार्टियों के लिए बनाया गया है।
  • छोटे टेक्स्ट: यह बहुत छोटे ट्वीट्स (50 शब्दों से कम) के साथ संघर्ष करता है क्योंकि अर्थ समझने के लिए पर्याप्त संदर्भ नहीं होता है।
  • कोई "तर्क" नहीं: यह अपने तर्क की व्याख्या नहीं कर सकता। यह केवल आपको एक संख्या देता है।

निष्कर्ष

यह पेपर सिद्ध करता है कि हम कंप्यूटर को राजनीतिक पूर्वाग्रह को केवल बक्सों में नहीं, बल्कि एक निरंतर पैमाने (continuous scale) पर मापने के लिए सिखा सकते हैं। आधिकारिक रिकॉर्ड, मतदाता मार्गदर्शिकाओं और चतुर गणित के मिश्रण का उपयोग करके, उन्होंने एक ऐसा उपकरण बनाया है जो जर्मन राजनीतिक टेक्स्ट को पढ़ सकता है और बता सकता है कि वह स्पेक्ट्रम पर वास्तव में कहाँ स्थित है, जिसकी सटीकता मानव विशेषज्ञों के बराबर है। हालाँकि, यह विश्लेषण के लिए एक उपकरण है, सत्य का निर्णायक नहीं है, और इसे गलतफहमी से बचने के लिए सावधानी से उपयोग किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →