REMOD: Relation Extraction for Modeling Online Discourse
यह शोध पत्र REMOD प्रस्तुत करता है, जो एक नवीन पर्यवेक्षित शिक्षण (supervised learning) विधि है जो अर्ध-संरचित ऑनलाइन विमर्श डेटा में संस्थाओं के बीच अर्थ संबंधी संबंधों को निकालने के लिए सिमेंटिक डिपेंडेंसी ग्राफ पर पाथ ट्रैवर्सल के साथ ग्राफ एम्बेडिंग तकनीकों को जोड़ती है, जिससे दुष्प्रचार दावों के अधिक प्रभावी मॉडलिंग और तर्क करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक शहर का चौक है जहाँ लाखों लोग एक साथ दावे, अफवाहें और तथ्य चिल्ला रहे हैं। इनमें से कुछ चिल्लाहटें सच हैं, लेकिन कई "फेक न्यूज" या भ्रामक हैं। शोर के बीच से सच्चाई खोजने की कोशिश करना ऐसा ही है जैसे आँखों पर पट्टी बाँधकर घास के ढेर में एक विशिष्ट सुई को ढूँढना।
यह शोध पत्र REMOD (रिलेशन एक्सट्रैक्शन फॉर मॉडलिंग ऑनलाइन डिस्कोर्स) नामक एक नए टूल का परिचय देता है, जिसे उस अराजकता को व्यवस्थित करने में मदद करने के लिए डिज़ाइन किया गया है। REMOD को एक अत्यधिक कुशल अनुवादक और जासूस के रूप में समझें जो इंटरनेट से एक अव्यवsembled (messy) वाक्य ले सकता है और उसे एक साफ, संरचित तथ्य में बदल सकता है जिसे कंप्यूटर आसानी से जाँच सके।
यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:
1. समस्या: अव्यवsembled वाक्य बनाम साफ तथ्य
जब कोई इंसान एक वाक्य पढ़ता है जैसे "तेज प्रताप यादव ने बिहार के तक्षशिला विश्वविद्यालय से डॉक्टरेट प्राप्त की," तो वह अर्थ समझ जाता है। लेकिन एक कंप्यूटर के लिए यह शब्दों का एक समूह मात्र है। यह जाँचने के लिए कि क्या यह सच है, एक कंप्यूटर को इस वाक्य को एक सरल "फैक्ट कार्ड" (एक सिमेंटिक ट्रिपल) में तोड़ना होगा जो इस तरह दिखता हो:
- कौन: तेज प्रताप यादव
- क्रिया: डिग्री प्राप्त की
- कहाँ से: तक्षशिला विश्वविद्यालय
कठिन काम कंप्यूटर को यह सिखाना है कि "कौन", "क्रिया" और "कहाँ से" के लिए वास्तव में कौन से शब्द जिम्मेदार हैं, खासकर जब वाक्य जटिल, व्यंग्यात्मक या खराब तरीके से लिखा गया हो।
2. समाधान: एक मानचित्र बनाना (ग्राफ)
लेखकों ने REMOD को एक मानचित्रकार (cartographer) की तरह बनाने के लिए बनाया है। केवल शब्दों को पढ़ने के बजाय, REMOD वाक्य का एक मानचित्र (जिसे सिमेंटिक डिपेंडेंसी ग्राफ कहा जाता है) बनाता है।
- कल्पना कीजिए कि वाक्य में हर शब्द मानचित्र पर एक शहर है।
- शब्दों के बीच के संबंध (जैसे, "किसने क्या किया और किसके साथ") उन शहरों को जोड़ने वाली सड़कें हैं।
3. सीक्रेट सॉस: सबसे छोटा रास्ता
शोध का बड़ा विचार यह है कि दो विशिष्ट लोगों या चीजों (विषय और वस्तु) के बीच के संबंध को समझने के लिए, आपको पूरे मानचित्र को देखने की आवश्यकता नहीं है। आपको बस उन्हें जोड़ने वाले सबसे छोटे पथ (सबसे सीधा मार्ग) को देखने की आवश्यकता है।
- उपमा: कल्पना कीजिए कि आप जानना चाहते हैं कि "वॉशिंगटन डी.सी." "यूएसए" की "राजधानी है"। आपको अमेरिका की हर सड़क जानने की ज़रूरत नहीं है। आपको बस दोनों शहरों को जोड़ने वाली सीधी सड़क का पता लगाने की आवश्यकता है। शोध का तर्क है कि उस विशिष्ट सड़क के साथ का "दृश्य" (बीच के अन्य शब्द और अवधारणाएं) संबंध की पहचान करने के लिए आवश्यक सुरागों को धारण करता है।
4. REMOD कैसे सीखता है (प्रशिक्षण)
REMOD को ये मानचित्र पढ़ना सिखाने के लिए, लेखकों ने इसे विकिपीडिया से हजारों उदाहरण खिलाए।
- उन्होंने वाक्यों को इन रोड मैप्स में बदलने के लिए FRED नामक टूल का उपयोग किया।
- उन्होंने Node2Vec नामक तकनीक का उपयोग किया (इसे एक जीपीएस के रूप में समझें जो मानचित्र के हर शहर के "वाइब" या मिजाज को सीखता है) ताकि हर शब्द को एक अद्वितीय डिजिटल फिंगरप्रिंट दिया जा सके।
- इसके बाद उन्होंने एक कंप्यूटर मस्तिष्क (क्लासिफायर) को दो शब्दों के बीच के सबसे छोटे पथ के "फिंगरप्रिंट" को देखने और संबंध का अनुमान लगाने के लिए प्रशिक्षित किया। उदाहरण के लिए, यदि पथ व्यक्ति -> डिग्री -> विश्वविद्यालय जैसा दिखता है, तो कंप्यूटर इसे "शिक्षा" के रूप में लेबल करना सीख जाता है।
5. परिणाम: यह काम करता है!
टीम ने दो चीजों पर REMOD का परीक्षण किया:
- संबंधों को छाँटना: उन्होंने विकिपीडिया स्निपेट्स में संबंधों की पहचान करने के लिए REMOD से कहा। इसने 97.6% बार सही पहचान की। यह एक कठिन परीक्षा में ए+ ग्रेड पाने वाले छात्र की तरह है।
- तथ्य-जाँच (Fact-Checking): उन्होंने वास्तविक दुनिया के दावों को लिया जिनकी पेशेवर तथ्य-जांचकर्ताओं द्वारा समीक्षा की गई थी (ClaimReview डेटाबेस से) और उन्हें REMOD का उपयोग करके सत्यापित करने की कोशिश की।
- REMOD ने सफलतापूर्वक अव्यवsembled दावों को साफ तथ्यों में बदल दिया।
- इसके बाद इसने उन तथ्यों को मौजूदा तथ्य-जाँच एल्गोरिदम में फीड किया।
- सिस्टम 83.3% की सटीकता स्कोर के साथ दावों को सत्यापित करने में सक्षम था, जो कि वर्तमान के सर्वश्रेष्ठ तरीकों के बराबर है जो अन्य दावों के डेटाबेस से मिलान करने पर आधारित होते हैं।
6. यह क्यों महत्वपूर्ण है
शोध पत्र का दावा है कि REMOD एक सेतु (bridge) है। यह इंटरनेट के बिखरे हुए, असंरचित "शोर" को संरचित डेटा में बदल देता है जिसे स्वचालित तथ्य-जांचकर्ता समझ सकते हैं।
- लाभ: वर्तमान में, तथ्य-जाँच धीमी है क्योंकि इंसानों को हर दावे को पढ़ने और शोध करने की आवश्यकता होती है। REMOD उस पहले और सबसे कठिन चरण को स्वचालित करने का एक तरीका प्रदान करता है: यह समझना कि दावा वास्तव में क्या कह रहा है ताकि कंप्यूटर तथ्यों की जाँच कर सके।
- सीमा: लेखक स्वीकार करते हैं कि उनका सिस्टम पूर्ण नहीं है। यदि प्रारंभिक "मानचित्र" (वाक्य पार्सिंग) गलत है, तो पूरी प्रक्रिया विफल हो जाती है। साथ भी, यदि इंटरनेट बहुत अधिक बदल जाता है तो सिस्टम को फिर से प्रशिक्षित करने की आवश्यकता होती है, और यह उन बहुत जटिल दावों के साथ संघर्ष करता है जिन्हें एक साधारण एकल तथ्य में नहीं बदला जा सकता।
संक्षेप में:
REMOD एक नया टूल है जो एक अनुवादक के रूप में कार्य करता है, जो ऑनलाइन अफवाहों की अव्यवsembled भाषा को साफ, संरचित तथ्यों में बदल देता है। शब्दों के बीच के "सबसे छोटे पथ" पर ध्यान केंद्रित करके, यह सटीक रूप से पहचान सकता है कि कोई दावा वास्तव में क्या कह रहा है, जिससे तेज़, स्वचालित तथ्य-जाँच का मार्ग प्रशस्त होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।