DHPLT: large-scale multilingual diachronic corpora and word representations for semantic change modelling
यह शोध पत्र DHPLT को प्रस्तुत करता है, जो 41 भाषाओं में बड़े पैमाने के, बहुभाषी कालक्रमिक संग्रहों (diachronic corpora) से युक्त एक खुला संसाधन है जिसमें पूर्व-गणनाकृत एम्बेडिंग्स और लेक्सिकल प्रतिस्थापन शामिल हैं, जिसे उच्च-संसाधन वाली भाषाओं से परे अर्थ परिवर्तन मॉडलिंग के लिए डेटा की कमी को दूर करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अध्ययन करना चाहते हैं कि मानव भाषा कैसे विकसित होती है, जैसे दशकों में एक नदी का मार्ग बदलते हुए देखना। आपको पुराने पत्रों, समाचार पत्रों और डायरियों के एक विशाल संग्रह की आवश्यकता होगी ताकि यह देखा जा सके कि "mouse" (जानवर बनाम कंप्यूटर डिवाइस) या "cloud" (आकाश बनाम डेटा स्टोरेज) जैसे शब्दों के अर्थ कैसे बदले।
समस्या क्या है? दुनिया की अधिकांश भाषाओं के लिए, वे "पुराने पत्र" किसी व्यवस्थित लाइब्रेरी में सलीके से मौजूद नहीं हैं। वे बिखरे हुए, अस्त-व्यset या बस अस्तित्व में ही नहीं हैं।
DHPLT से मिलिए। DHPLT को एक विशाल, समय-यात्रा करने वाली डिजिटल लाइब्रेरी के रूप में समझें जिसे शोधकर्ताओं द्वारा इस समस्या को हल करने के लिए बनाया गया है। यह कैसे काम करता है, यहाँ सरल रूप में दिया गया है:
1. स्रोत: "इंटरनेट टाइम मशीन"
इतिहास को व्यवस्थित करने के लिए पुस्तकालयाध्यक्षों (librarians) का इंतज़ार करने के बजाय, शोधकर्ताओं ने सीधे स्रोत पर ही प्रहार किया: इंटरनेट। उन्होंने HPLT (हाई-परफॉर्मेंस लैंग्वेज टेक्नोलॉजीज) नामक एक विशाल प्रोजेक्ट का उपयोग किया जिसने पहले से ही अरबों वेब पेज स्क्रेप (scrape) किए हुए हैं।
- उपमा (Analogy): कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक महासागर है। HPLT एक जाल है जो साफ, फिल्टर किया हुआ पानी निकालता है।
- ट्रिक: इस महासागर को एक टाइमलाइन में बदलने के लिए, उन्होंने यह नहीं देखा कि टेक्स्ट कब लिखा गया था (जो अक्सर छिपा हुआ या गायब होता है)। इसके बजाय, उन्होंने इस पर ध्यान दिया कि वेब क्रॉलर ने पेज को कब डाउनलोड किया।
- यदि किसी बॉट ने 2015 में एक पेज डाउनलोड किया, तो वह पेज 2015 तक मौजूद होना ही चाहिए। यह एक 'टाइम कैप्सूल' खोजने जैसा है: यदि आपने इसे 2015 में पाया, तो इसकी सामग्री 2015 के बाद की नहीं हो सकती।
2. संग्रह: 41 भाषाएँ, 3 टाइम कैप्सूल
शोधकर्ताओं ने केवल रैंडम पेज नहीं उठाए। उन्होंने 41 विभिन्न भाषाओं (अंग्रेजी और स्पेनिश से लेकर तमिल और जॉर्जियन तक) के लिए तीन विशिष्ट "टाइम विंडो" बनाई:
- विंडो 1 (2011–2015): "अर्ली इंटरनेट" युग।
- विंडो 2 (2020–2021): "महामारी" का युग (जब दुनिया तेजी से बदली)।
- विंडो 3 (2024–वर्तमान): "AI बूम" का युग।
प्रत्येक विंडो में प्रति भाषा 1 मिलियन दस्तावेज़ हैं। यह बहुत सारा पढ़ने योग्य साहित्य है!
3. "टारगेट वर्ड्स": शो के असली सितारे
आप एक शब्द खोजने के लिए दस लाख किताबें नहीं पढ़ सकते। इसलिए, शोधकर्ताओं ने प्रत्येक भाषा के लिए लगभग 18,000 दिलचस्प शब्दों (संज्ञा, क्रिया और विशेषण) की एक "वांटेड लिस्ट" चुनी।
उन्होंने आपको केवल टेक्स्ट ही नहीं दिया; उन्होंने आपके लिए भारी काम पहले ही कर दिया है। उन्होंने इन शब्दों के लिए तीन अलग-अलग प्रकार के "मीनिंग मैप्स" (अर्थ मानचित्र) की गणना की है:
- स्टैटिक मैप्स (Word2Vec): एक शब्दकोश की परिभाषा की तरह जो संदर्भ के आधार पर नहीं बदलती। यह उस युग में एक शब्द का "औसत" अर्थ है।
- कॉन्टेक्स्टुअल मैप्स (टोकन एम्बेडिंग्स): एक हाई-डेफिनिशन फोटो की तरह। यह दिखाता है कि उस शब्द का उपयोग एक विशिष्ट वाक्य में कैसे किया गया था। क्या "AI" का अर्थ वीडियो गेम में एक रोबोट था, या एक चैटबॉट? यह मैप अंतर जानता है।
- सबस्टीट्यूट्स (स्थानापन्न): यदि आपको उस वाक्य में शब्द को दूसरे शब्द से बदलना पड़े, तो आप किसका उपयोग करेंगे? यह ट्रैक करने में मदद करता है कि किसी शब्द का "वाइब" (vibe) कैसे बदला।
4. यह क्यों महत्वपूर्ण है: बदलाव को देखना
यह पेपर दिखाता है कि यह टूल खूबसूरती से काम करता है। उन्होंने "AI" शब्द के साथ इसका परीक्षण किया:
- 2011–2015 में: यह शब्द "वीडियो गेम्स", "रोबोट्स" और "कारों" के साथ घूम रहा था।
- 2020–2021 में: यह "चैटबॉट्स" और "मशीन लर्निंग" के साथ घुलने-मिलने लगा।
- 2024 में: अब यह "ChatGPT", "जेनरेटिव" और "LLMs" से घिरा हुआ है।
उन्होंने स्पेनिश ("IA") और रूसी ("ИИ") में भी बिल्कुल यही बदलाव देखा। यह एक फिल्म को फास्ट-फॉरवर्ड में देखने जैसा है, जिससे पता चलता है कि वास्तव में कब एक शब्द का व्यक्तित्व बदला।
कमी (सीमाएँ)
शोधकर्ता अपनी खामियों के बारे में ईमानदार हैं। क्योंकि उन्होंने लिखने की तारीखों के बजाय "डाउनलोड तारीखों" का उपयोग किया है, इसलिए 2024 में डाउनलोड किया गया दस्तावेज़ वास्तव में 2010 में लिखा गया हो सकता है।
- उपमा: यह 2024 के कूड़ेदान में 2010 के समाचार पत्र खोजने जैसा है। आप जानते हैं कि यह 2024 में मौजूद है, लेकिन यह नया नहीं है।
- परिणाम: टाइमलाइन एकदम सटीक (sharp) नहीं है, लेकिन बड़े चित्र (big picture) को देखने के लिए यह "काफी अच्छी" है।
मुख्य निष्कर्ष (The Bottom Line)
DHPLT वैज्ञानिक समुदाय के लिए एक उपहार है। इससे पहले, भाषा के परिवर्तन का अध्ययन करना एक दर्जन अलग-अलग देशों से मिले कुछ चुनिकी ईंटों से घर बनाने जैसा था। अब, उनके पास 41 विभिन्न संस्कृतियों की ईंटों से भरा एक गोदाम है, जो समय के अनुसार क्रमबद्ध है और जिसके ब्लूप्रिंट पहले से ही तैयार हैं। यह शोधकर्ताओं को अंततः यह पूछने की अनुमति देता है कि: "आज की दुनिया दस साल पहले की तुलना में अलग तरह से कैसे बोलती है?" और वास्तव में इसका उत्तर प्राप्त करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।