PREMOVE: A multilayer manually annotated dataset of PREverbed MOtion VErbs in Ancient Greek and Latin
यह शोधपत्र PREMOVE को प्रस्तुत करता है, जो प्राचीन यूनानी और लैटिन में प्रीवर्वड मोशन वर्ब्स (preverbed motion verbs) का एक सार्वजनिक रूप से उपलब्ध, बहुस्तरीय हस्तचालित रूप से एनोटेट किया गया डेटासेट है, जिसे 35 ग्रंथों के 2,835 मौखिक उद्गमों के व्यापक रूप से मॉर्फोसेंटैक्टिक (morphosyntactic) और सिमेंटिक (semantic) एनोटेशन के माध्यम से क्रॉस-लिंग्विस्टिक, डायक्रोनिक और कम्प्यूटेशनल अनुसंधान का समर्थन करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो इस रहस्य को सुलझाने की कोशिश कर रहे हैं कि प्राचीन लोग गति (movement) के बारे में कैसे बात करते थे। विशेष रूप से, आप यह समझना चाहते हैं कि उन्होंने क्रियाओं (verbs) के अर्थ को बदलने के लिए "उपसर्गों" (prefixes) का उपयोग कैसे किया (जैसे under- का undergo में उपयोग, या re- का return में उपयोग)।
यह शोध पत्र PREMOVE का परिचय देता है, जो एक विशाल, अत्यंत व्यवस्थित डिजिटल फाइलिंग कैबिनेट है जिसे शोधकर्ताओं को इस रहस्य को सुलझाने में मदद करने के लिए डिज़ाइन किया गया है, जो दो प्राचीन भाषाओं: प्राचीन ग्रीक और लैटिन में काम करता है।
यहाँ शोध पत्र के दावों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: एक बिखरी हुई लाइब्रेरी
इस परियोजना से पहले, शोधकर्ताओं के पास प्राचीन ग्रीक और लैटिन ग्रंथों की कई पुस्तकें (corpora) थीं। हालाँकि, ये पुस्तकें ऐसी लाइब्रेरी की तरह थीं जहाँ किताबें लेखक या तिथि के अनुसार तो क्रमबद्ध थीं, लेकिन उनके अंदर मौजूद शब्दों के विशिष्ट "क्रिया" (action) के आधार पर नहीं। यदि आप हजारों वर्षों के इतिहास में "दूर जाने" (going away) या "चारों ओर तैरने" (sailing around) के हर उदाहरण को खोजना चाहते, तो आपको मैन्युअल रूप से हर एक पन्ना पढ़ना पड़ता। यह दिखाने के लिए कोई एकल मानचित्र (map) नहीं था कि इन "उपसर्गों" ने विभिन्न समयों और शैलियों में गति की क्रियाओं के अर्थ को कैसे बदला।
2. समाधान: PREMOVE फाइलिंग कैबिनेट
लेखक, एंड्रिया फरिना ने PREMOVE बनाया है। इसे एक विशाल, 42-परत वाला स्प्रेडशीट समझें जिसमें 2,835 विशिष्ट उदाहरण हैं, जहाँ गति की क्रियाओं को एक उपसर्ग के साथ टैग किया गया है।
- सामग्री (The Ingredients): डेटा 35 ग्रंथों (जैसे इलियाड, सीज़र के युद्ध जर्नल, या सिसरो के भाषण) के एक सावधानीपूर्वक चुने गए "बेस कॉर्पस" (Base Corpus) से आता है। लेखक ने इन ग्रंथों को संतुलित किया है ताकि वे विभिन्न समय अवधियों (8वीं शताब्दी ईसा पूर्व से दूसरी शताब्दी ईस्वी तक) और विभिन्न शैलियों (कविता, इतिहास, नाटक, दर्शन) का प्रतिनिधित्व कर सकें।
- सामग्री की सूची (The Ingredients List): उन्होंने प्रत्येक भाषा के लिए 8 सामान्य गति क्रियाएं चुनीं (जैसे "जाना", "भागना", "दौड़ना", "तैरना") और 16 सामान्य उपसर्ग चुने (जैसे "बाहर", "अंदर", "चारों ओर", "नीचे")।
- परतें (The Layers): स्प्रेडशीट का प्रत्येक उदाहरण 42 अलग-अलग सूचनाओं के साथ एनोटेट (annotate) किया गया है। कल्पना करें कि यह एक कार दुर्घटना की फोटो है। एक बुनियादी फोटो केवल कार दिखाती है। PREMOVE एक ऐसी फोटो की तरह है जहाँ हर हिस्से को लेबल किया गया है: गति, मौसम, सड़क का प्रकार, ड्राइवर का मूड, और मानचित्र पर सटीक स्थान।
- Morphology (रूपविज्ञान): शब्द का रूप क्या है?
- Semantics (अर्थविज्ञान): क्या इसका अर्थ "ऊपर जाना" है या "नीचे जाना"? क्या यह शाब्दिक है या लाक्षणिक (metaphorical)?
- Spatial Roles (स्थानिक भूमिकाएँ): क्या शब्द एक शुरुआती बिंदु (Source), एक गंतव्य (Goal), या एक पथ (Path) का वर्णन कर रहा है?
- Context (संदर्भ): किसने लिखा? कब? कौन सी शैली?
3. गुणवत्ता नियंत्रण: "तीन न्यायाधीशों" की परीक्षा
चूंकि मनुष्य इस डेटा को एनोटेट कर रहे हैं, इसलिए असहमति की हमेशा संभावना रहती है। डेटा विश्वसनीय है, यह साबित करने के लिए, लेखक ने इसका परीक्षण किया।
- परीक्षण: तीन अलग-अलग विशेषज्ञों (एक कंप्यूटर भाषाविद्, एक पारंपरिक इतिहासकार, और स्वयं लेखक) ने वाक्यों के एक छोटे नमूने को देखा और स्वतंत्र रूप से उन्हें लेबल करने का प्रयास किया।
- परिणाम: सबसे महत्वपूर्ण हिस्सों के लिए—उपसर्ग और उसके मूल अर्थ की पहचान करना—वे लगभग पूरी तरह से सहमत थे (जैसे तीन न्यायाधीशों द्वारा किसी प्रतियोगी को 10/10 देना)। अधिक जटिल, व्यक्तिपरक अर्थों के लिए (जैसे क्रिया का सटीक भावनात्मक सूक्ष्म अंतर), सहमति कम थी, जो मानवीय व्याख्या में सामान्य है। यह सिद्ध करता है कि प्रणाली अपने मुख्य उद्देश्य के लिए अच्छी तरह से काम करती है।
4. उपकरण: एक मानचित्र और एक दूरबीन
शोध पत्र इस डेटा का उपयोग करने के दो मुख्य तरीके बताता है:
- डेटासेट (CSV): यह कच्चा डेटा (raw data) है, जो डाउनलोड के लिए उपलब्ध है। यह शोधकर्ता को कच्चे माल का एक बॉक्स देने जैसा है ताकि वे जो चाहें पका सकें।
- PrevNet (इंटरफेस): यह डेटा पर बना एक उपयोगकर्ता के अनुकूल वेबसाइट है। यह प्राचीन भाषा के लिए "गूगल मैप्स" की तरह है। आप एक उपसर्ग (जैसे "चारों ओर") पर क्लिक कर सकते हैं और तुरंत एक पाई चार्ट देख सकते हैं जो दिखाता है कि इसका कितनी बार उपयोग किया गया, किन लेखकों ने इसका उपयोग किया, और सदियों में इसका अर्थ कैसे बदला। आप पाई चार्ट के एक हिस्से पर क्लिक कर सकते हैं और वास्तविक प्राचीन वाक्य देख सकते हैं।
- संबंध (LiLa): यह डेटा एक विशाल वैश्विक भाषा डेटा नेटवर्क (LiLa) से भी जुड़ा हुआ है, जो इसे "FAIR" (खोजने योग्य, सुलभ, इंटरऑपरेबल, पुन: प्रयोज्य) बनाता है। यह डेटा को एक सार्वभौमिक बारकोड देने जैसा है ताकि कोई भी कंप्यूटर सिस्टम इसे पढ़ सके।
5. इसका उपयोग किस लिए किया जाता है (शोध पत्र के अनुसार)
शोध पत्र स्पष्ट रूप से बताता है कि यह डेटासेट निम्नलिखित के लिए एक उपकरण है:
- भाषाओं की तुलना करना: यह देखना कि ग्रीक और लैटिन ने गति को अलग-अलग तरीके से कैसे संभाला।
- AI को प्रशिक्षित करना: बड़े भाषा मॉडलों (LLMs) को प्राचीन भाषाओं को बेहतर ढंग से समझने के लिए सिखाने हेतु इस डेटा का उपयोग करना।
- ऐतिहासिक भाषाविज्ञान (Historical Linguistics): यह ट्रैक करना कि शब्दों के अर्थ में 1,000 वर्षों में कैसे बदलाव आया (उदाहरण के लिए, कैसे "बाहर जाने" के लिए इस्तेमाल होने वाला शब्द अंततः "होने" या "घटित होने" का अर्थ दे सकता है)।
- डिजिटल मानविकी (Digital Humanities): छात्रों और विद्वानों को कोडिंग विशेषज्ञ बने बिना ग्रंथों का पता लगाने में मदद करना।
यह क्या नहीं है (शोध पत्र के आधार पर)
- यह कोई चिकित्सा या नैदानिक (clinical) उपकरण नहीं है।
- यह सीधे तौर पर आधुनिक भाषा सीखने की समस्याओं को हल करने का दावा नहीं करता है (हालांकि यह उस AI को प्रशिक्षित करने में मदद करता है जो इसे कर सकता है)।
- यह ग्रीक या लैटिन का पूर्ण शब्दकोश नहीं है; यह उपसर्गों के साथ गति क्रियाओं का एक केंद्रित अध्ययन है।
संक्षेप में, PREMOVE यह दर्शाने वाला एक उच्च-परिशुद्धता, मानव-सत्यापित मानचित्र है कि प्राचीन लोगों ने दुनिया के माध्यम से गति करने के लिए शब्दों का उपयोग कैसे किया, जिसे कंप्यूटर और मनुष्य मिलकर भाषा के इतिहास को समझने के लिए डिज़ाइन किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।