EPIC-EuroParl-UdS: Information-Theoretic Perspectives on Translation and Interpreting
यह शोध पत्र यूरोपीय संसद के भाषणों, अनुवादों और व्याख्याओं का एक अद्यतित, संयुक्त अंग्रेजी-जर्मन संग्रह प्रस्तुत करता है जिसमें परिष्कृत मेटाडेटा और नई सूचना-सैद्धांतिक एनोटेशन शामिल हैं, जिसे भाषा भिन्नता, अनुवाद-शैली (translationese) और संभाव्य मॉडलों का उपयोग करके व्याख्या (interpreting) में विफलता या व्यवधान (disfluencies) के पूर्वानुमान पर अनुसंधान को समर्थन देने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास यूरोपीय संसद के राजनेताओं द्वारा दिए गए भाषणों का एक विशाल पुस्तकालय है। इनमें से कुछ भाषण कागज़ पर लिखे गए थे, और कुछ एक हलचल भरे हॉल में ज़ोर से बोले गए थे। वर्षों से, भाषाविद इन भाषणों का अध्ययन करने की कोशिश कर रहे हैं ताकि यह समझा जा सके कि इंसान एक भाषा से दूसरी भाषा में (जैसे जर्मन से अंग्रेजी में) विचारों को कैसे अनुवादित करते हैं और वे वास्तविक समय में उनकी व्याख्या कैसे करते हैं।
लेकिन एक समस्या थी: पुराना पुस्तकालय बहुत अस्त-व्यस्त था। कुछ किताबें गलत लेबल की गई थीं, कुछ पन्ने गायब थे, और "बोले गए" (spoken) हिस्से का "लिखित" (written) हिस्सों के प्रारूप से कोई मेल नहीं था। यह ऐसा ही था जैसे एक हस्तलिखित पत्र की तुलना एक टेक्स्ट मैसेज से करना, जिसमें कोई विराम चिह्न न हो और पत्र में कोई तारीख भी न हो।
"EPIC-EuroParl-UdS" पेपर एक बिल्कुल नए, पूरी तरह से व्यवस्थित डिजिटल पुस्तकालय के निर्माण के बारे में है।
यहाँ लेखकों द्वारा किए गए कार्यों का विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों का उपयोग करके समझाया गया है:
1. महान पुस्तकालय की सफाई (The Great Library Cleanup)
लेखकों ने डेटा के दो मौजूदा संग्रहों (एक मौखिक अनुवाद के लिए, एक लिखित अनुवाद के लिए) को एक 'सुपर-कॉर्पस' में मिला दिया।
- सुधार: उन्होंने टाइपिंग की गलतियों को ठीक किया, छूटे हुए विराम चिह्न जोड़े, और यह सुनिश्चित किया कि "बोले गए" और "लिखित" दोनों खंड एक जैसे दिखें।
- फ़िल्टर: उन्हें एहसास हुआ कि कुछ डेटा "दूषित" था। उदाहरण के लिए, यदि कोई भाषण लिखित और मौखिक दोनों संस्करणों में मौजूद था, तो उन्होंने डुप्लिकेट को हटा दिया ताकि वे सेब की तुलना सेब से कर सकें, न कि सेब की तुलना सेब-पाई से। उन्होंने पुस्तकालय को इस तरह संतुलित किया कि जर्मन-से-अंग्रेजी डेटा, अंग्रेजी-से-जर्मन डेटा की तुलना में बहुत अधिक न हो।
2. "सरप्राइज़ल" मीटर (The "Surprisal" Meter - भविष्य बताने वाला यंत्र)
यह सबसे दिलचस्प हिस्सा है। लेखकों ने केवल किताबों को साफ ही नहीं किया; उन्होंने हर एक शब्द के साथ एक विशेष "सरप्राइज़ल मीटर" भी जोड़ा।
- सरप्राइज़ल क्या है? कल्पना कीजिए कि आप एक कहानी सुन रहे हैं। यदि कोई कहता है, "बिल्ली बैठी थी..." तो आप अगले शब्द का अनुमान लगा सकते हैं कि वह "मैट" होगा। उस शब्द में कम सरप्राइज़ल (low surprisal) है (वह अपेक्षित है)। लेकिन यदि वे कहते हैं, "बिल्ली बैठी थी... टोस्टर पर," तो वह शब्द उच्च सरप्राइज़ल (high surprisal) वाला है (वह चौंकाने वाला और अप्रत्याशित है)।
- यह क्यों मायने रखता है? भाषाविज्ञान में, "सरप्राइज़ल" एक माप है कि किसी शब्द को समझने के लिए मस्तिष्क को कितनी मानसिक शक्ति की आवश्यकता होती है। उच्च सरप्राइज़ल का अर्थ है कि मस्तिष्क अधिक मेहनत कर रहा है।
- अपग्रेड: पिछले अध्ययनों में इन नंबरों का अनुमान लगाना पड़ता था या उन्हें धीरे-धीरे कैलकुलेट करना पड़ता था। यह नया पुस्तकालय पहले से ही इन नंबरों के साथ आता है, जिन्हें उन्नत AI मॉडल (जैसे GPT-2 और ट्रांसलेशन बॉट्स) द्वारा कैलकुलेट किया गया है। यह एक ऐसे पुस्तकालय की तरह है जहाँ हर शब्द के साथ पहले से ही एक "कठिनाई रेटिंग" छपी हुई है।
3. "फिलर पार्टिकल" डिटेक्टिव स्टोरी (The "Filler Particle" Detective Story)
अपने नए पुस्तकालय की प्रभावशीलता साबित करने के लिए, लेखों ने एक जासूसी कहानी चलाई। वे जानना चाहते थे: अनुवादक "अम्", "अह", या "हम्म" क्यों कहते हैं?
- पुराना सिद्धांत: लोग "अम्" तब कहते हैं जब वे इस बात को लेकर भ्रमित होते हैं कि वे क्या सुन रहे हैं।
- नई खोज: अपने नए "सरप्राइज़ल मीटर" का उपयोग करते हुए, उन्होंने पाया कि अनुवादक वास्तव में "अम्" तब कहते हैं जब वे अपनी भाषा में अगले शब्द को बनाने (formulate) के लिए संघर्ष कर रहे होते हैं, न कि इसलिए कि मूल शब्द समझने में कठिन था।
- उदाहरण: यह एक शेफ की तरह है जो एक जटिल सामग्री का स्वाद ले रहा है (भाषण सुनना) लेकिन फिर सोचने के लिए रुक जाता है, "मैं इस स्वाद का वर्णन ग्राहक को कैसे करूँ?" वह ठहराव ("अम्") खाना बनाने के दौरान होता है, न कि स्वाद लेने के दौरान।
4. "अलाइनमेंट" मैप (The "Alignment" Map)
पुस्तकालय में एक विस्तृत मानचित्र भी शामिल है जो दिखाता है कि स्रोत भाषा (जैसे जर्मन) के शब्द लक्ष्य भाषा (जैसे अंग्रेजी) के शब्दों के साथ कैसे मेल खाते हैं।
- कभी-कभी एक जर्मन शब्द तीन अंग्रेजी शब्दों में बदल जाता है।
- कभी-कभी एक पूरा वाक्य टुकड़ों में बंट जाता है।
- नया पुस्तकालय इन कनेक्शनों को पूरी तरह से मैप करता है, जिससे शोधकर्ता यह देख सकते हैं कि अनुवाद के दौरान विचारों को कैसे नया रूप दिया जाता है।
आपको इसकी परवाह क्यों करनी चाहिए?
इस कॉर्पस को मानव संचार के लिए एक हाई-टेक माइक्रोस्कोप के रूप में सोचें।
पहले, यदि आप यह अध्ययन करना चाहते थे कि भाषण का अनुवाद करना कितना कठिन है, तो आपको अपना खुद का माइक्रोस्कोप शून्य से बनाना पड़ता था, जिसमें वर्षों लग जाते थे। अब, लेखकों ने सभी को एक तैयार, सुपर-पावर्ड माइक्रोस्कोप थमा दिया है।
- शोधकर्ताओं के लिए: यह उनके वर्षों का काम बचाता है और उन्हें यह पूछने की अनुमति देता है कि हमारा मस्तिष्क भाषा को कैसे संभालता है।
- AI डेवलपर्स के लिए: यह बेहतर ट्रांसलेशन बॉट को प्रशिक्षित करने में मदद करता है क्योंकि यह उन्हें दिखाता है कि इंसान कहाँ संघर्ष करते हैं (वे "अम्" वाले क्षण)।
- सभी के लिए: यह हमें समझने में मदद करता है कि अनुवाद केवल शब्दों को बदलना नहीं है; यह एक जटिल मानसिक नृत्य है जहाँ मस्तिष्क लगातार गणना करता है कि अगला कदम कितना आश्चर्यजनक, कठिन या प्रवाहपूर्ण होना चाहिए।
संक्षेप में: उन्होंने राजनीतिक भाषणों के एक बिखरे हुए ढेर को लिया, उसे साफ किया, हर शब्द के साथ एक "मस्तिष्क-प्रयास" स्कोर जोड़ा, और यह साबित किया कि जब अनुवादक हिचकिचाते हैं, तो वे आमतौर पर यह बताने के लिए रुकते हैं कि मूल बात को कहने का सही तरीका क्या है, न कि इसलिए कि वे मूल बात को समझ नहीं पाए थे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।