Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?
यह शोध पत्र शास्त्रीय चीनी से अंग्रेजी अनुवाद के लिए मौजूदा स्वचालित मूल्यांकन मेट्रिक्स की विश्वसनीयता की जांच करता है, जो यह प्रकट करता है कि हालांकि सभी मेट्रिक्स की अपनी कमियां हैं, फिर भी MetricX24 का प्रदर्शन सर्वश्रेष्ठ है, जिससे ऐतिहासिक और सांस्कृतिक रूप से विशिष्ट अनुवाद परिवेशों के लिए अधिक सुदृढ़ और व्याख्या योग्य मेट्रिक्स की तत्काल आवश्यकता रेखांकित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आपके पास जो एकमात्र सुराग हैं वे एक ऐसी भाषा में लिखे गए हैं जो दो हज़ार साल पहले बोली जाती थी। यह शास्त्रीय चीनी (Classical Chinese) का अध्ययन करने वाले विद्वानों की दैनिक वास्तविकता है, जो सम्राटों, दार्शनिकों और कवियों की प्राचीन भाषा है। आज, हमारे पास 'लार्ज लैंग्वेज मॉडल्स' (LLMs) नामक सुपर-स्मार्ट कंप्यूटर दिमाग हैं जो इन प्राचीन ग्रंथों को पढ़ सकते हैं और उन्हें आधुनिक अंग्रेजी में अनुवाद कर सकते हैं। यह एक जादुई टाइम मशीन होने जैसा है जो धूल भरे स्क्रॉल को पठनीय कहानियों में बदल देती है। लेकिन इसमें एक पेंच है: हमें कैसे पता चलेगा कि मशीन मनगढ़ंत बातें नहीं बना रही है? यदि कंप्यूटर "कौए" के लिए एक शब्द को "कबूतर" के रूप में अनुवादित करता है, या एक राजा को बदलकर "ड्यूक" कर देता है, तो पूरी कहानी बर्बाद हो सकती है।
यह जांचने के लिए कि क्या कंप्यूटर अच्छा काम कर रहा है, वैज्ञानिक "इवैल्यूएशन मेट्रिक्स" (मूल्यांकन मीट्रिक) का उपयोग करते हैं। इन मेट्रिक्स को स्वचालित न्यायाधीशों या स्पेल-चेकर्स के रूप में समझें जो अनुवाद को एक स्कोर देते हैं। आमतौर पर, ये न्यायाधीश आधुनिक भाषाओं जैसे फ्रेंच या स्पेनिश पर प्रशिक्षित होते हैं। वे शब्दों के मिलान या समान वाक्य संरचनाओं जैसी चीजों को देखते हैं। लेकिन शास्त्रीय चीनी एक अनिश्चित तत्व है। यह अविश्वसनीय रूप से संक्षिप्त है, संदर्भ (context) पर बहुत अधिक निर्भर करती है, और अक्सर उन कर्ताओं या कर्मों को छोड़ देती है जिनकी आधुनिक भाषाओं को आवश्यकता होती है। एक अनुवाद जो एक आधुनिक अंग्रेजी बोलने वाले के लिए एकदम सही लग सकता है, वह वास्तव में प्राचीन पाठ के बारे में एक पूर्ण झूठ हो सकता है। बड़ा सवाल यह है: क्या हमारे वर्तमान स्वचालित न्यायाधीश इन प्राचीन-विशिष्ट गलतियों को पकड़ सकते हैं, या वे आधुनिक व्याकरण के नियमों को देखने में इतने व्यस्त हैं कि ऐतिहासिक त्रुटियों पर ध्यान ही नहीं दे पा रहे हैं?
यह शोध पत्र उन स्वचालित न्यायाधीशों को परखता है। शोधकर्ताओं ने "मिनिमल पेयर्स" (न्यूनतम युग्म) नामक एक चतुर तकनीक का उपयोग करके अनुवाद मीट्रिक के लिए एक विशेष "परीक्षा" बनाई। कल्पना कीजिए कि आपके पास एक प्राचीन वाक्य का एक आदर्श अनुवाद है। अब, आप उस वाक्य को लेते हैं और उसमें एक बहुत छोटा, विशिष्ट परिवर्तन करते—जैसे "कौए" को "कबूतर" से बदलना या बोलने वाले व्यक्ति का नाम हटा देना। यह एक "टूटे हुए" संस्करण को बनाता है जो मूल के लगभग समान है लेकिन जिसमें एक विशिष्ट त्रुटि है। शोधकर्ताओं ने फिर मूल संस्करण और टूटे हुए संस्करण दोनों को विभिन्न अनुवाद मीट्रिक्स को दिया ताकि यह देखा जा सके कि क्या मीट्रिक्स टूटे हुए संस्करण को कम स्कोर देते हैं।
परिणाम थोड़े मिले-जुले रहे, जिससे पता चला कि यहाँ तक कि सबसे स्मार्ट स्वचालित न्यायाधीशों की भी अपनी "अंध बिंदु" (blind spots) होती हैं। अध्ययन में पाया गया कि जबकि कुछ मीट्रिक्स स्पष्ट आपदाओं (जैसे पूरे पाठ को अंग्रेजी के बजाय आधुनिक चीनी में अनुवादित करना) को पकड़ने में अच्छे हैं, वे अक्सर उन सूक्ष्म, खतरनाक त्रुटियों को पकड़ने में विफल रहते हैं जो इतिहासकारों के लिए सबसे महत्वपूर्ण होती हैं। उदाहरण के लिए, कई मीट्रिक्स ने यह ध्यान नहीं दिया जब अनुवाद में काल (tense) गलत हो गया (जैसे "है" को "था" में बदलना) या जब "ड्यूक" जैसे विशिष्ट पद को "किंग" से बदल दिया गया। ये वे प्रकार की गलतियाँ हैं जो किसी विद्वान को इतिहास के बारे में गलत निष्कर्ष पर ले जा सकती हैं।
परीक्षण किए गए सभी न्यायाधीशों में से, MetricX24 नामक एक ने समग्र रूप से सबसे अच्छा प्रदर्शन किया। यह त्रुटियों के प्रति सबसे अधिक संवेदनशील था, जिसने कई टूटे हुए अनुवादों को सही ढंग से दंडित किया। हालाँकि, MetricX24 भी पूर्ण नहीं था; इसने कुछ प्रकार की त्रुटियों को मिस कर दिया, विशेष रूप से शब्दों के आधुनिक बनाम प्राचीन अर्थों से संबंधित। दूसरी ओर, मीट्रिक्स एक चीज़ में बहुत अच्छे थे: उन्होंने हानिरहित परिवर्तनों को दंडित नहीं किया। यदि अनुवाद ने नाम को प्रारूपित करने का थोड़ा अलग तरीका इस्तेमाल किया या वाक्य को किसी अन्य वैध स्थान पर तोड़ा, तो मीट्रिक्स ने ज्यादातर इसे पास कर दिया। यह अच्छी खबर है, क्योंकि इसका मतलब है कि न्यायाधीश शैली के मामले में बहुत सख्त नहीं हैं।
अंततः, यह शोध पत्र सुझाव देता है कि हम प्राचीन अनुवादों का मूल्यांकन करने के लिए केवल वर्तमान उपकरणों पर भरोसा नहीं कर सकते। ये मीट्रिक्स उन चश्मों की तरह हैं जो आधुनिक सड़कों के लिए डिज़ाइन किए गए हैं; वे वहां अच्छा काम करते हैं, लेकिन जब आप प्राचीन इतिहास की संकरी, घुमावदार गलियों में नेविगेट करने की कोशिश करते हैं, तो वे धुंधले हो जाते हैं। लेखक प्रस्ताव देते हैं कि डिजिटल मानविकी के लिए विश्वसनीय अनुवाद प्राप्त करने के लिए, हमें नए, स्मार्ट मूल्यांकन उपकरणों की आवश्यकता है जो विशेष रूप से शास्त्रीय चीनी की अनूठी विशेषताओं को समझने के लिए प्रशिक्षित हों, न कि केवल प्राचीन ग्रंथों पर आधुनिक नियम लागू करें। तब तक, मानव विशेषज्ञों को हमारे AI टाइम मशीनों के काम की दोबारा जांच करनी होगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।