Towards Cultural Bridge by Bahnaric-Vietnamese Translation Using Transfer Learning of Sequence-To-Sequence Pre-training Language Model
यह शोध पत्र बानारिक संसाधनों की कमी को दूर करने और सांस्कृतिक सेतु निर्माण के लिए प्रभावी बानारिक-वियतनामी मशीन अनुवाद प्राप्त करने हेतु, डेटा संवर्धन और अनुमानी विधियों द्वारा संवर्धित, एक अनुक्रम-से-अनुक्रम पूर्व-प्रशिक्षित वियतनामी भाषा मॉडल का उपयोग करते हुए एक ट्रांसफर लर्निंग दृष्टिकोण प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ हर भाषा एक अनूठा, हलचल भरा शहर है। कुछ शहर, जैसे अंग्रेजी या वियतनामी, विशाल महानगर हैं जिनमें गगनचुंबी इमारतें, अनंत पुस्तकालय और लाखों लोग एक-दूसरे को निर्देश देते हुए चिल्ला रहे हैं। लेकिन फिर कुछ छोटे, छिपे हुए गाँव भी हैं—कुछ सौ निवासियों वाले छोटे समुदाय, जहाँ बुजुर्ग कहानियों को अपने दिमाग में संजोए रखते हैं, लेकिन वहाँ कोई सड़क के संकेत, कोई मानचित्र या कोई मार्गदर्शिका नहीं है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "शहर" भाषाएँ हैं, और "मार्गदर्शिकाएँ" टेक्स्ट डेटा के वे विशाल ढेर हैं जिनकी कंप्यूटर को बोलना सीखने के लिए आवश्यकता होती है।
लंबे समय तक, AI अनुवादक उन पर्यटकों की तरह थे जो केवल बड़े महानगरों में नेविगेट करना जानते थे। यदि आप उनसे किसी छोटे गाँव की भाषा में अनुवाद करने के लिए कहते, तो वे बस खाली नज़रें टिका देते या अपनी ओर से कुछ बना लेते, क्योंकि उन्होंने नियमों को सीखने के लिए पर्याप्त उदाहरण नहीं देखे थे। यह "लो-रिसोर्स" (कम संसाधन वाली) भाषाओं की समस्या है: कंप्यूटर के दिमाग को प्रशिक्षित करने के लिए पर्याप्त डेटा नहीं है। लेकिन क्या होगा यदि हम कंप्यूटर को एक छोटा गाँव की भाषा बोलना सिखा सकें, पहले उसे बड़े शहर की भाषा सिखाकर, और फिर उसे कुछ विशेष संकेत दिखाकर? यह "ट्रांसफर लर्निंग" का जादू है। इसे एक मास्टर शेफ की तरह समझें जिसने पहले से ही एक हज़ार फ्रांसीसी व्यंजन बनाना सीख लिया है; यदि आप उन्हें किसी विशिष्ट स्थानीय स्टू (stew) की कुछ रेसिपी दे दें, तो वे अपने कौशल को अनुकूलित करके उसे पूरी तरह से बनाने में सक्षम हो सकते हैं, भले ही उन्होंने पहले कभी उस सटीक स्टू को न देखा हो। यह शोध पत्र ठीक इसी चुनौती में उतरता है: AI को वियतनामी और बानारिक (Bahnaric) के बीच के अंतर को पाटने में मदद करना, जो वियतनाम के एक जातीय अल्पसंख्यक द्वारा बोली जाने वाली एक सुंदर लेकिन डेटा-दुर्लभ भाषा है।
इस अध्ययन के पीछे के शोधकर्ताओं ने बानरिक लोगों और वियतनामी भाषी बहुसंख्यक आबादी के बीच एक डिजिटल सेतु बनाने का लक्ष्य रखा। उनका मुख्य उद्देश्य एक ऐसा मशीन ट्रांसलेशन सिस्टम बनाना था जो बानरिक टेक्स्ट को वियतनामी में बदल सके, बावजूद इसके कि उनके पास काम करने के लिए बहुत कम "पाठ्यपुस्तकें" (द्विभाषी डेटा) उपलब्ध थीं। उन्होंने पाया कि केवल एक मानक AI मॉडल को इस समस्या पर थोपना प्रभावी नहीं रहा क्योंकि डिजिटल दुनिया में बानरिक भाषा बहुत दुर्लभ है। इसके बजाय, उन्होंने ट्रांसफर लर्निंग नामक एक चतुर तकनीक का उपयोग किया। उन्होंने एक सुपर-स्मार्ट AI मॉडल से शुरुआत की जिसने पहले से ही वियतनामी भाषा की बारीकियों को सीख लिया था (एक "बड़े शहर" की भाषा)। फिर, उन्होंने इस मॉडल को बानरिक-वियतनामी वाक्य युग्मों (sentence pairs) का एक छोटा, विशेष आहार दिया ताकि यह नई भाषा सीख सके।
इसे और भी बेहतर बनाने के लिए, टीम ने एक दो-चरणीय प्रक्रिया का आविष्कार किया। सबसे पहले, उन्होंने बानरिक के लिए एक कस्टम "वर्ड स्प्लिटर" (शब्द विभाजक) बनाया। चूंकि बानरिक शब्द जटिल हो सकते हैं और अक्सर आपस में जुड़े रहते हैं, इसलिए कंप्यूटर को वाक्यों को सार्थक टुकड़ों में तोड़ने के लिए मदद की आवश्यकता थी। इनमें से कुछ टुकड़े अनुवाद के लिए आसान थे क्योंकि वे एक डिक्शनरी में थे (जैसे "एंकर" शब्द), लेकिन अन्य पेचीदा "टुकड़े" थे जिन्हें समझने के लिए AI की दिमागी शक्ति की आवश्यकता थी। AI, जो BARTpho नामक मॉडल पर आधारित है, को इन कठिन टुकड़ों को संभालने के लिए फाइन-ट्यून किया गया था।
लेकिन टीम यहीं नहीं रुकी। उन्हें एहसास हुआ कि बेहतरीन AI के साथ भी, उनके पास पर्याप्त डेटा नहीं है। इसलिए, उन्होंने डेटा ऑग्मेंटेशन नामक तकनीक का उपयोग करके अपने डेटा के साथ "कल्पना" का खेल खेला। कल्पना कीजिए कि आपके पास बिल्ली की एक अकेली फोटो है, और आप कंप्यूटर को सिखाना चाहते हैं कि बिल्ली कैसी दिखती है। आप उस फोटो को ले सकते हैं, उसे पलट सकते हैं, रंग बदल सकते हैं, या उसे क्रॉप करके पाँच नई "नकली" फोटो बना सकते हैं। शोधकर्ताओं ने अपने वाक्यों के साथ भी ऐसा ही किया। उन्होंने नए, सिंथेटिक प्रशिक्षण उदाहरण बनाने के लिए शब्दों को इधर-उधर बदलने, शब्दों को छिपाने या वाक्य के हिस्सों को मिलाने जैसे तरीकों का उपयोग किया। इसने उनके प्रशिक्षण डेटासेट के आकार को दोगुना कर दिया, जिससे AI को वास्तविक दुनिया के अधिक वक्ताओं को खोजने की आवश्यकता के बिना अधिक अभ्यास मिला।
परिणाम काफी उत्साहजनक थे। जब उन्होंने अपने कस्टम सिस्टम, जिसे BV-BARTpho कहा जाता है, का परीक्षण अन्य मानक AI मॉडलों के मुकाबले किया, तो यह शीर्ष पर रहा। मानक मॉडलों ने एक "BLEU स्कोर" (अनुवाद सटीकता मापने का एक तरीका) लगभग 20 से 30 प्राप्त किया। हालाँकि, उनके कस्टम मॉडल ने, जिसने विशेष वर्ड स्प्लिटर और डेटा ऑग्मेंटेशन ट्रिक्स का उपयोग किया था, बानरिक से वियतनामी में अनुवाद करने के लिए 33.58 का स्कोर हासिल किया। इससे भी दिलचस्प बात यह है कि जब उन्होंने विशेष रूप से वियतनामी से बानरिक में अनुवाद के लिए डेटा ऑग्मेंटेशन तकनीकों का परीक्षण किया, तो ये विधियाँ वास्तव में चमक उठीं। शब्दों को बदलने और छिपाने (विशेष रूप से "स्वैप" और "टोकन") के संयोजन का उपयोग करके, उन्होंने स्कोर को 33.58 के बेसलाइन से बढ़ाकर सीधे 49.61 तक पहुँचा दिया।
यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण इस विशिष्ट कार्य के लिए अत्यधिक प्रभावी है। यह सिद्ध करता है कि AI को एक दुर्लभ भाषा सिखाने के लिए आपको डेटा के पहाड़ की आवश्यकता नहीं है; आपको बस अपने पास मौजूद थोड़े से डेटा का स्मार्ट तरीके से उपयोग करने की आवश्यकता है, जिसे एक संबंधित भाषा जानने वाले मॉडल के साथ जोड़ा जा सके। बानरिक से वियतनामी का सफलतापूर्वक अनुवाद करके, शोधकर्ता बानरिक संस्कृति को संरक्षित करने और दोनों जातीय समूहों के बीच आपसी समझ को आसान बनाने की आशा करते हैं। हालांकि यह शोध पत्र यह दावा नहीं करता है कि यह दुनिया की हर भाषा के लिए एक पूर्ण, हल की गई समस्या है, लेकिन यह इस विशिष्ट सांस्कृतिक सेतु के लिए एक बहुत मजबूत, कामकाजी समाधान दिखाता है, जो रचनात्मकता और स्मार्ट कंप्यूटिंग के माध्यम से एक कठिन अनुवाद कार्य को एक प्रबंधनीय कार्य में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।