Building Large-Scale English-Romanian Literary Translation Resources with Open Models
यह शोध पत्र टिनीफैबुलिस्ट ट्रांसलेशन फ्रेमवर्क (TF2) का परिचय देता है, जो एक एकीकृत पाइपलाइन है जो उच्च-गुणवत्ता वाले अंग्रेजी-से-रोमानियाई साहित्यिक अनुवाद के लिए एक लागत प्रभावी, ओपन 12B-पैरामीटर मॉडल बनाने के लिए सिंथेटिक डेटा और दो-चरणीय फाइन-ट्यूनिंग प्रक्रिया का लाभ उठाता है, साथ ही बड़े पैमाने के डेटासेट और मूल्यांकन उपकरणों को भी जारी करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए एक ऐसी दुनिया की जहाँ कहानियाँ संस्कृति की मुद्रा हैं, लेकिन कुछ भाषाएँ द्वीपों की तरह हैं जो शेष दुनिया से जुड़ने के लिए बहुत कम पुलों से जुड़ी हैं। यह मशीन ट्रांसलेशन (मशीनी अनुवाद) की चुनौती है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जो कंप्यूटर को विभिन्न भाषाएँ बोलना सिखाने की कोशिश करती है। आमतौर पर, ये कंप्यूटर मनुष्यों द्वारा लिखी गई लाखों किताबों और समाचार लेखों को पढ़कर सीखते हैं। लेकिन कई भाषाओं के लिए, विशेष रूप से उन भाषाओं के लिए जो कम लोग बोलते हैं, कंप्यूटर को सिखाने के लिए पर्याप्त किताबें उपलब्ध नहीं हैं। यह इतालवी खाना बनाना सीखने जैसा है जब आपने कभी कोई रेसिपी न देखी हो या टमाटर का स्वाद न चखा हो।
इसे हल करने के लिए, वैज्ञानिकों ने लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करना शुरू कर दिया है। इन्हें सुपर-स्मार्ट, डिजिटल शेफ के रूप में सोचें जिन्होंने दुनिया के लगभग हर व्यंजन का स्वाद चखा है और वे अनुमान लगा सकते हैं कि एक नई रेसिपी का स्वाद कैसा होना चाहिए। हालाँकि, इन शेफ को साहित्य सिखाना—भावनाओं, चुटकुलों और सांस्कृतिक रहस्यों वाली कहानियाँ—एक समाचार रिपोर्ट का अनुवाद करने की तुलना में बहुत कठिन है। और रोमानिया जैसी भाषा के लिए ऐसा करना, जिसके पास अंग्रेजी की तुलना में कम डिजिटल संसाधन हैं, एक बहुत ही सीमित सामग्री और तंग बजट वाले किचन में एक परफेक्ट केक बनाने जैसा है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं: क्या हम बहुत अधिक पैसा खर्च किए बिना या सुपर-कंप्यूटर की आवश्यकता के बिना, अनुवादित कहानियों का एक उच्च-गुणवत्ता वाला पुस्तकालय बना सकते हैं?
द स्टोरी ऑफ द टाइनी फैबुलिस्ट (नन्हे कथाकार की कहानी)
इस शोध पत्र में, रोमानिया के शोधकर्ताओं की एक टीम एक नया प्रोजेक्ट पेश करती है जिसे TF2 (TinyFabulist Translation Framework) कहा जाता है। उनका लक्ष्य अनुवादित उपदेशात्मक कहानियों (fables)—जो ईसप की कहानियों जैसी छोटी, नैतिक कहानियाँ होती हैं—का एक विशाल पुस्तकालय बनाना था, जो अंग्रेजी से रोमानियाई में परिवर्तित हो। वे यह देखना चाहते थे कि क्या वे इसे महंगे, निजी टूल्स के बजाय "ओपन" मॉडल्स (मुफ्त, सार्वजनिक AI टूल्स) का उपयोग करके और एक बहुत ही कम बजट पर कर सकते हैं।
रेसिपी: शून्य से एक पुस्तकालय का निर्माण
शोधकर्ताओं को पता था कि वे केवल लाखों कहानियों को अनुवाद करने के लिए मनुष्यों से नहीं कह सकते; इसमें बहुत समय और लागत लगेगी। इसके बजाय, उन्होंने डेटा को स्वयं बनाने के लिए एक चार-चरणीय असेंबली लाइन बनाई:
- द टेस्ट ऑफ टेस्ट (चरण 1): सबसे पहले, उन्होंने 13 अलग-अलग AI मॉडल्स (कुछ मुफ्त, कुछ सशुल्क) का परीक्षण किया ताकि यह देखा जा सके कि कौन सा मॉडल कुछ नमूना कहानियों का अनुवाद करने में सबसे अच्छा है। उन्होंने केवल यह नहीं देखा कि शब्द मेल खाते हैं या नहीं; उन्होंने AI से अनुवादों को पाँच चीजों पर ग्रेड देने के लिए कहा: सटीकता, प्रवाह, कहानी का तर्क, शैली और सांस्कृतिक सामंजस्य। विजेता एक शक्तिशाली मॉडल था जिसे GPT-o3 कहा जाता है, जो बाकी पुस्तकालय को बनाने के लिए उनका "गोल्ड स्टैंडर्ड" बन गया।
- द सिल्वर स्टैंडर्ड (चरण 2): उस विजेता मॉडल का उपयोग करते हुए, उन्होंने 15,000 अंग्रेजी कहानियों को रोमानियाई में अनुवादित किया। भले ही ये मशीनों द्वारा बनाई गई थीं, लेकिन ये इतनी अच्छी थीं कि शोधकर्ताओं ने उन्हें "सिल्वर स्टैंडर्ड" (स्वर्ण के लगभग समान) के रूप में माना ताकि अपने स्वयं के कस्टम मॉडल्स को प्रशिक्षित किया जा सके।
- द स्पेशलाइज्ड ट्रेनिंग (चरण 3): यह जादुई हिस्सा है। उन्होंने ओपन-सोर्स AI मॉडल्स (विशेष रूप से Gemma के संस्करण, जो 1-बिलियन पैरामीटर से लेकर 12-बिलियन पैरामीटर तक के हैं) को लिया और उन्हें एक विशेष "फिनिशिंग स्कूल" दिया। उन्होंने LoRA (Low-Rank Adaptation) नामक तकनीक का उपयोग किया, जो एक सामान्य-उद्देश्य वाले शेफ को पूरे किचन को फिर से बनाए बिना कहानियों के लिए एक विशिष्ट कुकबुक देने जैसा है। उन्होंने इन मॉडल्स को उन 15,000 अनुवादित कहानियों पर प्रशिक्षित किया।
- द मास प्रोडक्शन (चरण 4): अंत में, उन्होंने अपने नए प्रशिक्षित, विशिष्ट मॉडल्स का उपयोग मूल अंग्रेजी संग्रह से शेष 3 मिलियन कहानियों का अनुवाद करने के लिए किया। परिणाम स्वरूप एक विशाल नया डेटासेट प्राप्त हुआ जिसे DS-TF2-EN-RO-3M कहा जाता है, जिसमें तीन मिलियन अंग्रेजी और रोमानियाई कहानियों के जोड़े शामिल हैं।
परिणाम: छोटे मॉडल्स, बड़े आश्चर्य
शोधकर्ताओं ने फिर अपने नए, प्रशिक्षित मॉडल्स का परीक्षण बड़े, महंगे और निजी मॉडल्स (जैसे GPT-4 और DeepL) और मूल, अनप्रशिक्षित ओपन मॉडल्स के विरुद्ध किया।
- द गैप क्लोज्ड (अंतर कम हुआ): उनका सर्वश्रेष्ठ ओपन मॉडल, TF2-12B (12-बिलियन पैरामीटर वाला संस्करण), अविश्वसनीय रूप से अच्छा प्रदर्शन करता है। इसने उनके गुणवत्ता मानदंड पर 5 में से औसतन 4.83 का स्कोर किया, जबकि शीर्ष निजी मॉडल (GPT-o3) ने 4.92 का स्कोर किया। उनके मुफ्त, कस्टम-प्रशिक्षित मॉडल और महंगे, प्रोप्रायटरी दिग्गज के बीच का अंतर बहुत कम था—0.1 अंक से भी कम।
- लागत का अंतर: यहीं से कहानी वास्तव में रोमांचक हो जाती है। महंगे निजी API का उपयोग करके सभी 3 मिलियन कहानियों का अनुवाद करने में 32,400 के बीच खर्च होता (यह इस पर निर्भर करता कि आपने कौन सा मॉडल चुना)। इसके विपरीत, उनके ओपन-सोर्स TF2 मॉडल ने लगभग $350 में वही काम किया। यह 97% से 99% की बचत है।
- छोटे मॉडल्स: यहाँ तक कि उनके सबसे छोटे मॉडल (1 बिलियन पैरामीटर) ने, प्रशिक्षण के बाद, अपने स्कोर को 2.02 से बढ़ाकर 3.75 कर दिया। यह परफेक्ट नहीं था, लेकिन यह "बमुश्किल समझ में आने योग्य" से "काफी अच्छा" हो गया, जिससे यह सिद्ध हुआ कि यदि उन्हें सही तरीके से सिखाया जाए तो छोटे, सस्ते कंप्यूटर भी कहानियाँ सुनाना सीख सकते हैं।
उन्होंने क्या पाया (और क्या नहीं)
शोध पत्र सुझाव देता है कि उच्च-गुणवत्ता वाले साहित्यिक अनुवाद उपकरण बनाने के लिए आपको अरबपति होने की आवश्यकता नहीं है। एक स्मार्ट, चरण-दर-चरण प्रक्रिया का उपयोग करके और कहानियों के एक विशिष्ट प्रकार (उपदेशात्मक कहानियों) पर ध्यान केंद्रित करके, उन्होंने दिखाया कि ओपन मॉडल्स दिग्गजों के साथ प्रतिस्पर्धा कर सकते हैं।
हालाँकि, लेखक कुछ बातों को नोट करने में सावधानी बरतते हैं:
- यह अभी भी पूर्ण नहीं है: हालांकि ओपन मॉडल्स करीब हैं, लेकिन निजी मॉडल्स (जैसे GPT-o3) विशेष रूप से शैली और सांस्कृतिक बारीकियों में थोड़ा अधिक स्कोर करते हैं। ओपन मॉडल्स एक बेहतरीन विकल्प हैं, लेकिन उन्होंने हर मामले में मानव-स्तर की अनुवाद गुणवत्ता से मेल खाने की समस्या को पूरी तरह से "हल" नहीं किया है।
- "गोल्ड स्टैंडर्ड" वास्तव में सिल्वर है: उन्होंने जिन संदर्भ अनुवादों का उपयोग अपने मॉडल्स को प्रशिक्षित करने के लिए किया, वे एक अन्य AI द्वारा बनाए गए थे, न कि मानव द्वारा। इसका मतलब है कि मॉडल्स अन्य AI की तरह सुनाई देने के लिए सीख रहे हैं, न कि अनिवार्य रूप से मानव अनुवादकों की तरह। शोधकर्ताओं ने एक मानव विशेषज्ञ से कहानियों के एक छोटे नमूने की जांच करवाकर इसकी पुष्टि की, और मानव इस बात से सहमत था कि AI रैंकिंग आम तौर पर सही थी, लेकिन वे स्वीकार करते हैं कि 100% निश्चित होने के लिए एक बड़े मानव अध्ययन की आवश्यकता है।
- कहानियाँ (Fables) विशेष हैं: उपदेशात्मक कहानियाँ छोटी होती हैं और उनकी एक स्पष्ट संरचना होती है। शोधकर्ताओं का सुझाव है कि जबकि यह तरीका कहानियों के लिए बहुत अच्छा काम करता है, इसे गहरे रूपकों या ऐतिहासिक संवादों वाले जटिल उपन्यासों पर लागू करना कठिन हो सकता है।
मुख्य निष्कर्ष (The Takeaway)
TF2 प्रोजेक्ट यह दिखाने जैसा है कि आप सोने के भंडार के बजाय पुनर्चक्रित (recycled) सामग्री और थोड़ी सी चतुराई का उपयोग करके एक शानदार पुस्तकालय बना सकते हैं। उन्होंने साबित किया कि सही प्रशिक्षण डेटा और एक चतुर, लागत प्रभावी दृष्टिकोण के साथ, ओपन-सोर्स AI रोमानिया जैसी भाषाओं के लिए साहित्यिक सामग्री का एक अंश लागत पर अनुवाद कर सकता है। उन्होंने अपना सारा कोड, अपना 3-मिलियन-कहानी का डेटासेट और अपने प्रशिक्षित मॉडल्स को सार्वजनिक रूप से जारी कर दिया है, और सभी को अपने काम पर आगे बढ़ने के लिए आमंत्रित किया है। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ AI हर संस्कृति की कहानियों को संरक्षित करने और साझा करने में मदद कर सकता है, चाहे उस संस्कृति के पास तकनीक पर खर्च करने के लिए कितना भी पैसा क्यों न हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।