DIETA: A Decoder-only transformer-based model for Italian-English machine TrAnslation
यह शोध पत्र DIETA को प्रस्तुत करता है, जो एक 0.5-बिलियन-पैरामीटर वाला डिकोडर-ओनली ट्रांसफॉर्मर मॉडल है जिसे एक क्यूरेटेड 207-मिलियन-वाक्य इतालवी-अंग्रेजी कॉर्पस और बैक-ट्रांसलेटेड डेटा पर प्रशिक्षित किया गया है, जो बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और इसके प्रशिक्षण स्क्रिप्ट, मॉडल, डेटा और एक नए मूल्यांकन सेट के सार्वजनिक रिलीज के साथ आता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसा अनुवादक बनाना चाहते हैं जो केवल दो भाषाएँ बोलता हो: इतालवी और अंग्रेजी। अधिकांश बड़ी तकनीकी कंपनियाँ "यूनिवर्सल ट्रांसलेटर" बनाती हैं जो एक साथ 100 भाषाएँ बोलने की कोशिश करते हैं। वे दुनिया के हर शब्दकोश से भरे भारी, विशाल बैकपैक की तरह होते हैं। वे शक्तिशाली तो होते हैं, लेकिन वे बहुत बड़े, चलाने में महंगे होते हैं, और कभी-कभी भ्रमित हो जाते हैं क्योंकि वे एक साथ बहुत सारी चीजें याद रखने की कोशिश कर रहे होते हैं।
इस शोध पत्र के लेखकों ने कुछ अलग बनाने का निर्णय लिया: एक विशेषज्ञ, हल्का अनुवादक जिसे DIETA कहा जाता है।
यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:
1. लक्ष्य: एक विशेषज्ञ एथलीट, न कि एक मैराथन धावक
हर भाषा बोलने के लिए एक विशाल मॉडल को प्रशिक्षित करने के बजाय (एक मैराथन धावक की तरह जो हर दूरी दौड़ने की कोशिश करता है), टीम ने केवल इतालवी और अंग्रेजी में सर्वश्रेष्ठ होने के लिए एक छोटा, 0.5-बिलियन-पैरामीटर वाला मॉडल प्रशिक्षित किया।
- रूपक: DIETA को एक स्प्रिंटर (धावक) के रूप में सोचें। इसे 100 भाषाओं का भार ढोने की आवश्यकता नहीं है; इसे बस इतालवी-अंग्रेजी ट्रैक पर अविश्वसनीय रूप से तेज़ और सटीक होने की आवश्यकता है।
2. प्रशिक्षण डेटा: "जिम"
किसी भी चीज़ में अच्छा होने के लिए, आपको अभ्यास की आवश्यकता होती है। टीम ने केवल कुछ पाठ्यपुस्तकों का उपयोग नहीं किया; उन्होंने 768 मिलियन अभ्यास वाक्यों के साथ एक विशाल जिम बनाया।
- वास्तविक सामग्री: उन्होंने संसदीय रिकॉर्ड, कानूनी दस्तावेज़, समाचार, फिल्में (सबटाइटल्स) और पुस्तकों जैसे स्थानों से लगभग 207 मिलियन वास्तविक वाक्य युग्म एकत्र किए।
- "घोस्ट" अभ्यास (बैक-ट्रांसलेशन): चूंकि उन्हें और अधिक अभ्यास की आवश्यकता थी, इसलिए उन्होंने "बैक-ट्रांसलेशन" नामक एक चतुर तकनीक का उपयोग किया। कल्पना कीजिए कि एक इतालवी समाचार लेख को लिया जाता है, कंप्यूटर के माध्यम से उसे अंग्रेजी में अनुवादित किया जाता है, और फिर कंप्यूटर को उस अंग्रेजी को वापस इतालवी में अनुवादित करने के लिए कहा जाता है। यह एक नया "सिंथेटिक" अभ्यास युग्म बनाता है। उन्होंने इस तरह लाखों बार किया ताकि एक विशाल 352 मिलियन वाक्यों का पुस्तकालय बनाया जा सके।
- परिणाम: मॉडल ने वास्तविक मानव लेखन और इस विशाल मात्रा में कंप्यूटर-जनित अभ्यास डेटा के मिश्रण पर अभ्यास किया।
3. नई परीक्षा: "ताज़ा समाचार" परीक्षा
आमतौर पर, अनुवाद मॉडल का परीक्षण पुराने, स्थिर डेटा पर किया जाता है। लेखकों ने महसूस किया कि यह आपको यह नहीं बताता कि क्या एक मॉडल आज की खबरों को संभाल सकता है।
- नवाचार: उन्होंने WikiNews-25 नामक एक नया टेस्ट सेट बनाया, जो 2025 के लेखों पर आधारित है।
- चुनौती: उन्होंने केवल किसी भी वाक्यों का उपयोग नहीं किया। उन्होंने गूगल द्वारा किए गए अनुवाद लिए, उनमें से गलत अनुवादों को खोजा, और मनुष्यों से उन्हें ठीक करवाया। इससे एक "गोल्ड स्टैंडर्ड" परीक्षा बनी जो विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन की गई है कि एक मॉडल वर्तमान, वास्तविक दुनिया की खबरों को कितनी अच्छी तरह संभालता है।
4. परिणाम: अपने वजन से कहीं अधिक प्रदर्शन करना
उन्होंने DIETA को 32 अन्य अनुवादकों के खिलाफ एक दौड़ में खड़ा किया, जिनमें छोटे मॉडल से लेकर 9 बिलियन पैरामीटर वाले विशाल मॉडल (उन भारी बैकपैक की तरह जिनका उल्लेख ऊपर किया गया है) तक शामिल थे।
- प्रदर्शन: भले ही DIETA छोटा (केवल 0.5 बिलियन पैरामीटर) है, इसने लगातार दूसरे-सर्वश्रेष्ठ समूह (दूसरे क्वार्टाइल) में स्थान प्राप्त किया।
- तुलना: इसने 3 बिलियन पैरामीटर से छोटे लगभग सभी अन्य मॉडलों को पीछे छोड़ दिया। वास्तव में, पांच में से चार अलग-अलग परीक्षणों में, इसने लगभग अन्य सभी छोटे मॉडलों से बेहतर प्रदर्शन किया।
- समझौता (Trade-off): यह 9-बिलियन-पैरामीटर वाले विशाल मॉडलों (यानी "सुपर-एथलीट्स") जितना पूर्ण नहीं था, लेकिन यह उनके बहुत करीब था। मुख्य क्षेत्र जहाँ दिग्गज जीत गए, वह था "रेफरेंस-फ्री" स्कोरिंग (बिना किसी सटीक उत्तर कुंजी के गुणवत्ता का अनुमान लगाना), लेकिन बाकी सब के लिए, DIETA ने कड़ी टक्कर दी।
5. यह क्यों महत्वपूर्ण है
शोध पत्र का दावा है कि बेहतरीन अनुवाद परिणाम प्राप्त करने के लिए आपको हमेशा एक विशाल, महंगे सुपरकंप्यूटर की आवश्यकता नहीं होती है।
- सीख: यदि आप अपने प्रशिक्षण डेटा को विशेष रूप से दो भाषाओं पर केंद्रित करते हैं और बहुत सारे स्मार्ट, सिंथेटिक अभ्यास डेटा का उपयोग करते हैं, तो एक छोटा, हल्का मॉडल वह काम कर सकता है जिसके लिए आमतौर पर बहुत बड़े, भारी मॉडल की आवश्यकता होती है।
- सुलभता: क्योंकि DIETA बहुत छोटा है, यह एक एकल उपभोक्ता ग्राफिक्स कार्ड (जैसे कि एक उच्च-स्तरीय गेमिंग पीसी) पर चल सकता है, जबकि विशाल मॉडलों के लिए विशाल डेटा केंद्रों की आवश्यकता होती है।
सारांश
लेखकों ने इतालवी और अंग्रेजी के लिए एक छोटा, विशिष्ट अनुवादक DIETA बनाया। उन्होंने इसे वास्तविक दस्तावेजों और कंप्यूटर-जनित अभ्यास वाक्यों के विशाल मिश्रण पर प्रशिक्षित किया। परिणाम? एक छोटा मॉडल जो दिग्गजों के लगभग समान प्रदर्शन करता है, जो यह सिद्ध करता है कि विशेष प्रशिक्षण और स्मार्ट डेटा, विशाल आकार को हरा सकते हैं।
उन्होंने मॉडल, प्रशिक्षण डेटा और नया टेस्ट सेट सभी के लिए उपलब्ध करा दिया है ताकि अन्य लोग इससे सीख सकें और इससे भी बेहतर उपकरण बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।