Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM
यह शोध पत्र प्रदर्शित करता है कि केवल अंग्रेजी वाले कैलिब्रेशन सेट्स को विविध, भाषा-विशिष्ट या बहुभाषी डेटा से बदलने से क्वांटाइज्ड बहुभाषी एलएलएम (LLMs) की परप्लेक्सिटी में महत्वपूर्ण सुधार होता है, जो यह दर्शाता है कि विभिन्न भाषाओं और क्वांटाइजेशन विधियों में सुदृढ़ प्रदर्शन के लिए भाषाई संरेखण अत्यंत महत्वपूर्ण है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय (एक लार्ज लैंग्वेज मॉडल) है जो दर्जनों भाषाएँ बोलना जानता है। हालाँकि, यह पुस्तकालय इतना बड़ा है कि यह पूरे गोदाम की जगह घेर लेता है और इसे चलाने के लिए एक विशाल, महंगे जनरेटर की आवश्यकता होती है। इसे एक छोटे से शेड में फिट करने और एक मानक बिजली के आउटलेट पर चलाने के लिए, आपको इसे "कंप्रेस" (संकुचित) करने की आवश्यकता है। इस प्रक्रिया को क्वांटाइजेशन (quantization) कहा जाता है।
क्वांटाइजेशन को एक यात्रा के लिए सूटकेस पैक करने जैसा समझें। आपको सब कुछ अंदर ठूसने के लिए मजबूर होना पड़ता है, जिसका अर्थ है कि आपको कपड़ों को कसकर मोड़ना होगा या कुछ चीजें पीछे छोड़नी होंगी। यदि आप खराब तरीके से पैक करते हैं, तो आपके कपड़े सिकुड़े हुए निकल सकते हैं, और आप अपना टूथब्रश भूल सकते हैं। AI की दुनिया में, "सिकुड़े हुए कपड़े" का अर्थ है कि मॉडल अधिक गलतियाँ करता है, और "टूथब्रश भूलने" का अर्थ है कि वह कुछ भाषाओं को अच्छी तरह से बोलने की क्षमता खो देता है।
समस्या: "केवल अंग्रेजी" पैकिंग सूची
लंबे समय तक, जब लोग इन AI सूटकेस को पैक कर रहे थे, तो वे एक विशिष्ट पैकिंग सूची (जिसे "कैलिब्रेशन सेट" कहा जाता है) का उपयोग करते थे जो पूरी तरह से अंग्रेजी में लिखी गई थी। उन्होंने मान लिया था कि यदि सूटकेस अंग्रेजी के लिए अच्छी तरह से पैक किया गया है, तो यह फ्रेंच, स्वाहिली या चीनी के लिए भी ठीक रहेगा।
इस शोध पत्र के लेखकों ने पूछा: "क्या एक बहुभाषी सूटकेस को केवल एक अंग्रेजी चेकलिस्ट का उपयोग करके पैक करना उचित है?"
उन्होंने इसे परीक्षण करने के लिए एक ही AI मॉडल (Llama3.1 और Qwen2.5) को विभिन्न पैकिंग सूचियों के साथ पैक किया:
- केवल अंग्रेजी: पुराना मानक।
- एकल-भाषा: केवल फ्रेंच में, या केवल स्वाहिली में, आदि की एक सूची।
- बहुभाषी (Multilingual): सब कुछ का एक मिला-जुला मिश्रण।
बड़ी खोज
परिणाम स्पष्ट थे: एक बहुभाषी सूटकेस के लिए "केवल अंग्रेजी" वाली पैकिंग सूची सबसे खराब विकल्प थी।
- "एक ही आकार सबके लिए" वाला मिथक: एक बहुभाषी मॉडल को पैक करने के लिए अंग्रेजी सूची का उपयोग करना, बूट्स के लिए डिज़ाइन किए गए बॉक्स में बूट्स, सैंडल और एक विंटर कोट को फिट करने की कोशिश करने जैसा है। यह सही से फिट नहीं बैठता। जब मॉडल को अंग्रेजी डेटा के साथ पैक किया गया, तो गैर-अंग्रेजी भाषाओं में इसका प्रदर्शन खराब रहा।
- बहुभाषी मिश्रण जीतता है: जब उन्होंने एक बहुभाषी पैकिंग सूची (कई भाषाओं का मिश्रण) का उपयोग किया, तो मॉडल सूटकेस से बहुत कम सिकुड़ा हुआ बाहर आया। इसने सभी भाषाओं को बेहतर ढंग से बोला, गलतियाँ कम हुईं। कुछ मामलों में, इसने मॉडल के "परप्लेक्सिटी" (एक स्कोर जो बताता है कि मॉडल कितना भ्रमित है) को काफी हद तक सुधार दिया—3.5 अंक तक कम हो गया, जो AI में एक बहुत बड़ी बात है।
ऐसा क्यों होता है? ("पूंछ" का सादृश्य)
यह शोध पत्र इसे "एक्टिवेशन टेल्स" (activation tails) की अवधारणा का उपयोग करके समझाता है।
कल्पना कीजिए कि AI मॉडल पियानो बजाने वाला एक संगीतकार है।
- अंग्रेजी डेटा पियानो की केवल बीच की कुंजियों (keys) पर अभ्यास करने जैसा है।
- बहुभाषी डेटा संगीतकार को बहुत कम बेस नोट्स और बहुत ऊंचे, तीखे हाई नोट्स पर भी अभ्यास करने के लिए मजबूर करता है।
जब आप मॉडल को कंप्रेस करते हैं, तो आपको यह तय करना होता है कि स्वर (notes) कितने तेज या धीमे हो सकते हैं। यदि आपने केवल बीच की कुंजियों (अंग्रेजी) पर अभ्यास किया, तो आप वॉल्यूम की सीमा बहुत कम रख सकते हैं। जब मॉडल बाद में स्वाहिली या चीनी में कोई दुर्लभ, तेज़ नोट बजाने की कोशिश करता है, तो वह "क्लिप्ड" (कट) जाता है, और ध्वनि खराब हो जाती है।
एक बहुभाषी कैलिब्रेशन सेट का उपयोग करके, मॉडल पैकिंग प्रक्रिया के दौरान "नोट्स" (दुर्लभ शब्द, अजीब प्रतीक, विभिन्न वाक्य संरचनाएं) की एक विस्तृत श्रृंखला देखता है। यह मॉडल को विभिन्न भाषाओं के चरम उच्च और निम्न स्तरों को बिना टूटे संभालने के लिए प्रशिक्षित करता है।
यह "पैकिंग विधि" पर निर्भर करता है
शोध पत्र ने यह भी पाया कि अलग-अलग कंप्रेशन टूल्स पैकिंग सूची के प्रति अलग-अलग प्रतिक्रिया देते हैं:
- GPTQ (एक संवेदनशील टूल): यह तरीका एक बहुत ही सटीक, नाजुक फोल्डिंग मशीन की तरह है। यह इस बात के प्रति अत्यंत संवेदनशील है कि सूटकेस में क्या है। यदि आप इसे अंग्रेजी सूची देते हैं, तो यह सब कुछ अंग्रेजी के लिए फोल्ड करता है और बाकी चीजों को बिगाड़ देता है। लेकिन यदि आप इसे एक संतुलित बहुभाषी सूची देते हैं, तो यह सब कुछ पूरी तरह से फोल्ड करता है। इसे अच्छी तरह से काम करने के लिए एक विविध मिश्रण की आवश्यकता होती है।
- AWQ (एक लचीला टूल): यह तरीका थोड़ा अधिक लचीला है। यह एक अंग्रेजी सूची को ठीक से संभाल सकता है, लेकिन यह तब सबसे अच्छा काम करता है जब आप इसे उस विशिष्ट भाषा के अनुरूप सूची दें जिसे आप उपयोग करना चाहते हैं। हालांकि, यदि आपको मॉडल को कई भाषाएं बोलने की आवश्यकता है, तो एक बहुभाषी सूची ही सबसे सुरक्षित दांव है।
मुख्य निष्कर्ष
लेखकों का निष्कर्ष है कि हमें "एक ही आकार सबके लिए" वाले दृष्टिकोण को छोड़ना होगा।
- यदि आप चाहते हैं कि एक मॉडल कई भाषाओं को अच्छी तरह से बोले, तो उसे तैयार करने के लिए केवल अंग्रेजी डेटा का उपयोग न करें।
- आपको एक विविध, बहुभाषी प्रशिक्षण सूची की आवश्यकता है ताकि यह सुनिश्चित हो सके कि मॉडल उन सभी अजीब, दुर्लभ और चरम हिस्सों के लिए तैयार है जिनका सामना वह हर भाषा में कर सकता है।
संक्षेप में: एक बहुभाषी AI सूटकेस को पैक करने के लिए, आपको एक बहुभाषी चेकलिस्ट की आवश्यकता है। केवल अंग्रेजी का उपयोग करने से अन्य भाषाएं सिकुड़ी हुई और भ्रमित रह जाती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।