Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents
यह शोध पत्र लकीस्टार (LuckyStar) 111B को प्रस्तुत करता है, जो कोहेर (Cohere) और एलजी सीएनएस (LG CNS) द्वारा विकसित एक हाइब्रिड रीजनिंग मॉडल है, जो विशिष्ट फाइन-ट्यूनिंग और क्वांटाइजेशन रणनीतियों के माध्यम से कोरियाई-अंग्रेजी एंटरप्राइज एजेंटों के लिए एक पोस्ट-ट्रेन्ड मल्टीलिंगुअल बेस मॉडल को कुशलतापूर्वक अनुकूलित करता है, जिससे मेमोरी की सीमाओं के तहत सामान्य इंस्ट्रक्शन-फॉलोइंग गुणवत्ता बनाए रखते हुए फंक्शन कॉलिंग और एनएल2एसक्यूएल (NL2SQL) जैसी टूल-यूज़ क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, बहुभाषी सहायक है जिसका नाम LuckyStar है। यह सहायक बहुत विशाल है (111 बिलियन "मस्तिष्क कोशिकाएं" या पैरामीटर्स) और बड़ी कंपनियों के लिए काम करता है। चुनौती यह थी कि कंपनियों को इस सहायक की इतनी समझ चाहिए थी कि वह जटिल गणितीय समस्याओं को हल कर सके, कंप्यूटर कोड लिख सके और डेटाबेस (जैसे SQL) से बात कर सके, लेकिन साथ ही उन्हें इसे तेज़, सस्ता और कोरियाई और अंग्रेजी दोनों भाषाओं में बिना भ्रमित हुए धाराप्रवाह बोलने में सक्षम भी होना चाहिए था।
यहाँ शोधकर्ताओं ने LuckyStar को कैसे बनाया और ट्यून किया, इसकी कहानी सरल शब्दों में दी गई है:
1. शुरुआती बिंदु: एक स्मार्ट बेस
शून्य से नया मस्तिष्क बनाने के बजाय (जो एक बच्चे को शुरू से पढ़ना सिखाने जैसा है), उन्होंने एक बहुत ही स्मार्ट, पहले से प्रशिक्षित मॉडल से शुरुआत की जिसे Command A कहा जाता है। इसे एक वरिष्ठ कर्मचारी की तरह समझें जो पहले से ही कोरियाई और अंग्रेजी दोनों में निर्देशों का पालन करने में माहिर है। उन्हें बस उसे कुछ नए, विशिष्ट कार्य कौशल सिखाने की आवश्यकता थी।
2. "स्विच" का कमाल: हाइब्रिड रीजनिंग (Hybrid Reasoning)
सबसे बड़ा नवाचार एक मानसिक स्विच देना था जो एक सरल "प्रिअम्बल" (बातचीत की शुरुआत में दिया गया एक छोटा निर्देश) द्वारा नियंत्रित होता है।
- मोड A (द स्प्रिंटर - धावक): यदि आप "मौसम कैसा है?" जैसा सरल प्रश्न पूछते हैं, तो स्विच मॉडल को त्वरित और संक्षिप्त होने का निर्देश देता है।
- मोड B (द डिटेक्टिव - जासूस): यदि आप कोई कठिन गणितीय समस्या या जटिल डेटाबेस क्वेरी पूछते हैं, तो स्विच मॉडल को "ज़ोर से सोचने" (think out loud) का निर्देश देता है, जिससे वह उत्तर देने से पहले कई चरणों में समाधान निकाल सके।
- यह क्यों महत्वपूर्ण है: उन्हें दो अलग-अलग रोबोटों की आवश्यकता नहीं थी। एक ही रोबोट केवल अपने "माइंडसेट" को बदलकर दोनों काम पूरी तरह से कर सकता था।
3. भाषा की पहेली: अंग्रेजी में सोचना, कोरियाई में बोलना
प्रशिक्षण के दौरान, उन्होंने एक अजीब सी गड़बड़ी देखी। जब वे मॉडल से कोरियाई में प्रश्न पूछते थे, तो वह अक्सर कोरियाई में सोचना शुरू करता था लेकिन फिर गलती से उत्तर अंग्रेजी में पूरा कर देता था। यह उस छात्र की तरह था जो फ्रेंच में पढ़ता है लेकिन अपना अंतिम निबंध स्पेनिश में लिखता है।
इसे ठीक करने के लिए, उन्होंने एक चतुर रणनीति का उपयोग किया:
- उन्होंने मॉडल को अंग्रेजी में सोचने (जटिल तर्क करने) के लिए प्रशिक्षित किया क्योंकि गणित और तर्क के लिए प्रशिक्षण डेटा मुख्य रूप से अंग्रेजी में था।
- लेकिन यदि मॉडल अंतिम उत्तर उपयोगकर्ता की भाषा में नहीं देता था, तो उन्हें उसे सख्ती से दंडित किया गया।
- परिणाम: मॉडल ने सीखा कि उसे अपना आंतरिक "जासूसी कार्य" अंग्रेजी में करना है, लेकिन हमेशा उपयोगकर्ता द्वारा पूछी गई भाषा में ही अंतिम रिपोर्ट देनी है।
4. "टूल" प्रशिक्षण: डेटाबेस का उपयोग करना सीखना
सहायक को "एजेंटिक" कार्यों (SQL डेटाबेस जैसे टूल्स का उपयोग करना) में कुशल बनाने के लिए, उन्हें बहुत सावधान रहना पड़ा।
- कोल्ड स्टार्ट समस्या: शुरुआत में, मॉडल डेटाबेस क्वेरी लिखने में बहुत खराब था। यह किसी को रेसिंग कार चलाने सिखाने जैसा था जब उन्होंने कभी स्टीयरिंग व्हील पकड़ा भी न हो।
- समाधान: उन्होंने "प्रयास और अस्वीकार" (try and reject) विधि का उपयोग किया। उन्होंने हजारों संभावित उत्तर उत्पन्न किए, जांचा कि कौन से वास्तव में काम करते थे (जो "सत्यापनीय" थे), और केवल सही उत्तरों को ही सीखने के लिए मॉडल को वापस दिया। इससे उन्नत प्रशिक्षण शुरू करने से पहले एक मजबूत नींव बनी।
5. "चैटी" (बातूनी) समस्या: चुप रहना सीखना
मॉडल को एक बेहतरीन जासूस बनाने के बाद, वह थोड़ा अधिक बातूनी हो गया। जब आप केवल "हाँ" या "नहीं" चाहते थे, तब भी वह लंबे, भ्रामक स्पष्टीकरण देने लगा।
- सुधार: उन्होंने प्रेफरेंस अलाइनमेंट (Preference Alignment) नामक तकनीक का उपयोग किया। उन्होंने मॉडल को "अच्छे, संक्षिप्त उत्तरों" बनाम "बुरे, लंबे-चौड़े उत्तरों" के उदाहरण दिखाए और उससे कहा, "हम छोटे उत्तरों को पसंद करते हैं।" इसने मॉडल को परेशान किए बिना मददगार बनने के लिए ट्यून किया।
6. हार्डवेयर हैक: एक बाथटब में व्हेल को फिट करना
यह मॉडल बहुत विशाल है (111 बिलियन पैरामीटर्स)। आमतौर पर, इसे चलाने के लिए आपको एक बहुत बड़े, महंगे सुपरकंप्यूटर की आवश्यकता होती है।
- ट्रिक: उन्होंने 4-बिट क्वांटाइजेशन (4-bit quantization) का उपयोग किया। कल्पना करें कि आप एक उच्च-रिज़ॉल्यूशन वाली फोटो को इतना कंप्रेस कर रहे हैं कि फ़ाइल का आकार आधा हो जाता है, लेकिन फिर भी आप चित्र को स्पष्ट रूप से पहचान सकते हैं।
- परिणाम: इसने इस विशाल 111-बिलियन-पैरामीटर वाले मॉडल को गुणवत्ता में बहुत कम कमी के साथ एक एकल मानक ग्राफिक्स कार्ड (एक H100 GPU) पर चलाने में सक्षम बनाया। यह इसे कंपनियों के लिए वास्तव में उपयोग करने में बहुत सस्ता और आसान बनाता है।
परिणामों का सारांश
अंतिम मॉडल, LuckyStar 111B, एक व्यावहारिक, द्विभाषी (कोरियाई/अंग्रेजी) एजेंट है जो:
- मूल बेस मॉडल की तुलना में गणित और तर्क की समस्याओं को बेहतर ढंग से हल करता है।
- डेटाबेस से बात कर सकता है और प्रभावी ढंग से टूल्स का उपयोग कर सकता है।
- उपयोगकर्ता की भाषा को सही ढंग से बोलता है, भले ही वह दूसरी भाषा में सोच रहा हो।
- एक एकल सर्वर पर चल सकता है, जिससे पैसे की बचत होती है।
पेपर निष्कर्ष निकालता है कि उद्यम (enterprise) उपयोग के लिए, आपको हमेशा शून्य से एक नया, पूर्ण मॉडल बनाने की आवश्यकता नहीं होती है। इसके बजाय, आप एक स्मार्ट मौजूदा मॉडल ले सकते हैं, उसे विभिन्न कार्यों के लिए एक "स्विच" दे सकते हैं, उसे सावधानी से टूल्स का उपयोग करना सिखा सकते हैं, और उसे कुशलतापूर्वक चलाने के लिए कंप्रेस कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।