CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations
यह शोध पत्र CroCo को प्रस्तुत करता है, जो एक ऐसी विधि है जो यह प्रदर्शित करती है कि स्व-निर्मित प्रतिक्रियाओं और एक अंग्रेजी-प्रशिक्षित रिवॉर्ड मॉडल का उपयोग करके क्रॉस-लिंगुअल कंट्रास्टिव प्रेफरेंस ट्यूनिंग, विविध कार्यों में बहुभाषी एलएलएम (LLM) के प्रदर्शन को प्रभावी ढंग से सुधारती है, बशर्ते कि ऑन-पॉलिसी डेटा का उपयोग किया गया हो, जिसके लिए भाषा-विशिष्ट प्रेफरेंस एनोटेशन की आवश्यकता नहीं होती है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक बहुभाषी शेफ को बिना किसी बहुभाषी आलोचक के सिखाने की व्याख्या सरल भाषा और रोज़मर्रा के उदाहरणों के साथ दी गई है।
मुख्य विचार: एक बहुभाषी आलोचक के बिना एक बहुभाषी शेफ को सिखाना
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली शेफ (AI मॉडल) है जो कई भाषाएँ बोल सकता है, लेकिन उसे यह सीखने की ज़रूरत है कि कैसे ऐसे व्यंजन बनाए जाएँ जिन्हें इंसान वास्तव में पसंद करते हैं। आमतौर पर, एक शेफ को सिखाने के लिए, आपको एक खाद्य आलोचक (food critic) की आवश्यकता होती है जो शेफ की ही भाषा बोलता हो ताकि वह व्यंजनों को चख सके और कह सके, "यह बहुत बढ़िया है, वह बहुत बुरा है।"
समस्या:
AI की दुनिया में, हमारे पास "आलोचकों" (Reward Models) की भरमार है जो अंग्रेजी के विशेषज्ञ हैं, लेकिन डेनिश, डच या इतालवी के विशेषज्ञ बहुत कम हैं। पारंपरिक रूप से, एक बहुभाषी शेफ को सुधारने के लिए, शोधकर्ताओं ने अंग्रेजी के निर्देशों को अन्य भाषाओं में अनुवाद करने या हर एक भाषा के लिए विशिष्ट आलोचकों को काम पर रखने की कोशिश की। यह महंगा, धीमा है, और अक्सर इससे शेफ अपने मूल व्यंजन बनाना भूल जाता है (जिसे "कैटास्ट्रोफिक फॉरगेटिंग" कहा जाता है)।
समाधान (CROCO):
इस पेपर के लेखक एक चतुर शॉर्टकट प्रस्तावित करते हैं जिसे CROCO कहा जाता है। हर भाषा के लिए एक आलोचक की आवश्यकता के बजाय, वे एक अंग्रेजी बोलने वाले आलोचक और कॉन्ट्रास्टिव प्रेफरेंस ट्यूनिंग (Contrastive Preference Tuning) नामक तकनीक का उपयोग करते हैं।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
1. "सेल्फ-जेनरेशन" बुफे (The "Self-Generation" Buffet)
शेफ को केवल एक व्यंजन बनाने के लिए कहने के बजाय, AI (शेफ) से एक विशिष्ट भाषा (जैसे, डेनिश कहानी के 64 संस्करण) के लिए एक ही रेसिपी के 64 अलग-अलग संस्करण बनाने के लिए कहा जाता है।
2. "एक-आलोचक" स्कोरकार्ड (The "One-Critic" Scorecard)
एकल अंग्रेजी बोलने वाला आलोचक सभी 64 संस्करणों को चखता है। भले ही आलोचक अंग्रेजी बोलता हो, फिर भी वह यह अंतर बता सकता है कि एक सुसंगत, मददगार डेनिश कहानी और एक निरर्थक, भ्रमित करने वाली कहानी के बीच क्या अंतर है। वह प्रत्येक संस्करण को एक स्कोर देता है।
- मुख्य अंतर्दृष्टि: आलोचक को यह जानने की ज़रूरत नहीं है कि एक डेनिश कहानी पूर्ण रूप से कितनी अच्छी है। उन्हें बस सुसंगत होने की आवश्यकता है। यदि कहानी A को 90 मिलता है और कहानी B को 10 मिलता है, तो आलोचक जानता है कि A, B से बेहतर है, भले ही संख्याएँ एकदम सटीक न हों।
3. "स्वीट स्पॉट" पेयरिंग (The "Sweet Spot" Pairing)
यही जादू है। शोधकर्ता केवल "सबसे अच्छे" और "सबसे खराब" कहानी को नहीं चुनते।
- वे सबसे अच्छी कहानी चुनते हैं (विजेता)।
- वे एक औसत दर्जे की (mediocre) कहानी चुनते जो विजेता से स्पष्ट रूप से खराब है लेकिन सबसे खराब नहीं है (विशेष रूप से, जो औसत स्कोर से लगभग 2 मानक विचलन (standard deviations) नीचे है)।
इसे एक स्पोर्ट्स कोच की तरह समझें। खिलाड़ी को स्वर्ण पदक विजेता का वीडियो और जूते के फीते में उलझकर गिरने वाले व्यक्ति का वीडियो दिखाने के बजाय, कोच उन्हें स्वर्ण पदक विजेता और एक ऐसे खिलाड़ी का वीडियो दिखाता है जिसने कुछ गलतियाँ कीं लेकिन फिर भी खेल खेल रहा था। यह "कंट्रास्ट" (अंतर) खिलाड़ी के सीखने के लिए अधिक आसान होता है।
4. सबक (DPO)
AI इन दो विशिष्ट कहानियों की तुलना करके सीखता है: "मुझे विजेता की ओर लक्ष्य रखना चाहिए, और मुझे औसत दर्जे की शैली से बचना चाहिए।" क्योंकि AI इन दोनों के बीच के अंतर (gap) को सीख रहा है, इसलिए यह मायने नहीं रखता कि आलोचक की स्कोरिंग प्रणाली उस विशिष्ट भाषा के लिए थोड़ी "गलत" है। जब तक रैंकिंग सुसंगत है, AI सही सबक सीख लेता है।
उन्होंने क्या पाया
शोधकर्ताओं ने इसे दो अलग-अलग AI मॉडलों (एक छोटा, एक मध्यम आकार का) पर 14 अलग-अलग भाषाओं (डेनिश, डच, फ्रेंच, जर्मन, इतालवी, स्पेनिश और वेल्स और आयरिश जैसी कम संसाधन वाली भाषाओं सहित) में टेस्ट किया।
- "अनुवाद" का जाल (The "Translation" Trap): जब उन्होंने केवल अंग्रेजी प्रशिक्षण डेटा को अन्य भाषाओं में अनुवाद करने और AI को सीधे सिखाने की कोशिश की (Supervised Fine-Tuning), तो AI भ्रमित हो गया और उन भाषाओं को अच्छी तरह से बोलना भूल गया। यह एक फ्रांसीसी शेफ को एक अनुवादित इतालवी रेसिपी बुक याद करने के लिए मजबूर करने जैसा था; उन्होंने शब्दों को गलत कर दिया और अपने मूल कौशल को भूल गए।
- CROCO की सफलता: "सेल्फ-जेनरेशन + वन क्रिटिक" पद्धति का उपयोग करके, AI में लगभग हर भाषा में सुधार हुआ।
- यह संरचित कार्यों (जैसे गणित और कोडिंग) और खुले-अंत वाले कार्यों (जैसे रचनात्मक लेखन) में बेहतर हुआ।
- यह छोटे और बड़े दोनों मॉडलों के लिए काम आया।
- यह उन भाषाओं के लिए भी काम कर गया जिन्हें AI ने अपने प्रशिक्षण के दौरान नहीं देखा था, जिससे पता चला कि इसने एक सामान्य "बेहतर खाना बनाने" का कौशल सीखा है जो भाषाओं के बीच स्थानांतरित (transfer) हो गया।
"सीक्रेट सॉस" की आवश्यकताएं (The "Secret Sauce" Requirements)
पेपर में पाया गया कि यह तरीका केवल तभी काम करता है जब आप दो सख्त नियमों का पालन करते हैं:
- आपको अपना स्वयं का खाना बनाना चाहिए (On-Policy Data): AI को खुद अपनी 64 कहानियाँ बनानी चाहिए। यदि आप किसी दूसरे AI द्वारा बनाई गई कहानियों का उपयोग उसे सिखाने के लिए करते हैं, तो यह तरीका विफल हो जाता है। यह एक शेफ के अपने ही गलतियों से सीखने जैसा है, न कि किसी और के काम से।
- "ऑफलाइन" दृष्टिकोण बेहतर है: आपको AI को सिखाना शुरू करने से पहले सभी कहानियों को स्कोर करना चाहिए। यदि आप AI को वास्तविक समय में कहानियाँ बनाते समय सिखाने की कोशिश करते हैं (Online), तो AI आलोचक के तत्काल फीडबैक से भ्रमित हो जाता है और उतना अच्छा नहीं सीख पाता है।
निचोड़ (The Bottom Line)
यह पेपर यह सिद्ध करता है कि AI को कई भाषाओं में बेहतर बनाने के लिए आपको बहुभाषी विशेषज्ञों की टीम की आवश्यकता नहीं है। आपको बस एक सुसंगत अंग्रेजी बोलने वाला आलोचक और यह दिखाने का एक स्मार्ट तरीका चाहिए कि उसकी अपनी भाषा में एक "अच्छा" उत्तर और एक "बुरा" उत्तर क्या है।
उत्तरों के पूर्ण गुण (absolute quality) के बजाय उनके सापेक्ष अंतर (relative difference) पर ध्यान केंद्रित करके, AI बिना किसी विशिष्ट शिक्षक के और बिना अंग्रेजी बोलना भूले, डेनिश, इतालवी या वेल्स में बेहतर बोलना सीख सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।