Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer
यह शोध पत्र हार्डनेस एडजस्टेड ट्रांसफर (HAT) स्कोर को पेश करता है ताकि सामान्य स्रोत-भाषा सुधारों से वास्तविक क्रॉस-लिंगुअल ट्रांसफर को अलग किया जा सके, जिससे यह पता चलता है कि जहाँ छोटे मॉडल प्रभावी ढंग से ट्रांसफर करते हैं और समय के साथ प्रगति हुई है, वहीं मॉडलों को स्केल करने से ट्रांसफर स्ट्रेंथ में अपेक्षा से धीमी बढ़त मिलती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।
बड़ी समस्या: "दिखावा करने वाला" जाल (The "Faking It" Trap)
कल्पना कीजिए कि आप दो अलग-अलग देशों के छात्रों को ग्रेड दे रहे हैं: देश A (जहाँ शिक्षक उस भाषा में पारंगत है) और देश B (जहाँ शिक्षक अभी सीख रहा है)।
लंबे समय से, शोधकर्ता यह मापने के लिए कि एक कंप्यूटर मॉडल ने नई भाषा कितनी अच्छी तरह सीखी है, केवल उस नई भाषा में उसके टेस्ट स्कोर को देखते थे। वे सोचते थे: "यदि स्कोर बढ़ रहा है, तो इसका मतलब है कि मॉडल अपने ज्ञान को बेहतर तरीके से ट्रांसफर कर रहा है!"
यह पेपर तर्क देता है कि यह एक धोखा है।
लेखकों का कहना है कि अक्सर, मॉडल वास्तव में अपने ज्ञान को अनुवाद (translate) करने में बेहतर नहीं हो रहा होता है; वह बस कुल मिलाकर अधिक स्मार्ट हो रहा होता है।
- उपमा: कल्पना कीजिए कि एक छात्र जो गणित में बहुत खराब है, उसे एक ट्यूटर मिलता है। ट्यूटर उसे कॉन्सेप्ट्स (concepts) को बेहतर ढंग से समझने में मदद करता है। अब, जब वह छात्र अपनी मातृभाषा में टेस्ट देता है, तो उसे 90% अंक मिलते हैं। जब वह उसी टेस्ट को एक विदेशी भाषा में देता है, तो उसे 60% अंक मिलते हैं।
- बाद में, छात्र को एक बेहतर ट्यूटर मिलता है। वह कॉन्सेप्ट्स को और भी गहराई से समझता है। अब वह अपनी मातृभाषा में 98% और विदेशी भाषा में 65% अंक प्राप्त करता है।
- गलती: यदि आप केवल विदेशी भाषा के स्कोर (60% → 65%) को देखते हैं, तो आप सोच सकते हैं कि छात्र के भाषा कौशल में सुधार हुआ है। लेकिन वास्तव में, वह केवल गणित में बेहतर हुआ है। उनकी मातृभाषा और विदेशी भाषा के स्कोर के बीच का "अंतर" (gap) वास्तव में और बढ़ गया है (30 अंक से घटकर 33 अंक का अंतर हो गया)।
यह पेपर कहता है कि वर्तमान विधियाँ वैसी ही हैं: वे "सामान्य रूप से स्मार्ट होने" और "क्रॉस-लैंग्वेज ट्रांसफर में बेहतर होने" के बीच भ्रमित हो जाती हैं।
समाधान: "HAT स्कोर" (Hardness Adjusted Transfer)
इसे ठीक करने के लिए, लेखकों ने HAT स्कोर नामक प्रगति को मापने का एक नया तरीका बनाया।
उपमा: एक "परफेक्ट ट्रांसफर" लाइन की कल्पना करें। यह एक जादुई रेखा है जहाँ यदि एक छात्र अपनी मातृभाषा में 80% प्राप्त करता है, तो यदि उसने वास्तव में ट्रांसफर में महारत हासिल कर ली है, तो उसे विदेशी भाषा में भी 80% मिलना चाहिए।
- पुरानी विधि: केवल अंतिम संख्या (जैसे, "65%") को देखती थी।
- HAT स्कोर: संबंध को देखता है। यह पूछता है: "यह देखते हुए कि मॉडल ने सोर्स लैंग्वेज में X% प्राप्त किया, इसने अपेक्षित स्तर की तुलना में टारगेट लैंग्वेज में कितना अधिक (या कम) प्रदर्शन किया?"
यदि कोई मॉडल अपेक्षित रेखा से ऊपर प्रदर्शन करता है, तो यह एक वास्तविक 'ट्रांसफर जीत' है। यदि वह केवल इसलिए रेखा का अनुसरण करता है क्योंकि वह सामान्य रूप से स्मार्ट हो गया है, तो HAT स्कोर वही रहता है। यह "सामान्य सुधार" के शोर (noise) को हटाकर "वास्तविक भाषा सीखने" के संकेत (signal) को खोज निकालता है।
उन्होंने क्या पाया (परिणाम)
शोधकर्ताओं ने 20 अलग-अलग AI मॉडलों (Google, OpenAI और Anthropic जैसी कंपनियों के) का तीन अलग-अलग प्रकार के कार्यों पर परीक्षण किया। उनके "HAT स्कोर" ने क्या खुलासा किया:
1. छोटे मॉडल टूटे हुए नहीं हैं (Small Models Aren't Broken)
- मिथक: लोग सोचते थे कि छोटे AI मॉडल नई भाषाएँ सीखने में बहुत खराब होते हैं।
- वास्तविकता: जब आप HAT स्कोर का उपयोग करते हैं, तो छोटे मॉडल वास्तव में एक अच्छा काम करते हैं! वे "टूटे हुए" नहीं हैं; बस उनके समग्र स्कोर कम होते हैं। पुराने मेट्रिक्स उन्हें उनकी वास्तविक क्षमता से कम दिखा रहे थे।
2. प्रगति हमारी सोच से धीमी है (Progress is Slower Than We Thought)
- मिथक: जैसे-जैसे AI मॉडल बड़े होते जाते हैं (अधिक पैरामीटर्स के साथ), वे क्रॉस-लैंग्वेज ट्रांसफर में जादुई रूप से पूर्ण हो जाते हैं।
- वास्तविकता: HAT स्कोर का उपयोग करते हुए, लेखकों ने पाया कि मॉडल को बड़ा बनाना मदद तो करता है, लेकिन सुधार हमारी उम्मीद से बहुत धीमा है। हम कच्चे स्कोर (raw scores) द्वारा सुझाए गए बड़े उछालों को नहीं देख रहे हैं।
3. समय मदद कर रहा है (लेकिन केवल कुछ कार्यों पर)
- वास्तविकता: नए मॉडल (2025/2026 में जारी) रीजनिंग (reasoning) कार्यों (जैसे गणित और लॉजिक पहेलियाँ) में पुराने मॉडलों की तुलना में वास्तव में बेहतर हैं। इन परीक्षणों पर, HAT स्कोर दिखाता है कि वे लगभग "हल" (solved) हो चुके हैं—यानी, वे ज्ञान को लगभग पूरी तरह से ट्रांसफर कर लेते हैं।
- कैच (Catch): यह प्रगति फैक्ट-रिकॉल (fact-recall) कार्यों (जैसे सामान्य ज्ञान के सवालों के जवाब देना) के लिए नहीं हुई है। उन पर, प्रगति रुक गई है।
4. "स्क्रिप्ट" की बाधा (The "Script" Barrier)
- वास्तविकता: क्या इससे फर्क पड़ता है कि भाषाएँ अलग लिपियों (alphabets) का उपयोग करती हैं? (जैसे, अंग्रेजी बनाम अरबी)।
- निष्कर्ष: यह कार्य (task) पर निर्भर करता है।
- रीजनिंग (गणित/लॉजिक) के लिए, लिपि का ज्यादा महत्व नहीं है। मॉडल इसे समझ लेता है।
- तथ्यों (trivia) के लिए, लिपि बदलने से एक बड़ी बाधा आती है। स्क्रिप्ट बदलने पर मॉडल को बहुत अधिक संघर्ष करना पड़ता है।
5. "सोचना" मदद करता है (Thinking Helps)
- वास्तविकता: वे मॉडल जिन्हें "सोचने" (जवाब देने से पहले रीजनिंग की श्रृंखला उत्पन्न करने) की अनुमति दी जाती है, वे क्रॉस-लैंग्वेज ट्रांसफर में बेहतर प्रदर्शन करते हैं।
- अवलोकन: मॉडल ऐसा लगता है कि वे इस अतिरिक्त सोचने के समय का उपयोग भाषाओं के बीच के अंतर को पाटने के लिए करते हैं, प्रभावी रूप से अपने "मन" में समस्या का अनुवाद करने के बाद उसे हल करते हैं।
निष्कर्ष
यह पेपर निष्कर्ष निकालता है कि जबकि AI बेहतर हो रहा है, हम "सामान्य बुद्धिमत्ता" को "भाषा कौशल" मानकर उसका जश्न मना रहे थे।
- अच्छी खबर: हम रीजनिंग कार्यों पर वास्तविक प्रगति कर रहे हैं, और छोटे मॉडल आश्चर्यजनक रूप से सक्षम हैं।
- बुरी खबर: हम तथ्य-आधारित कार्यों में धीमी प्रगति कर रहे हैं, और भाषाओं के बीच का अंतर अभी भी बना हुआ है, विशेष रूप से जब अलग लिपियों की बात आती है।
- कार्यवाही का आह्वान (Call to Action): वर्तमान परीक्षण (benchmarks) नवीनतम मॉडलों के लिए बहुत आसान हैं। हमें कठिन, अधिक जटिल परीक्षणों की आवश्यकता है जो मॉडलों को कई चरणों वाले कार्यों के लिए संघर्ष करने पर मजबूर करें, जहाँ "अनुवाद" वाला हिस्सा समस्या का असली चुनौतीपूर्ण भाग हो।
संक्षेप में: केवल अंतिम स्कोर को न देखें; यह देखें कि मॉडल वहां तक कैसे पहुँचा। HAT स्कोर वास्तविक भाषा सीखने को मापने के लिए नया पैमाना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।