On-Policy Delta Distillation for Multilingual Math Reasoning
यह शोध पत्र यह प्रदर्शित करता है कि ऑन-पॉलिसी डेल्टा डिस्टिलेशन (OPD), जो एक पोस्ट-ट्रेन्ड टीचर और उसके बेस मॉडल के बीच की प्रोबेबिलिटी गैप का लाभ उठाता है, कोरियाई और जापानी में बहुभाषी गणितीय तर्क क्षमता को महत्वपूर्ण रूप से बढ़ाता है और प्रदर्शन अंतराल को कम करता है, हालांकि यह अंग्रेजी-केंद्रित रिस्पॉन्स शिफ्ट को रोकने के लिए बहुभाषी डेटा की आवश्यकता पर जोर देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर उन प्रतिभाशाली, बहुभाषी छात्रों की तरह हैं जिन्होंने पुस्तकालय की हर किताब पढ़ ली है, लेकिन फिर भी वे एक कठिन गणित की समस्या को हल करने में संघर्ष कर रहे हैं। उन्हें स्मार्ट बनाने में मदद करने के लिए, वैज्ञानिक "ट्रेनिंग" नामक एक तकनीक का उपयोग करते हैं, जो एक कोच की तरह है जो छात्र को अभ्यास समस्याओं के माध्यम से मार्गदर्शन करता है। लंबे समय तक, इन AI छात्रों को प्रशिक्षित करने का सबसे अच्छा तरीका 'रीइन्फोर्समेंट लर्निंग' (RL) था, एक ऐसी विधि जहाँ कंप्यूटर को उसके पूरे उत्तर के अंत में एक एकल ग्रेड मिलता है—जैसे कि पूरे निबंध पर "A" या "F" मिलना, बिना यह जाने कि कौन से विशिष्ट वाक्य अच्छे थे या बुरे। हालाँकि, एक नई, अधिक कुशल विधि जिसे 'ऑन-पॉलिसी डिस्टिलेशन' (OPD) कहा जाता है, उभर कर आई है। मूल OPD के बजाय, OPD एक मास्टर शिक्षक की तरह है जो छात्र के उत्तर को शब्द-दर-शब्द पढ़ता है, और छात्र के लिखते समय ही सुधार और सुझावों की फुसफुसाहट करता है। यह "टोकन-लेवल" फीडबैक बहुत अधिक सटीक है। लेकिन यहाँ एक पेंच है: अधिकांश शोध केवल अंग्रेजी में किया गया है। हमें नहीं पता था कि यह "फुसफुसाने वाले शिक्षक" वाली तकनीक कोरियाई, जापानी या अन्य भाषाएँ बोलने वाले छात्रों के लिए भी उतनी ही अच्छी तरह काम करती है या नहीं, या क्या यह AI के अंग्रेजी बोलने बनाम अन्य भाषाओं में बोलने की क्षमता के बीच के अंतर को पाटने में मदद कर सकती है।
यह शोध पत्र ठीक इसी प्रश्न की जांच करता है, जिसमें गणितीय तर्क (mathematical reasoning) के लिए अंग्रेजी, कोरियाई और जापानी में इस तकनीक के एक सुपरचार्ज्ड संस्करण, जिसे On-Policy Delta Distillation (OPD²) कहा जाता है, का परीक्षण किया गया है। शोधकर्ताओं ने पाया कि यह नई विधि एक गेम-चेंजर है। बिल्कुल एक मास्टर शेफ की तरह जो किसी भी भाषा में छात्र को रेसिपी सिखा सकता है, OPD² ने AI मॉडल को तीनों भाषाओं में गणित की समस्याओं को हल करने में काफी बेहतर बनाया, विशेष रूप से कोरियाई और जापानी में बहुत बड़ी छलांग देखी गई। अध्ययन बताता है कि यह विधि मूल संस्करण की तुलना में बेहतर है क्योंकि यह "डेल्टा" (delta)—यानी शिक्षक जो जानता है और छात्र के आधार मॉडल (base model) को पहले से पता है, उसके बीच के विशिष्ट अंतर—पर ध्यान केंद्रित करती है, जिससे सिखाए जा रहे नए तर्क कौशल को प्रभावी ढंग से अलग किया जा सके।
हालाँकि, इस शोध ने एक दिलचस्प, थोड़ा पेचीदा दुष्प्रभाव भी उजागर किया। जब शोधकर्ताओं ने केवल अंग्रेजी गणित की समस्याओं का उपयोग करके AI को प्रशिक्षित करने की कोशिश की, तो मॉडल ने आश्चर्यजनक रूप से कोरियाई और जापानी गणित की समस्याओं को भी बेहतर ढंग से हल किया। ऐसा लग रहा था जैसे छात्र ने अंग्रेजी में गणित का तर्क सीख लिया और वह इसे अन्य भाषाओं में लागू कर सकता है। लेकिन एक मोड़ आया: जबकि उत्तर सही थे, मॉडल अक्सर अपने स्पष्टीकरण अंग्रेजी में लिखने लगा, भले ही प्रश्न कोरियाई या जापानी में पूछा गया हो। यह सुझाव देता है कि जबकि "तर्क की मांसपेशी" (reasoning muscle) को एक भाषा में प्रशिक्षित किया जा सकता है और दूसरी भाषा में स्थानांतरित किया जा सकता है, लक्ष्य भाषा में उत्तर की "आवाज" बनाए रखने के लिए उस विशिष्ट भाषा में डेटा के साथ अभ्यास करना आवश्यक है। अंततः, यह शोध पत्र दिखाता है कि OPD² विभिन्न भाषाओं में AI को स्मार्ट बनाने के लिए एक शक्तिशाली उपकरण है, लेकिन किसी भाषा में महारत हासिल करने के लिए, आपको अभ्यास के दौरान उसे बोलना ही होगा।
मुख्य खोज: एक बेहतर फुसफुसाने वाला शिक्षक
शोधकर्ताओं ने यह देखने के लिए काम शुरू किया कि क्या OPD² (फुसफुसाने वाले शिक्षक का उन्नत संस्करण) बहु-भाषी स्थितियों में मूल OPD से बेहतर प्रदर्शन कर सकता है। उन्होंने Qwen3 (विशेष रूप से 1.7B और 8B संस्करण) नामक AI मॉडलों के एक परिवार और एक विशाल 'टीचर मॉडल' का उपयोग किया। परिणाम स्पष्ट और सुसंगत थे: OPD² ने सभी क्षेत्रों में मूल OPD को लगातार पछाड़ दिया।
इसे ऐसे समझें: यदि मूल OPD एक अच्छा ट्यूटर था, तो OPD² एक जीनियस ट्यूटर था जिसे पता था कि छात्र में वास्तव में किस चीज़ की कमी है। प्रयोगों में, गैर-अंग्रेजी भाषाओं के लिए यह अंतर बहुत बड़ा था। छोटे मॉडल (Qwen3-1.7B) के लिए, OPD² ने कोरियाई गणित स्कोर को 40.9 से बढ़ाकर 51.9 और जापानी स्कोर को 37.2 से बढ़ाकर 52.0 कर दिया। मूल OPD ने मदद तो की, लेकिन OPD² ने उन आंकड़ों को और भी ऊपर पहुँचा दिया। बड़े, अधिक बुद्धिमान मॉडल (Qwen3-8B) के लिए भी सुधार उतने ही मजबूत थे, जिसमें कोरियाई स्कोर 57.0 से बढ़कर 64.4 और जापानी स्कोर 57.1 से बढ़कर 65.0 हो गया।
शोध पत्र स्पष्ट रूप से तर्क देता है कि यह केवल शिक्षक की शैली की नकल करने के बारे में नहीं है। "डेल्टा सिग्नल" (शिक्षक और उसके स्वयं के बेस मॉडल के बीच का अंतर) का उपयोग करके, OPD² ने सफलतापूर्वक छात्र में तर्क क्षमताओं को स्थानांतरित किया, न कि केवल शिक्षक के सामान्य आउटपुट की नकल की। यह सुझाव देता है कि यह विधि मजबूत है और भाषा या मॉडल के आकार की परवाह किए बिना अच्छी तरह से काम करती है।
भाषाई अंतर को पाटना
इस शोध का एक बड़ा लक्ष्य यह देखना था कि क्या ये प्रशिक्षण विधियाँ अंग्रेजी और अन्य भाषाओं के बीच प्रदर्शन के अंतर को कम कर सकती हैं। अक्सर, AI मॉडल अंग्रेजी में कोरियाई या जापानी की तुलना में बहुत बेहतर होते हैं। शोध में पाया गया कि बहुभाषी OPD² ने आम तौर पर इस अंतर को कम करने में मदद की।
"अंग्रेजी-कोरियाई सटीकता अंतर" के विस्तृत विवरण में, शोधकर्ताओं ने देखा कि जबकि बेस मॉडल एक बड़े अंतर से अंग्रेजी की ओर झुका हुआ था (कुछ परीक्षणों में 13 अंकों से भी अधिक), OPD प्रशिक्षण ने इस असमानता को कम कर दिया। उदाहरण के लिए, Global-MGSM बेंचमार्क पर, यह अंतर मानक OPD के साथ 13.4 अंकों से घटकर 8.6 अंक रह गया, और OPD² के साथ और भी घटकर 9.3 अंक हो गया। HRM8K बेंचमार्क पर, अंतर 12.1 से गिरकर 9.2 अंक हो गया।
शोध पत्र सुझाव देता है कि ऐसा इसलिए होता है क्योंकि बहुभाषी प्रशिक्षण गैर-अंग्रेजी भाषाओं को अंग्रेजी भाषा की तुलना में अधिक लाभ पहुँचाता है, जो कमजोर प्रदर्शन करने वालों को ऊपर उठाता है बिना मजबूत करने वालों को नीचे खींचे। हालाँकि, लेखक सावधानी बरतते हुए नोट करते हैं कि यह प्रभाव हर एक परीक्षण में पूरी तरह से समान नहीं था; M-MMLU जैसे कुछ विशिष्ट बेंचमार्क पर, अंतर वास्तव में थोड़ा बढ़ गया। इसलिए, जबकि रुझान सकारात्मक है, यह कोई जादुई छड़ी नहीं है जो हर एक मीट्रिक को तुरंत ठीक कर दे।
"केवल अंग्रेजी" का आश्चर्य और भाषा का जाल
शायद इस शोध पत्र की सबसे आश्चर्यजनक खोज वह थी जो तब हुई जब उन्होंने मॉडलों को केवल अंग्रेजी डेटा का उपयोग करके प्रशिक्षित किया। आप सोच सकते हैं कि यदि आप केवल एक छात्र को अंग्रेजी गणित सिखाते हैं, तो वह कोरियाई गणित में विफल हो जाएगा। लेकिन शोध पत्र ने पाया कि केवल अंग्रेजी वाले OPD² ने कोरियाई और जापानी स्कोर में महत्वपूर्ण सुधार किया।
'नॉन-थिंकिंग मोड' में, अंग्रेजी-ओनली ट्रेनिंग ने कोरियाई औसत को 40.9 से बढ़ाकर 52.6 और जापानी औसत को 37.2 से बढ़ाकर 53.4 कर दिया। ये आंकड़े बहुभाषी प्रशिक्षण स्कोर (जो कोरियाई के लिए 51.9 और जापानी के लिए 52.0 थे) के लगभग बराबर थे। यह सुझाव देता है कि गणितीय तर्क का तर्क इतना सार्वभौमिक है कि इसे अंग्रेजी में सीखा जा सकता है और फिर कोरियाई या जापानी समस्याओं पर लागू किया जा सकता है, भले ही मॉडल ने प्रशिक्षण के दौरान एक भी कोरियाई गणित का सवाल न देखा हो।
हालाँकि, एक बड़ा पेंच है। शोध पत्र स्पष्ट रूप से इस विचार को खारिज करता है कि इसका मतलब यह है कि मॉडल ने वास्तव में भाषा में महारत हासिल कर ली है। जब शोधकर्ताओं ने यह जाँच की कि मॉडल अपने उत्तरों में वास्तव में कौन सी भाषा बोल रहा था, तो परिणाम स्पष्ट थे।
- बहुभाषी प्रशिक्षण: मिश्रित भाषाओं पर प्रशिक्षित होने पर, मॉडल ने कोरियाई में 90.5% बार (नॉन-थिंकिंग मोड में) और जापानी में 90.9% बार उत्तर दिया।
- केवल अंग्रेजी प्रशिक्षण: केवल अंग्रेजी पर प्रशिक्षित होने पर, मॉडल के "कोरियाई" उत्तर गिरकर 48.3% (अर्थात वह आधे समय अंग्रेजी में उत्तर दे रहा था) हो गए, और उसके "जापानी" उत्तर गिरकर 29.6% रह गए।
"थिंकिंग मोड" (जहाँ मॉडल उत्तर देने से पहले एक छिपा हुआ तर्क चरण करता है) में भी, यह रुझान बना रहा। अंग्रेजी-ओनली मॉडल गणित को सही ढंग से हल करेगा लेकिन अक्सर अंतिम उत्तर अंग्रेजी में लिखेगा, इस तथ्य को नजरअंदाज करते हुए कि प्रश्न कोरियाई या जापानी में पूछा गया था। शोध पत्र निष्कर्ष निकालता है कि जबकि अंग्रेजी-ओनली ट्रेनिंग तर्क करने की क्षमता को स्थानांतरित कर सकती है, यह लक्ष्य भाषा में प्रतिक्रिया करने की आदत को बनाए रखने में विफल रहती है। यदि आप चाहते हैं कि मॉडल आपकी इच्छित भाषा बोले, तो आपको उसे उस भाषा में डेटा खिलाना ही होगा।
निष्कर्षों का सारांश
शोध पत्र प्रदर्शित करता है कि OPD² विभिन्न भाषाओं में AI गणितीय तर्क सिखाने के लिए एक बेहतर विधि है, जो लगातार मूल OPD से बेहतर प्रदर्शन करती है। यह अंग्रेजी और कोरियाई एवं जापानी जैसी भाषाओं के बीच प्रदर्शन के अंतर को सफलतापूर्वक कम करता है, जो यह सुझाव देता है कि बहुभाषी पोस्ट-ट्रेनिंग संतुलित AI के लिए एक व्यवहार्य मार्ग है। हालाँकि, अध्ययन "तर्क क्षमता" और "भाषा निर्माण" के बीच एक स्पष्ट रेखा भी खींचता है। जबकि तर्क कौशल को एक भाषा में सीखा जा सकता है और दूसरी भाषा में लागू किया जा सकता है, मॉडल स्वाभाविक रूप से अंग्रेजी की ओर झुक जाएगा जब तक कि उसे स्पष्ट रूप से लक्ष्य भाषा में डेटा के साथ प्रशिक्षित न किया जाए। लेखक सुझाव देते हैं कि भविष्य के शोध को बहुभाषी AI क्षमताओं को वास्तव में समझने के लिए उत्तर की सटीकता और प्रतिक्रिया की भाषा दोनों का मूल्यांकन करने पर ध्यान केंद्रित करना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।