← नवीनतम पेपर
💬 NLP

ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection

यह शोध पत्र ExpLang को प्रस्तुत करता है, जो एक नवीन पोस्ट-ट्रेनिंग पाइपलाइन है जो सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) के दौरान ऑन-पॉलिसी थिंकिंग लैंग्वेज सिलेक्शन को सक्षम करके लार्ज रीजनिंग मॉडल्स को उन्नत करती है, जिससे बहुभाषी लाभों के माध्यम से अन्वेषण (एक्सप्लोरेशन) और दोहन (एक्सप्लोइटेशन) दोनों में सुधार होता है और यह केवल अंग्रेजी-आधारित प्रशिक्षण की तुलना में बेहतर प्रदर्शन करती है।

मूल लेखक: Changjiang Gao, Zixian Huang, Kaichen Yang, Jiajun Chen, Jixing Li, Shujian Huang

प्रकाशित 2026-02-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changjiang Gao, Zixian Huang, Kaichen Yang, Jiajun Chen, Jixing Li, Shujian Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ExpLang पेपर का विवरण दिया गया है, जिसे सरल, रोज़मर्रा की भाषा में कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: AI को "बहुभाषी मस्तिष्क" देना

कल्पना कीजिए कि आप एक बहुत कठिन गणित की पहेली सुलझाने की कोशिश कर रहे हैं। आपके पास एक शानदार सहायक (AI) है, लेकिन वह केवल अंग्रेजी बोलता है। वह बुद्धिमान है, लेकिन कभी-कभी, जब वह फंस जाता है, तो वह बस अंग्रेजी में ही बार-बार घूमता रहता है।

ExpLang एक नया प्रशिक्षण तरीका है जो इस सहायक को ज़रूरत पड़ने पर भाषा बदलने के लिए सिखाता है। यह पता चला है कि कुछ समस्याओं के लिए, अंग्रेजी में ही टिके रहने के बजाय स्पेनिश, चीनी या वियतनामी में सोचना वास्तव में AI को समाधान खोजने में अधिक तेज़ी से या अधिक रचनात्मक रूप से मदद कर सकता है।

पेपर का तर्क है कि AI को यह चुनने देने से कि उसे किस भाषा में सोचना है, हम इसे स्मार्ट, तेज़ और विभिन्न भाषाओं बोलने वाले उपयोगकर्ताओं के प्रति अधिक आज्ञाकारी बना सकते हैं।


समस्या: "केवल अंग्रेजी" का जाल

वर्तमान में, अधिकांश उन्नत AI मॉडल मुख्य रूप से अंग्रेजी डेटा पर प्रशिक्षित होते हैं। वे एक ऐसे शेफ की तरह हैं जो केवल मसालों के एक विशिष्ट सेट के साथ खाना बनाना जानता है।

  • समस्या: यदि आप उन्हें कोई समस्या हल करने के लिए कहते हैं, तो वे डिफ़ॉल्ट रूप से अंग्रेजी का उपयोग करते हैं। यदि अंग्रेजी उस विशिष्ट पहेली के लिए सबसे अच्छा "उपकरण" नहीं है, तो वे संघर्ष कर सकते हैं।
  • पुराना तरीका: शोधकर्ताओं ने एक "प्रिफिक्स" (जैसे कि उसे कहना "अब फ्रेंच बोलो") जोड़कर AI को अन्य भाषाएं बोलने के लिए मजबूर करने की कोशिश की। लेकिन यह अजीब और अस्थिर था, जैसे किसी कुत्ते पर नकली मूंछें लगाना; यह मूंछों जैसा दिखता तो है, लेकिन कुत्ता वास्तव में मूंछों वाला व्यक्ति नहीं बन जाता।

समाधान: ExpLang (एक्सप्लोर एंड एक्सप्लॉइट - खोज और उपयोग)

लेखकों ने एक प्रशिक्षण पाइपलाइन बनाई जिसे ExpLang कहा जाता है। इसे AI के मस्तिष्क के लिए दो चरणों वाले "बूट कैंप" के रूप में समझें।

चरण 1: "एक्सप्लोरेशन" चरण (यात्री)

  • उपमा: कल्पना कीजिए कि AI एक नए शहर में एक यात्री है। शुरुआत में, उसे नहीं पता कि कौन सी गली खजाने की ओर ले जाती है। इसलिए, वह अलग-अलग मोहल्लों (भाषाओं) को आज़माने के लिए बेतरतीब ढंग से घूमता है।
  • क्या होता है: AI को अलग-अलग भाषाएँ आज़माने के लिए पुरस्कृत किया जाता है। यदि वह आमतौर पर अंग्रेजी में सोचता है, तो सिस्टम कहता है, "हे, आज वियतनामी में सोचने की कोशिश करो!"
  • लक्ष्य: एक विस्तृत जाल बिछाना। शायद ज्यामिति (geometry) की समस्या का समाधान जापानी तर्क में अधिक स्पष्ट हो, या जर्मन में तर्क की पहेली बेहतर समझ आए। AI को कई भाषाएँ आज़माने के लिए मजबूर करके, यह समस्याओं को हल करने के नए तरीके खोज लेता है जो वह अंग्रेजी में रहकर चूक जाता।

चरण 2: "एक्सप्लोइटेशन" चरण (प्रो/विशेषज्ञ)

  • उपमा: यात्री ने शहर की खोज करने के बाद महसूस किया कि "मोहल्ला A" (अंग्रेजी) और "मोहल्ला B" (चीनी) ही एकमात्र हैं जहाँ खजाना है। अब, वह घूमना बंद कर देता है और पूरी तरह से सर्वोत्तम मार्गों पर ध्यान केंद्रित करता है।
  • क्या होता है: AI उन सभी समाधानों को देखता है जो उसने खोजे थे। वह महसूस करता है, "वाह, जब मैंने अंग्रेजी में सोचा, तो मैं 90% बार सही उत्तर पाया। जब मैंने फ्रेंच में सोचा, तो मैं 60% बार सही था।"
  • लक्ष्य: AI विशिष्ट समस्या के लिए सर्वश्रेष्ठ भाषा चुनना सीख जाता है। वह अन्य भाषाएं बोलना बंद नहीं करता है, बल्कि वह यह जानने में माहिर हो जाता है कि कब किसका उपयोग करना है।

यह गेम-चेंजर क्यों है

1. यह "ऑन-पॉलिसी" है (AI खुद चुनता है)
पुराने तरीकों में, इंसान AI को भाषा बोलने के लिए मजबूर करते थे। ExpLang में, AI निर्णय लेने की प्रक्रिया के हिस्से के रूप रूप में स्वयं भाषा का चुनाव करता है।

  • उपमा: यह एक शिक्षक द्वारा छात्र को फ्रेंच में निबंध लिखने के लिए मजबूर करने और एक छात्र द्वारा यह महसूस करने के बीच का अंतर है कि, "मैं इस अवधारणा को फ्रेंच में बेहतर समझता हूँ, इसलिए मैं इसे फ्रेंच में लिखूँगा।" दूसरे तरीके से बेहतर सीखने में मदद मिलती है।

2. यह "ऑर्थोगोनल" है (प्लग-एंड-प्ले)
पेपर में उल्लेख है कि यह तरीका लगभग किसी भी मौजूदा AI प्रशिक्षण एल्गोरिदम के साथ काम करता है।

  • उपमा: ExpLang एक नया कार इंजन नहीं है; यह एक नया GPS सिस्टम है जिसे आप किसी भी कार में इंस्टॉल कर सकते हैं। बेहतर नेविगेशन का लाभ उठाने के लिए आपको पूरी कार को फिर से बनाने की आवश्यकता नहीं है।

3. "अंग्रेजी-बहुभाषी-अंग्रेजी" की यात्रा
पेपर ने पाया कि AI के मस्तिष्क में कैसे बदलाव आया, इसका एक दिलचस्प पैटर्न है:

  1. शुरुआत: यह केवल अंग्रेजी बोलता है।
  2. मध्य: यह पागल हो जाता है, 12 अलग-अलग भाषाएँ आज़माता है (एक्सप्लोरेशन)।
  3. अंत: यह वापस शांत हो जाता है, लेकिन अब यह अधिक स्मार्ट है। यह ज्यादातर फिर से अंग्रेजी बोलता है, लेकिन इसने अन्य भाषाओं से जो तर्क और दक्षता सीखी है, उसे "अवशोषित" कर लिया है।
  • परिणाम: अंतिम मॉडल अंग्रेजी तर्क में उस मॉडल से बेहतर है जिसने कभी अन्य भाषाओं को आज़माया ही नहीं, क्योंकि इसने विविधता से सीखा है।

परिणाम: उन्होंने क्या पाया?

  • स्मार्ट AI: ExpLang मॉडल्स ने समान कंप्यूटिंग पावर के साथ, केवल अंग्रेजी में प्रशिक्षित मॉडल्स की तुलना में कठिन गणितीय समस्याओं को बेहतर ढंग से हल किया।
  • बेहतर अनुपालन (Compliance): यदि आप AI से "वियतनामी में सोचें" कहते हैं, तो वह वास्तव में ऐसा करता है (99% समय), जबकि अन्य मॉडल अक्सर आपकी बात अनसुनी कर देते हैं और अंग्रेजी ही बोलते रहते हैं।
  • सामान्यीकरण (Generalization): भले ही आप AI को ऐसी भाषा में सोचने के लिए कहें जिस पर उसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था (जैसे कि कोई दुर्लभ भाषा), फिर भी वह बहुत अच्छा काम करता है। उसने केवल विशिष्ट शब्दों को नहीं, बल्कि भाषा बदलने के कौशल को सीखा है।

सारांश

ExpLang एक प्रतिभाशाली छात्र को बहुभाषी बनने की शिक्षा देने जैसा है। उन्हें केवल एक भाषा तक सीमित रहने के लिए मजबूर करने के बजाय, आप उन्हें कई भाषाओं के साथ प्रयोग करने देते हैं। प्रशिक्षण के अंत तक, उनके पास एक "सुपर-ब्रेन" होता है जो किसी भी दी गई समस्या के लिए सोचने के सबसे अच्छे तरीके को जानता है, जिससे वे तेज़, अधिक सटीक और दुनिया भर के लोगों के लिए बहुत अधिक सहायक बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →