← नवीनतम पेपर
💬 NLP

Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling

यह शोध पत्र यह प्रदर्शित करता है कि वियतनामी लघु भाषा मॉडलों (Small Language Models) के लिए, सरलीकृत चेन-ऑफ-थॉट प्रॉम्प्टिंग और सेल्फ-कंसिस्टेंसी के साथ संयुक्त सुपरवाइज्ड फाइन-ट्यूनिंग, रीजनिंग गैप को पाटने और एज डिवाइसेस पर पेडागोगिकल कोहेरेंस प्राप्त करने में जटिल एजेंटिक वर्कफ्लो से बेहतर प्रदर्शन करती है।

मूल लेखक: Bui The Trung, Do Minh Duc, Nguyen Van Vinh, Bui Nguyen Quoc Trinh

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bui The Trung, Do Minh Duc, Nguyen Van Vinh, Bui Nguyen Quoc Trinh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

🧠 मुख्य विचार: एक नन्हे मस्तिष्क को इंसान की तरह सोचना सिखाना

कल्पive करें कि आपके पास एक छोटा, सुपर-स्मार्ट रोबोट (एक "स्मॉल लैंग्वेज मॉडल" या SLM) है जो आपकी जेब में समा सकता है। यह रोबोट, जिसका नाम Qwen3-1.7B है, अविश्वसनीय रूप से जानकार है। इसने लगभग पूरा इंटरनेट पढ़ा है, इसलिए इसे गणित के सवालों के जवाब तुरंत पता होते हैं।

समस्या:
भले ही रोबोट को जवाब पता हो, लेकिन वह उसे समझाने में बुरा है।

  • यदि आप उससे पूछें, "12 गुना 5 क्या होता है?", तो वह बिना काम दिखाए बस "60!" चिल्ला सकता है।
  • यदि आप उसे एक कठिन शब्द-समस्या (word problem) हल करने के लिए कहते हैं, तो हो सकता है कि वह सही संख्या तो लिख दे, लेकिन उसका स्पष्टीकरण भ्रमित करने वाला हो, या यदि आपने वियतनामी में पूछा है, तो वह अंग्रेजी शब्दों का उपयोग करे।
  • यह एक ऐसे जीनियस छात्र की तरह है जो अपने दिमाग में गणित की समस्या हल कर सकता है, लेकिन परीक्षा में फेल हो जाता है क्योंकि उसने वे चरण नहीं लिखे जो शिक्षक ने मांगे थे।

यह पेपर इस बारे में है कि कैसे शोधकर्ताओं ने इस छोटे रोबोट को धीरे होने, कदम-दर-कदम सोचने और खुद को स्पष्ट रूप से समझाने के लिए सिखाया, और इसके लिए किसी सुपर-कंप्यूटर की आवश्यकता नहीं पड़ी।


🛠️ सफलता के लिए तीन-चरणीय रेसिपी

शोधकर्ताओं ने इस नन्हे रोबोट को अपग्रेड करने के लिए तीन मुख्य तरकीबों का उपयोग किया:

1. "अनुवादक" पाइपलाइन (Vi-S1K बनाना)

उन्होंने केवल गणित की समस्याओं का अंग्रेजी से वियतनामी में अनुवाद नहीं किया। ऐसा करना एक चुटकुले का शब्द-दर-शब्द अनुवाद करने जैसा होगा; इससे उसका मज़ा खत्म हो जाता है।

  • उपमा: कल्पना करें कि आपके पास फ्रेंच में लिखी केक की एक रेसिपी है। यदि आप केवल शब्दों का अनुवाद करते हैं, तो आप "बेकिंग सोडा" के बजाय "बेकिंग पाउडर" पा सकते हैं क्योंकि अनुवादक को संदर्भ समझ नहीं आया।
  • उन्होंने क्या किया: उन्होंने एक स्मार्ट AI (Gemini) का उपयोग किया जो एक सांस्कृतिक शेफ (cultural chef) की तरह काम करता था। इसने कठिन गणित की समस्याओं को लिया, उन्हें स्वाभाविक लगने वाली वियतनामी में अनुवादित किया, और यह सुनिश्चित किया कि गणित के शब्द (जैसे "दशमलव बिंदु" या "शेषफल") ठीक वैसे ही हों जैसे वियतनामी स्कूली पाठ्यपुस्तकों में उपयोग किए जाते हैं। इससे एक विशेष प्रशिक्षण पुस्तक तैयार हुई जिसे Vi-S1K कहा गया।

2. "ट्यूटर" प्रशिक्षण (सुपरवाइज्ड फाइन-ट्यूनिंग)

उन्होंने इस नई किताब का उपयोग करके नन्हे रोबोट को प्रशिक्षित किया।

  • उपमा: प्रशिक्षण से पहले, रोबोट एक कैलकुलेटर की तरह था। वह बस आपको संख्या देता था। प्रशिक्षण के बाद, वह एक धैर्यवान ट्यूटर बन गया।
  • परिणाम: रोबोट ने सीखा कि अच्छा ग्रेड पाने के लिए, वह सिर्फ "60" नहीं कह सकता। उसे कहना होगा: "पहले, मैं 10 को 5 से गुणा करता हूँ जिससे 50 आता है। फिर मैं 2 को 5 से गुणा करता हूँ जिससे 10 आता है। अंत में, मैं उन्हें जोड़कर 60 प्राप्त करता हूँ।"
  • जादू: इस प्रशिक्षण ने रोबोट की एक मानव शिक्षक की तरह "बात करने" की क्षमता को अनलॉक कर दिया। चीजों को समझाने की उसकी क्षमता में 77% का सुधार हुआ।

3. "सोचने का समय" रणनीति (टेस्ट-टाइम स्केलिंग)

शोधकर्ताओं ने रोबोट को समस्याएं हल करने के लिए पूछने के विभिन्न तरीकों का परीक्षण किया।

  • "ReAct" का जाल: उन्होंने ReAct नामक एक विधि का परीक्षण किया, जो रोबोट को मजबूर करती है कि वह कहे "मैं सोच रहा हूँ," फिर "मैं कार्य कर रहा हूँ," और फिर "मैंने देखा।"
    • उपमा: कल्पना करें कि आप एक छोटे बच्चे को पहेली सुलझाने के लिए कह रहे हैं, लेकिन आप उसे हर चाल के बाद रुकने और कहने के लिए मजबूर करते हैं, "मैं लाल ब्लॉक को हिला रहा हूँ," "मैं नीले ब्लॉक को देख रहा हूँ।" बच्चा यह बताने में इतना थक जाता है कि वह क्या कर रहा है, कि वह पहेली सुलझाना ही भूल जाता है।
    • निष्कर्ष: इस छोटे रोबोट के लिए, ReAct बहुत जटिल था। इसने रोबोट की दिमागी शक्ति को गणित के बजाय फॉर्मेटिंग पर बर्बाद कर दिया।
  • विजेता (CoT + सेल्फ-कंसिस्टेंसी): सबसे अच्छी विधि चेन-ऑफ-थॉट (CoT) (बस "कदम-दर-कदम सोचें") थी, जिसे सेल्फ-कंसिस्टेंसी के साथ जोड़ा गया था।
    • उपमा: रोबोट से एक बार पूछने के बजाय, उन्होंने एक ही समस्या को हल करने के लिए उसे पाँच बार पूछा। फिर, उन्होंने पाँचों उत्तरों को देखा और उस उत्तर को चुना जो सबसे अधिक बार आया (जैसे बहुमत का वोट)।
    • यह क्यों काम करता है: भले ही रोबोट एक बार कोई मूर्खतापूर्ण गलती कर दे, लेकिन इसे पाँच बार करने से आमतौर पर गलतियाँ रद्द हो जाती हैं। सही उत्तर पाने का यह सबसे विश्वसनीय तरीका है।

📊 उन्होंने क्या सीखा? (मुख्य बातें)

  1. छोटे मॉडल हमारी सोच से अधिक स्मार्ट हैं: छोटा रोबोट पहले से ही गणित जानता था (उसने सटीकता में 5 में से 4 अंक प्राप्त किए)। वह बस यह नहीं जानता था कि इसके बारे में कैसे बात की जाए
  2. प्रशिक्षण ही कुंजी है: एक छोटे मॉडल को स्मार्ट बनाने के लिए आपको विशाल सुपर-कंप्यूटर की आवश्यकता नहीं है। आपको बस उसे सोचने का सही तरीका सिखाने की आवश्यकता है (Vi-S1K डेटासेट का उपयोग करके)।
  3. इसे सरल रखें: छोटे रोबोटों (2 बिलियन से कम "मस्तिष्क कोशिकाओं") के लिए, ReAct जैसे जटिल ढांचे बहुत भारी होते हैं। वे सबसे अच्छा तब काम करते हैं जब आप उन्हें स्वाभाविक रूप से सोचने (Chain-of-Thought) और अपने काम की दोबारा जांच करने (Self-Consistency) देते हैं।
  4. "ट्यूटर" प्रभाव: सबसे बड़ा सुधार सही संख्या प्राप्त करने में नहीं था; बल्कि स्पष्टीकरण में था। रोबोट एक शांत कैलकुलेटर से बदलकर एक सहायक शिक्षक बन गया जो समझा सकता है कि उत्तर क्यों सही है।

🚀 यह क्यों महत्वपूर्ण है?

यह शोध बहुत महत्वपूर्ण है क्योंकि यह दिखाता है कि हम स्मार्ट, रीजनिंग AI को सीधे फोन, टैबलेट और सस्ते लैपटॉप (एज डिवाइसेस) पर डाल सकते हैं।

किसी ग्रामीण गाँव के छात्र के लिए गणित की समस्या हल करने के लिए क्लाउड में एक विशाल सर्वर फार्म की आवश्यकता होने के बजाय, अब हम उनके फोन पर ही एक "ट्यूटर" चला सकते हैं। यह तेज़ है, निजी है, और बिना इंटरनेट कनेक्शन के भी काम करता है।

संक्षेप में: उन्होंने एक स्मार्ट लेकिन शर्मीले रोबोट को लिया, उसे स्थानीय भाषा और शिष्टाचार सिखाया, और दिखाया कि यदि आप उसे थोड़ा सोचने दें और अपने काम की दोबारा जांच करने दें, तो वह एक शानदार शिक्षक बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →