← नवीनतम पेपर
💬 NLP

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab एक इन्फरेंस-टाइम सहयोग पद्धति है जो छोटे भाषा मॉडलों को केवल विचलन (divergence) का पता चलने पर चुनिंदा रूप से बड़े रीजनिंग मॉडलों से परामर्श करने में सक्षम बनाती है, जिससे संक्षिप्त और लागत प्रभावी आउटपुट बनाए रखते हुए तर्क संबंधी सटीकता में सुधार होता है।

मूल लेखक: Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना विचारकों के एक हलचल भरे पुस्तकालय के रूप में करें। एक तरफ, आपके पास "विशाल विद्वान" (Giant Scholars) हैं—विशाल, अविश्वसनीय रूप से शक्तिशाली मॉडल जो गणित, विज्ञान और तर्क की सबसे कठिन पहेलियों को हल कर सकते हैं। वे अत्यंत बुद्धिमान हैं, लेकिन वे धीमे भी हैं, उन्हें चलाना महंगा है, और वे बहुत अधिक बातें करते हैं। जब आप उनसे कोई प्रश्न पूछते हैं, तो वे एक साधारण उत्तर समझाने के लिए एक पूरा उपन्यास लिख सकते हैं, और अक्सर अपने ही विचारों में खो जाते हैं, खुद पर संदेह करने लगते हैं, और विचारों को दोहराते रहते हैं। दूसरी ओर "त्वरित विचारक" (Quick Thinkers) हैं—छोटे, तेज़ मॉडल जो सस्ते और कुशल हैं। वे छोटे, चुस्त उत्तर देते हैं, लेकिन जब उनके सामने वास्तव में कठिन, बहु-चरणीय पहेली आती है, तो वे कभी-कभी अटक जाते हैं या गलत उत्तर दे देते हैं क्योंकि उनमें गहरे तर्क की शक्ति की कमी होती है।

कुछ समय के लिए, शोधकर्ताओं ने इसे ठीक करने का प्रयास किया कि कैसे त्वरित विचारकों को सीधे विशाल विद्वानों की नकल कराई जाए। उन्होंने सोचा, "यदि छोटा मॉडल बड़े मॉडल के हर शब्द का पालन करता है, तो वह स्मार्ट हो जाएगा!" लेकिन यह कुछ हद तक वैसा ही साबित हुआ जैसे कोई छात्र प्रोफेसर के पूरे व्याख्यान की नकल करने की कोशिश कर रहा हो, जिसमें प्रोफेसर के संदेह, ठहराव और "रुको, मुझे इस बारे में सोचने दो" जैसे क्षण भी शामिल हों। छात्र अंततः एक लंबा, भ्रमित करने वाला निबंध लिख देता था जो केवल इसलिए गलत था क्योंकि वह प्रोफेसर की तरह दिखने की कोशिश कर रहा था। सवाल यह था: हम छोटे मॉडल की गति और संक्षिप्तता को, बड़े मॉडल की बौद्धिक क्षमता के साथ कैसे प्राप्त करें, बिना बड़े मॉडल की लंबी-चौड़ी बातों में उलझे?

यहीं पर एक नया विचार आता है जिसे MENTORCOLLAB कहा जाता है। इस शोध पत्र के पीछे के शोधकर्ता इन दो प्रकार के AI के बीच काम करने का एक स्मार्ट तरीका प्रस्तावित करते हैं। इसके बजाय कि बड़ा मॉडल बातचीत पर नियंत्रण ले ले या छोटा मॉडल आँख मूंदकर हर शब्द की नकल करे, वे एक अध्ययन सत्र में छात्र और गुरु (मेंटर) की तरह कार्य करते हैं। छोटा मॉडल (छात्र) लेखन करता है और बातचीत को आगे बढ़ाता है। लेकिन विशिष्ट, यादृच्छिक क्षणों पर, वह बड़े मॉडल (गुरु) से संपर्क करने के लिए रुकता है।

यहाँ जादू कैसे होता है: छात्र और गुरु दोनों अनुमान लगाते हैं कि अगला शब्द क्या होना चाहिए। यदि वे सहमत होते हैं, तो छात्र लिखना जारी रखता है। यदि वे असहमत होते हैं, तो गुरु केवल उत्तर चिल्लाकर नहीं बताता। इसके बजाय, गुरु एक छोटा, केंद्रित संकेत (hint) देता है—केवल कुछ शब्दों का एक छोटा सा "लुकअहेड" (lookahead)—जो एक बेहतर मार्ग का सुझाव देता है। महत्वपूर्ण बात यह है कि छात्र केवल इस संकेत को आँख मूंदकर स्वीकार नहीं करता है। एक हल्का "सत्यापनकर्ता" (verifier) (इसे एक त्वरित वास्तविकता जांच की तरह समझें) यह तय करता है कि गुरु का संकेत वास्तव में सहायक है या वह केवल गुरु के अत्यधिक सोचने का परिणाम है। यदि संकेत अच्छा है, तो छात्र उसे अपना लेता है; यदि नहीं, तो छात्र उसे अनदेखा कर देता है और अपनी शैली में आगे बढ़ता रहता है।

शोध पाते हैं कि यह "चयनात्मक परामर्श" (selective mentorship) आश्चर्यजनक रूप से अच्छा काम करता है। 15 अलग-अलग जोड़ियों (छोटे और बड़े मॉडलों के बीच) और तीन क्षेत्रों (गणित, सामान्य ज्ञान और सामान्य समझ) में, इस पद्धति ने छोटे मॉडलों की सटीकता में औसतन 3.0% का सुधार किया, जबकि कुछ सेटअपों में यह लाभ 8.0% तक देखा गया। शायद सबसे प्रभावशाली बात यह है कि अंतिम उत्तर संक्षिप्त और सुव्यवस्थित रहे। इस पद्धति ने औसतन गुरु के केवल 18.4% टोकन का उपयोग किया, जिसका अर्थ है कि अंतिम आउटपुट उस स्थिति की तुलना में बहुत छोटा था जब बड़े मॉडल ने अकेले काम किया होता।

शोधकर्ताओं ने यह भी खोजा कि आपको गुरु को बहुत अधिक बोलने की आवश्यकता नहीं है। केवल 4 से 8 शब्दों के छोटे संकेत भी छात्र को सही दिशा में मोड़ने के लिए पर्याप्त थे। उन्होंने विभिन्न "चेक-इन" आवृत्तियों का परीक्षण किया और पाया कि बहुत बार संपर्क करने से चीजें वास्तव में खराब हो सकती थीं, क्योंकि छात्र बहुत अधिक सलाह से भ्रमित हो सकता है। कुंजी उस 'स्वीट स्पॉट' को खोजने में थी जहाँ गुरु केवल तभी हस्तक्षेप करता है जब वास्तव में आवश्यकता हो।

संक्षेप में, यह शोध पत्र सुझाव देता है कि हमें स्मार्ट उत्तर प्राप्त करने के लिए छोटे मॉडलों को बड़े, धीमे वक्ता बनाने की आवश्यकता नहीं है। उन्हें रास्ता दिखाने देने और जब वे किसी बाधा से टकराते हैं, तो केवल एक त्वरित, सत्यापित धक्के (nudge) के लिए मदद मांगने से, हम दोनों दुनिया का सर्वश्रेष्ठ प्राप्त कर सकते हैं: उत्तर जो सटीक भी हैं और पढ़ने में आसान भी। लेखक दिखाते हैं कि यह दृष्टिकोण हर प्रश्न के लिए विशाल मॉडलों को चलाने की भारी लागत के बिना तर्क क्षमता को बढ़ाने का एक व्यावहारिक तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →