← नवीनतम पेपर
🤖 AI

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

यह लेख Tandem को पेश करता है, जो एक सहयोगात्मक ढांचा है जिसमें एक लार्ज लैंग्वेज मॉडल एक रणनीतिक समन्वयक के रूप में कार्य करता है ताकि महत्वपूर्ण अंतर्दृष्टि उत्पन्न की जा सके जो एक छोटे और अधिक कुशल मॉडल को पूर्ण तर्क निष्पादित करने में मार्गदर्शन करती है, जिससे गणितीय तर्क और कोड जनरेशन जैसे कार्यों में उच्च प्रदर्शन बनाए रखते हुए कम्प्यूटेशनल लागत को लगभग 40% कम किया जा सकता है।

मूल लेखक: Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Tandem: Efficient Reasoning के लिए Large और Small Language Models के साथ मिलकर काम करना" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "ओवरथिंकर" (ज़रूरत से ज़्यादा सोचने वाला)

एक अत्यंत बुद्धिमान, विश्व स्तरीय प्रोफेसर (Large Language Model या LLM) की कल्पना करें जो गणित की बेहद कठिन समस्याओं को हल कर सकता है। हालाँकि, इस प्रोफेसर की एक आदत है: आपको उत्तर देने से पहले, वह हर एक विचार, हर एक गलत दिशा जिसमें उसने विचार किया, और हर एक छोटी गणना को समझाने के लिए 5,000 शब्दों का निबंध लिखता है।

हालाँकि उत्तर आमतौर पर सही होता है, लेकिन यह प्रक्रिया धीमी और महंगी है। यह एक मास्टर आर्किटेक्ट को एक साधारण पक्षी घर (birdhouse) बनाने के लिए काम पर रखने जैसा है, लेकिन वह आर्किटेक्ट एक भी कील ठोकने से पहले तीन दिन तक ब्लूप्रिंट बनाने, लकड़ी के रेशों के गुणों की गणना करने और बढ़ईगिरी के इतिहास को लिखने में बिता देता है।

दूसरी ओर, आपके पास एक तेज़, ऊर्जावान प्रशिक्षु (Apprentice) है (Small Language Model या SLM)। वह तेज़ और सस्ता है, लेकिन यदि आप उससे सीधे कठिन प्रश्न पूछेंगे, तो वह अक्सर गलत अनुमान लगा लेता है या अटक जाता है।

समाधान: "Tandem" टीम

लेखकों ने Tandem नामक काम करने का एक नया तरीका प्रस्तावित किया है। बड़े मॉडल (LLM) को अकेले सारा काम करने देने या प्रशिक्षु को अंधे होकर अनुमान लगाने देने के बजाय, वे एक मेंटर-इंटर्न (Mentor-Intern) संबंध में मिलकर काम करते हैं।

"Tandem" सिस्टम इस प्रकार काम करता है:

1. मेंटर एक "चीट शीट" प्रदान करता है (पूरी किताब नहीं)

बड़ा मॉडल (मेंटर) पूरा निबंध नहीं लिखता है। इसके बजाय, यह चार प्रमुख जानकारियों के साथ एक संक्षिप्त "चीट शीट" जल्दी से तैयार करता है:

  • लक्ष्य (Goal): हम वास्तव में क्या हल करने की कोशिश कर रहे हैं?
  • योजना (Planning): समग्र रणनीति क्या है?
  • प्राप्ति (Retrieval): हमें किन विशिष्ट तथ्यों या सूत्रों की आवश्यकता है?
  • कार्रवाई (Action): पहले कुछ तार्किक चरण क्या हैं?

कल्पना कीजिए कि यह प्रोफेसर द्वारा प्रशिक्षु को कार चलाने के बजाय एक विस्तृत मानचित्र और एक दिशा-सूचक यंत्र (compass) देने जैसा है।

2. इंटर्न कार चलाता है

छोटा मॉडल (इंटर्न) इस "चीट शीट" को लेता है और इसका उपयोग भारी काम करने के लिए करता है। चूंकि उसके पास मानचित्र है, इसलिए वह रास्ता नहीं भटकता। वह प्रोफेसर के अकेले काम करने की तुलना में बहुत तेज़ी से और सस्ते में गंतव्य तक पहुँचने के लिए कार चलाता है (तर्क के चरणों को उत्पन्न करता है)।

3. "स्टॉप साइन" तंत्र (लागत-जागरूक मूल्यांकन)

यह सिस्टम का सबसे चतुर हिस्सा है। सिस्टम आँख बंद करके इस नियम का पालन नहीं करता कि "मेंटर को हमेशा 5 मिनट तक बोलना चाहिए।"

इसके बजाय, छोटे मॉडल में एक एकीकृत कॉन्फिडेंस मीटर (विश्वास मीटर) होता है। मेंटर के संकेतों को पढ़ते समय, वह अपनी आंतरिक भावनाओं की जाँच करता है:

  • "क्या मैं इस काम को पूरा करने के लिए इसे पर्याप्त रूप से समझता हूँ?"
  • "क्या मैं भ्रमित हूँ या मैं सुरक्षित महसूस कर रहा हूँ?"

यदि छोटा मॉडल सुरक्षित महसूस करता है (कम "एन्ट्रॉपी" या अनिश्चितता), तो वह एक स्टॉप साइन (रुकने का संकेत) उठा देता है। मेंटर तुरंत बोलना बंद कर देता है, और छोटा मॉडल उत्तर पूरा करता है। यदि छोटा मॉडल अभी भी भ्रमित है, तो मेंटर थोड़ा और मार्गदर्शन जोड़ता है।

परिणाम: तेज़, सस्ता और स्मार्ट

पेपर ने कठिन गणितीय समस्याओं और कोड जनरेशन कार्यों पर इसका परीक्षण किया। यहाँ उन्होंने पाया:

  • सही संतुलन (The Sweet Spot): एक "बड़े दिमाग" (32B मॉडल) और एक "छोटे दिमाग" (7B मॉडल) वाली टीम ने मिलकर समस्याओं को अकेले बड़े दिमाग की तुलना में बेहतर तरीके से हल किया।
  • बचत: उन्होंने इस उच्च सटीकता के साथ एक ही समय में 40% कम कंप्यूटिंग पावर (और पैसा) प्राप्त किया।
  • जादुई स्थानांतरण (The Magical Transfer): "कॉन्फिडेंस मीटर" (वह क्लासिफायर जो रुकने का निर्णय लेता है) को गणित की समस्याओं पर प्रशिक्षित किया गया था। आश्चर्यजनक रूप से, यह बिना पुन: प्रशिक्षित हुए कोडिंग समस्याओं पर भी उतना ही अच्छा काम करता है। यह एक ऐसे ड्राइवर की तरह है जिसने न्यूयॉर्क में रेड लाइट पर रुकना सीखा और वह बिना किसी नए सबक के तुरंत टोक्यो में भी रेड लाइट पर रुक सकता है।

यह क्यों महत्वपूर्ण है

पेपर का तर्क है कि हमें अपने सबसे बड़े और सबसे महंगे AI मॉडल्स को हर एक तर्क चरण (reasoning step) करने के लिए मजबूर करने की आवश्यकता नहीं है। उन्हें रणनीतिक लीडर के रूप में कार्य करने देने और छोटे, सस्ते मॉडल्स को निष्पादन (execution) संभालने देने से, हम दोनों दुनिया का सर्वश्रेष्ठ प्राप्त कर सकते हैं: एक विशाल मॉडल की गहरी सोच और एक छोटे मॉडल की गति और दक्षता।

संक्षेप में: सीईओ से यह न पूछें कि क्या उसे कागजात फाइल करने चाहिए। सीईओ से मेमो लिखने के लिए कहें, और कुशल सहायक को कागजात फाइल करने दें। "Tandem" सिस्टम श्रम के इस आदर्श विभाजन को स्वचालित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →