← नवीनतम पेपर
🤖 AI

Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning

यह शोध पत्र COREA को प्रस्तुत करता है, जो एक लागत-कुशल तर्क प्रणाली है जो एक बड़े भाषा मॉडल के साथ एक छोटे भाषा मॉडल को कैस्केड करती है और आत्मविश्वास स्कोर (confidence scores) को कैलिब्रेट करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करती है, जिससे उच्च सटीकता बनाए रखते हुए अनुमान लागत (inference costs) में काफी कमी आती है।

मूल लेखक: Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त, उच्च श्रेणी का रेस्तरां चलाते हैं। आपके पास दो शेफ हैं:

  1. "स्पीडी सूस-शेफ" (SLM): यह शेफ तेज़ है, इसे काम पर रखना सस्ता है और यह ग्रिल्ड चीज़ या सलाद जैसे सरल व्यंजन बनाने में माहिर है। हालाँकि, वे कभी-कभी जटिल रेसिपी (जैसे कि 10-कोर्स मॉलिक्यूलर गैस्ट्रोनॉमी मील) को लेकर भ्रमित हो सकते हैं और आपको आत्मविश्वास के साथ जला हुआ व्यंजन भी परोस सकते हैं।
  2. "मास्टर शेफ" (LLM): यह शेफ एक जीनियस है। यह कुछ भी पूरी तरह से बना सकता है। लेकिन, यह अविश्वसनीय रूप से महंगा, धीमा है, और इसका समय सीमित है। आप हर एक ऑर्डर के लिए इसे इस्तेमाल नहीं कर सकते।

समस्या:
AI की दुनिया में, हम मास्टर शेफ का उपयोग करके कठिन समस्याओं (जैसे गणित या विज्ञान) को हल करना चाहते हैं, लेकिन हर चीज़ के लिए उनका उपयोग करने में बहुत अधिक पैसा खर्च होता है। यदि हम सब कुछ करने के लिए स्पीडी शेफ का उपयोग करते हैं, तो हम पैसे बचाते हैं, लेकिन गलत उत्तर प्राप्त करते हैं।

समाधान: COREA (स्मार्ट वेटर सिस्टम)
लेखकों ने COREA नामक एक सिस्टम बनाया है। इसे एक सुपर-स्मार्ट वेटर के रूप में समझें जो ग्राहक और रसोई के बीच खड़ा होता है।

यह इस प्रकार काम करता है, चरण-दर-चरण:

1. "कॉन्फिडेंस चेक" (आत्मविश्वास की जाँच)

जब कोई ग्राहक किसी व्यंजन का ऑर्डर देता है (एक प्रश्न), तो स्पीडी सूस-शेफ पहले उसे बनाने की कोशिश करता है। लेकिन यहाँ एक जादुई ट्रिक है: स्पीडी शेफ को यह जानने के लिए प्रशिक्षित किया गया है कि वह क्या नहीं जानता।

व्यंजन परोसने से पहले, स्पीडी शेफ को ज़ोर से कहना होगा: "मुझे 90% यकीन है कि यह एकदम सही है" या "मुझे केवल 20% यकीन है, यह जोखिम भरा लग रहा है।"

  • पुराना तरीका: स्पीडी शेफ अक्सर कहते थे, "मैं 100% सुनिश्चित हूँ!" भले ही वे गलत होते थे। इसे "ओवरकॉन्फिडेंट" (अति-आत्मविश्वासी) होना कहा जाता है।
  • COREA का तरीका: एक विशेष प्रशिक्षण प्रक्रिया (रीइन्फोर्समेंट लर्निंग) के माध्यम से, स्पीडी शेफ ईमानदार होना सीखता है। यदि व्यंजन कठिन है, तो वे स्वीकार करते हैं, "मुझे विश्वास नहीं है।"

2. निर्णय द्वार (The Decision Gate)

स्मार्ट वेटर (सिस्टम) उस कॉन्फिडेंस स्कोर को सुनता है:

  • यदि शेफ कहता है "मैं आश्वस्त हूँ (70% से ऊपर)": वेटर तुरंत व्यंजन परोस देता है। परिणाम: आपको एक तेज़, सस्ता उत्तर मिलता है।
  • यदि शेफ कहता है "मैं आश्वस्त नहीं हूँ (70% से नीचे)": वेटर कहता है, "ठहरिए, यह बहुत पेचीदा है।" वे ऑर्डर को मास्टर शेफ को सौंप देते हैं। परिणाम: आपको एक सटीक उत्तर मिलता है, लेकिन इसमें अधिक लागत आती है।

3. प्रशिक्षण (द टेस्ट ऑफ टेस्ट/स्वाद परीक्षण)

उन्होंने स्पीडी शेफ को ईमानदार कैसे बनाया?
उन्होंने उन्हें केवल यह नहीं बताया कि वे अच्छे बनें। उन्होंने प्रशिक्षण के दौरान एक "रिवॉर्ड सिस्टम" (पुरस्कार प्रणाली) का उपयोग किया:

  • सही होने पर पुरस्कार: यदि उत्तर सही है, तो शेफ को एक पॉइंट मिलता है।
  • ईमानदार होने पर पुरस्कार: यदि शेफ कहता है "मुझे 50% यकीन है" और वे वास्तव में 50% बार सही होते हैं, तो उन्हें बोनस मिलता है। यदि वे कहते हैं "मैं 100% सुनिश्चित हूँ" लेकिन गलत होते हैं, तो उन्हें पेनल्टी (दंड) मिलती है।

इसने स्पीडी शेफ को अपने आत्मविश्वास को अपनी वास्तविक क्षमता के साथ जोड़ने के लिए मजबूर किया। उन्होंने सीखा कि जब वे वास्तव में नहीं जानते, तो "मुझे नहीं पता" कहना है।

परिणाम: एक विन-विन (जीत-जीत की स्थिति)

पेपर में इस सिस्टम का परीक्षण हजारों गणित और तर्क संबंधी समस्याओं पर किया गया। यहाँ क्या हुआ:

  • लागत बचत: स्पीडी शेफ को आसान चीजें संभालने देकर (जो कि अधिकांश समय होता है), उन्होंने मास्टर शेफ का उपयोग करने की तुलना में 16% से 21% तक पैसे बचाए।
  • सटीकता: सिस्टम अभी भी लगभग उतना ही सटीक था जितना कि अकेले मास्टर शेफ का उपयोग करना (केवल लगभग 2% कम सटीक)।
  • दक्षता: यह एक ऐसी टीम की तरह है जहाँ जूनियर स्टाफ 60% काम संभालता है, और सीनियर स्टाफ केवल कठिन 40% के लिए हस्तक्षेप करता है।

एनालॉजी सारांश (उपमा सारांश)

कल्पना कीजिए कि आप एक परीक्षा दे रहे छात्र हैं।

  • COREA के बिना: या तो आप हर गणित के सवाल के लिए कैलकुलेटर का उपयोग करते हैं (महंगा/धीमा) या आप हर चीज़ पर अनुमान लगाते हैं (तेज़ लेकिन गलत)।
  • COREA के साथ: आप पहले समस्या को अपने दिमाग में हल करने की कोशिश करते हैं। यदि आप आत्मविश्वासी महसूस करते हैं, तो आप उत्तर लिख देते हैं। यदि आप अटक गए हैं या अनिश्चित हैं, तो आप तुरंत हाथ उठाकर शिक्षक (मास्टर शेफ) से मदद मांगते हैं।

यह पेपर साबित करता है कि यदि आप अपने "छात्र" (छोटे AI) को उनके ज्ञान के बारे में ईमानदार होने के लिए प्रशिक्षित करते हैं, तो आप एक ऐसा सिस्टम बना सकते हैं जो सस्ता, तेज़ और स्मार्ट तीनों एक साथ है।

यह पेपर सिद्ध करता है कि यदि आप अपने "छात्र" (छोटे AI) को उनके ज्ञान के बारे में ईमानदार होने के लिए प्रशिक्षित करते हैं, तो आप एक ऐसा सिस्टम बना सकते हैं जो सस्ता, तेज़ और स्मार्ट सभी एक साथ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →