← नवीनतम पेपर
💬 NLP

ConfSpec: Efficient Step-Level Speculative Reasoning via Confidence-Gated Verification

ConfSpec एक कॉन्फिडेंस-गेटेड कैस्केडेड वेरिफिकेशन फ्रेमवर्क पेश करता है जो स्टेप-लेवल स्पेकुलेटिव रीजनिंग में सटीकता-गति के बीच के ट्रेड-ऑफ को हल करने के लिए जनरेशन और वेरिफिकेशन के बीच की विषमता का लाभ उठाता है, जिससे लक्ष्य-मॉडल की सटीकता से समझौता किए बिना या बाहरी जज मॉडल की आवश्यकता के बिना 2.24×\times तक एंड-टू-एंड स्पीडअप प्राप्त होता है।

मूल लेखक: Siran Liu, Cyril Y. He

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siran Liu, Cyril Y. He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान लेकिन धीमी गति से सोचने वाले ग्रैंडमास्टर चेस प्लेयर (लार्ज लैंग्वेज मॉडल) हैं। आप अविश्वसनीय रूप से स्मार्ट हैं और सबसे कठिन पहेलियों को हल कर सकते हैं, लेकिन आपको हर एक चाल के बारे में सोचने में बहुत समय लगता है।

अब, कल्पना कीजिए कि आपके पास एक जूनियर चेस प्लेयर (स्मॉल ड्राफ्ट मॉडल) है जो बहुत तेज़ है। वे उतने स्मार्ट नहीं हैं, लेकिन वे त्वरित हैं और अधिकांश समय अच्छे मूव्स बना सकते हैं।

समस्या: "टोकन" की बाधा (The "Token" Bottleneck)

पारंपरिक रूप से, ग्रैंडमास्टर को तेज़ बनाने के लिए, हमने जूनियर को एक चाल चलने दी, और फिर ग्रैंडमास्टर ने उसे अक्षर-दर-अक्षर (टोकन-दर-टोकन) चेक किया।

  • समस्या: यदि जूनियर कहता है, "मैं नाइट को राजा के बगल वाले वर्ग पर ले जाता हूँ," और ग्रैंडमास्टर सोचता है, "नहीं, मैं कहूँगा 'मैं नाइट को राजा के समीप वाले वर्ग पर ले जाता हूँ'," तो ग्रैंडमास्टर उसे खारिज कर देता है। भले ही अर्थ बिल्कुल समान हो, लेकिन शब्द थोड़े अलग हैं।
  • परिणाम: ग्रैंडमास्टर जूनियर के अच्छे विचारों को सिर्फ इसलिए खारिज कर देता है क्योंकि उन्होंने अलग-अलग पर्यायवाची शब्दों का उपयोग किया था। यह समय बर्बाद करता है और सब कुछ धीमा कर देता है।

पुराने समाधान (और वे क्यों विफल हुए)

  1. "आशावादी" दृष्टिकोण (The "Optimistic" Approach): बस जूनियर पर भरोसा करें। परिणाम: जूनियर एक तार्किक त्रुटि करता है, और पूरा खेल बर्बाद हो जाता है।
  2. "ब्रूट फोर्स" दृष्टिकोण (The "Brute Force" Approach): एक तीसरे, महंगे रेफरी से हर एक चाल की जांच करने के लिए कहें। परिणाम: यह सटीक है, लेकिन आप दो के बजाय तीन खिलाड़ियों के लिए भुगतान कर रहे हैं, इसलिए यह वास्तव में तेज़ नहीं है।
  3. "अस्पष्ट" दृष्टिकोण (The "Vague" Approach): जूनियर से पूछें कि क्या चालें "महसूस" होने में समान हैं। परिणाम: वे जटिल तर्क में भ्रमित हो जाते हैं और गलत निर्णय लेते हैं।

नया समाधान: ConfSpec (द "कॉन्फिडेंस गेट")

लेखकों ने महसूस किया कि कुछ चीज़ है जो बहुत चतुर है: सभी चालें जांचने के लिए समान रूप से कठिन नहीं होती हैं।

  • आसान चालें: "प्यादे को एक वर्ग आगे बढ़ाएं।" जूनियर इसे तुरंत चेक कर सकता है और इसके बारे में 100% निश्चित हो सकता है।
  • कठिन चालें: "10 चालों में चेकमेट की जटिल संभावना की गणना करें।" जूनियर केवल अनुमान लगा रहा हो सकता है।

ConfSpec एक "कॉन्फिडेंस गेट" (एक क्लब के बाउंसर की तरह) पेश करता है:

  1. जूनियर एक स्टेप प्रस्तावित करता है (तर्क का एक पूरा हिस्सा, न कि केवल एक शब्द)।
  2. जूनियर खुद से पूछता है: "मैं इस स्टेप के सही होने के बारे में कितना आश्वस्त हूँ?"
    • उच्च आत्मविश्वास (जैसे, 95%): जूनियर कहता है, "मुझे यकीन है!" गेट खुल जाता है। ग्रैंडमास्टर इस स्टेप को चेक करना छोड़ देता है और इसे तुरंत स्वीकार कर लेता है। गति: तेज़!
    • कम आत्मविश्वास (जैसे, 60%): जूनियर कहता है, "मुझे यकीन नहीं है, यह थोड़ा पेचीदा लग रहा है।" गेट बंद हो जाता है। यह स्टेप पूरी और कठोर जांच के लिए ग्रैंडमास्टर को भेज दिया जाता है। गति: धीमी, लेकिन सुरक्षित।

जादुई उपमा: "ट्रैफिक लाइट" सिस्टम

तर्क प्रक्रिया (Reasoning process) को एक हाईवे के रूप में सोचें।

  • पुराना तरीका: हर कार (तर्क स्टेप) को आगे बढ़ने से पहले एक रेड लाइट पर रुकना पड़ता है और पुलिस अधिकारी (ग्रैंडमास्टर) द्वारा पूरी जांच करवानी पड़ती है।
  • ConfSpec: हम एक स्मार्ट ट्रैफिक लाइट लगाते हैं।
    • यदि कार एक छोटा, साधारण सेडान है (एक आसान स्टेप) और ड्राइवर (जूनियर) आत्मविश्वासी दिखता है, तो लाइट बिना किसी रोक-टोक के अपने आप ग्रीन हो जाती है। किसी स्टॉप की आवश्यकता नहीं है।
    • यदि कार खतरनाक सामग्री ले जाने वाला एक विशाल ट्रक है (एक जटिल स्टेप) या ड्राइवर घबराया हुआ दिखता है, तो लाइट रेड हो जाती है, और पुलिस अधिकारी (ग्रैंडमास्टर) सावधानीपूर्वक निरीक्षण करने के लिए आगे आता है।

यह एक बड़ी बात क्यों है

  • गति: क्योंकि तर्क श्रृंखला के अधिकांश स्टेप वास्तव में "आसान" होते हैं (जैसे बुनियादी गणित या सरल तर्क), यह सिस्टम अधिकांश काम के लिए ग्रैंडमास्टर को स्किप कर देता है। यह पूरी प्रक्रिया को 2.24 गुना तेज़ बना देता है।
  • सटीकता: क्योंकि सिस्टम केवल उन्हीं आसान स्टेप्स को स्किप करता है जिनके बारे में वह निश्चित है, और कठिन, भ्रमित करने वाले स्टेप्स को ग्रैंडमास्टर के पास भेजता है, इसलिए अंतिम उत्तर उतना ही सटीक होता है जितना कि यदि ग्रैंडमास्टर ने सब कुछ अकेले किया होता।
  • कोई अतिरिक्त लागत नहीं: आपको तीसरे रेफरी को काम पर रखने की ज़रूरत नहीं है। जूनियर खुद ही इसकी जांच करता है, अपने स्वयं के "अंतर्ज्ञान" (कॉन्फिडेंस स्कोर) का उपयोग करके।

सारांश

ConfSpec एक तेज़ लेकिन कम बुद्धिमान सहायक को यह सिखाने जैसा है कि उसे केवल तभी बॉस से मदद मांगनी चाहिए जब वह वास्तव में अनिश्चित हो। बाकी सब के लिए, सहायक बस अपना काम करता रहता है। यह बॉस का समय बचाता है, काम को सटीक रखता है, और काम को बहुत तेज़ी से पूरा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →