Adaptive Stopping for Multi-Turn LLM Reasoning
यह शोध पत्र MiCP को प्रस्तुत करता है, जो मल्टी-टर्न LLM रीजनिंग के लिए पहला कॉन्फॉर्मल प्रेडिक्शन फ्रेमवर्क है जो औपचारिक कवरेज गारंटी प्रदान करने के लिए टर्न्स के बीच एरर बजट आवंटित करता है और साथ ही उच्च-जोखिम वाले अनुप्रयोगों में लागत और विलंबता (लेटेंसी) को कम करने के लिए एडेप्टिव अर्ली स्टॉपिंग को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही पेचीदा पहेली सुलझाने की कोशिश कर रहे हैं। आपके पास एक सुपर-स्मार्ट सहायक (AI) है जो आपसे बात कर सकता है, लेकिन कभी-कभी उसे तुरंत उत्तर नहीं पता होता।
अतीत में, हमारे पास इन सहायकों के साथ दो मुख्य समस्याएँ थीं:
- वे बहुत जल्दी रुक जाते थे: वे पर्याप्त सुराग इकट्ठा करने से पहले ही उत्तर का अनुमान लगा लेते थे, जिससे गलतियाँ होती थीं।
- वे बहुत ज़्यादा बातें करते थे: वे उत्तर जानने के बाद भी और अधिक सुराग माँगने के लिए बातें जारी रखते थे, जिससे समय और पैसा बर्बाद होता था।
बड़ा सवाल यह था: सहायक को ठीक कब पता चलता है कि उसे बात करना बंद कर देना चाहिए और अंतिम उत्तर देना चाहिए?
अधिकांश वर्तमान प्रणालियाँ केवल एक "अंतर्ज्ञान" (जैसे, "मैं 80% निश्चित हूँ, इसलिए मैं रुक जाऊँगा") के आधार पर अनुमान लगाती हैं। लेकिन उच्च-दांव वाली स्थितियों में—जैसे किसी मरीज़ का निदान करना या बैंक खाता प्रबंधित करना—अनुमान लगाना काफी नहीं है। आपको यह गारंटी चाहिए कि उत्तर सही है।
समाधान: MiCP (एक "सुरक्षा जाल" प्रणाली)
यह पेपर एक नई प्रणाली पेश करता है जिसे MiCP कहा जाता है। इसे ऐसे समझें जैसे आपने AI को एक व्यवस्थित सुरक्षा जाल और उसकी सोचने की प्रक्रिया के लिए एक स्मार्ट बजट दिया हो।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "गोल्ड टिकट" फ़िल्टर (रिट्रीवल कैलिब्रेशन)
कल्पना कीजिए कि AI एक विशाल पुस्तकालय में सुरागों की तलाश कर रहा एक जासूस है। हर बार जब वह कोई किताब माँगता है, तो लाइब्रेरियन उसे 10 किताबें थमा देता है।
- समस्या: कुछ किताबें उपयोगी होती हैं; अन्य बेकार होती हैं। यदि AI बेकार की किताबें पढ़ता है, तो वह भ्रमित हो जाता है।
- MiCP का समाधान: AI के शुरू करने से पहले ही, MiCP एक सख्त लाइब्रेरियन की तरह कार्य करता है। इसके पास एक "गोल्ड टिकट" परीक्षण है। यदि किसी किताब का प्रासंगिकता स्कोर पर्याप्त रूप से उच्च नहीं है, तो उसे तुरंत बाहर कर दिया जाता है। यह सुनिश्चित करता है कि AI केवल उन "गोल्ड" किताबों को पढ़े जो वास्तव में पहेली सुलझाने में मदद करती हैं।
2. "सोचने का बजट" (एरर बजट एलोकेशन)
यह सबसे चतुर हिस्सा है। कल्पना कीजिए कि आपके पास पहेलियों की एक श्रृंखला को सुलझाने के लिए 100 "गलती टोकन" का बजट है।
पुराना तरीका: आप हर पहेली पर समान मात्रा में टोकन खर्च करते हैं। यदि पहेली आसान है, तो आप टोकन बर्बाद करते हैं। यदि वह कठिन है, तो आपके पास टोकन खत्म हो जाते हैं और आप विफल हो जाते हैं।
MiCP का तरीका: MiCP एक स्मार्ट अकाउंटेंट है। यह पहेली को देखता है और कहता है:
- "यह वाला आसान लग रहा है। चलिए केवल 5 टोकन खर्च करते हैं। यदि हम इसे सुलझा लेते हैं, तो बहुत अच्छा! यदि नहीं, तो हम रुक जाते हैं।"
- "यह वाला कठिन लग रहा है। आइए बाद के राउंड के लिए 20 टोकन बचा कर रखें।"
यह AI को आसान सवालों पर जल्दी रुकने (समय और पैसा बचाने) की अनुमति देता है लेकिन कठिन सवालों पर तब तक चलते रहने देता है जब तक कि वह सुनिश्चित न हो जाए। महत्वपूर्ण रूप से, यह एक रनिंग टैली रखता है ताकि अंत में कुल गलतियों की संख्या आपके द्वारा शुरू में निर्धारित सुरक्षा सीमा से अधिक न हो।
3. "स्टॉप साइन" (एडेप्टिव स्टॉपिंग)
बातचीत के हर चरण पर, MiCP पूछता है: "क्या हमारे पास रुकने के लिए पर्याप्त आत्मविश्वास है?"
- यदि AI बार-बार एक ही उत्तर एकत्र कर रहा है (उच्च आत्मविश्वास), तो MiCP एक हरा झंडा लहराता है: "रुकिए! हमारे पास उत्तर है।"
- यदि AI भ्रमित है और अलग-अलग उत्तर दे रहा है, तो MiCP एक लाल झंडा लहराता है: "जारी रखें! और सुराग प्राप्त करें।"
- यदि AI का बजट समाप्त हो जाता है और वह अभी भी भ्रमित है, तो MiCP के पास एक अंतिम सुरक्षा चाल है: वह कहता है, "मुझे नहीं पता," बजाय इसके कि वह गलत उत्तर का अनुमान लगाए। यह झूठ बोलने से बेहतर है!
यह एक बड़ी बात क्यों है?
इसे एक GPS नेविगेशन सिस्टम की तरह समझें:
- MiCP के बिना: GPS आपको तुरंत बाएँ मुड़ने के लिए कह सकता है (जल्दी रुकना) और आपको रास्ता भटका सकता है, या यह 20 मिनट तक मार्ग की पुनर्गणना करता रह सकता है जबकि आप ट्रैफिक में फंसे रहते हैं (देर से रुकना)।
- MiCP के साथ: GPS जानता है कि विश्वसनीय टर्न-बाय-टर्न निर्देश देने के लिए उसके पास पर्याप्त डेटा कब है। यदि सड़क अवरुद्ध है और वह रास्ता नहीं खोज पाता है, तो वह ईमानदारी से कहता है, "मैं आपको वहां नहीं पहुँचा सकता," बजाय इसके कि वह आपको दीवार में गाड़ी चलाने पर मजबूर करे।
परिणाम
शोधकर्ताओं ने कई कठिन प्रश्नों (जैसे "X की सीमा से लगे देश की राजधानी कहाँ है?") पर इसका परीक्षण किया। उन्होंने पाया कि MiCP:
- पैसा बचाता है: यह AI को अनावश्यक काम करने से रोकता है।
- समय बचाता है: यह तेजी से उत्तर देता है।
- अधिक सुरक्षित है: यह गणितीय रूप से प्रमाणित निश्चितता के साथ गारंटी देता है कि उत्तर सही है (या यह स्वीकार करता है कि उसे नहीं पता)।
संक्षेप में, MiCP AI को सिखाता है कि जब ज़रूरत हो तो धैर्यवान कैसे रहना है, जब संभव हो तो तेज़ कैसे होना है, और जब फंस जाए तो ईमानदार कैसे रहना है। यह एक "अनुमान लगाने वाले खेल" को एक "विश्वसनीय प्रक्रिया" में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।