Inference-Time Budget Control for LLM Search Agents
यह शोध पत्र एक 'वैल्यू-ऑफ-इन्फॉर्मेशन-ड्रिवन' सर्च कंट्रोलर और एक चयनात्मक साक्ष्य-आधारित फाइनलाइज़र के माध्यम से मल्टी-हॉप क्यू-एंड-ए (QA) के दौरान दोहरे बजट (टूल कॉल्स और टोकन) को गतिशील रूप से आवंटित करने वाले एलएलएम (LLM) सर्च एजेंटों के लिए एक द्वि-चरणीय इन्फरेंस-टाइम बजट नियंत्रण ढांचे का प्रस्ताव करता है, जो कई बेंचमार्क और मॉडलों में बेसलाइन की तुलना में निरंतर प्रदर्शन लाभ प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य (एक "मल्टी-हॉप प्रश्न") को सुलझाने की कोशिश कर रहे हैं। आपके पास टॉर्च की बैटरी (अपने उत्तर लिखने के लिए आपका "टोकन बजट") और अपने मुखबिरों को करने के लिए फोन कॉल (इंटरनेट पर खोजने के लिए आपका "टूल-कॉल बजट") की एक सीमित आपूर्ति है।
अतीत में, AI जासूस अक्सर इन संसाधनों को बर्बाद कर देते थे। वे बहुत अधिक फोन कॉल कर सकते थे, लूप में फंस सकते थे, या एक लंबा, भटका हुआ रिपोर्ट लिख सकते थे जिससे निष्कर्ष तक पहुँचने से पहले ही उनकी बैटरी खत्म हो जाती थी। कभी-कभी, वे सही सुराग ढूंढ लेते हैं लेकिन अंत में थक जाने या भ्रमित हो जाने के कारण अंतिम फैसला गलत लिख देते हैं।
यह पेपर इन AI जासूसों के लिए एक नया ट्रैफिक कंट्रोलर (Traffic Controller) पेश करता है। यह जासूस को नई चीजें नहीं सिखाता है; इसके बजाय, यह सुनिश्चित करने के लिए कि वे मामले को कुशलतापूर्वक और सटीक रूप से सुलझाएं, वास्तविक समय में जासूस के संसाधनों का प्रबंधन करता है।
यह प्रणाली कैसे काम करती है, इसे दो सरल चरणों में विभाजित किया गया है:
चरण 1: "सूचना का मूल्य" वाला ट्रैफिक लाइट (The "Value of Information" Traffic Light)
जब जासूस खोज कर रहा होता है, तो ट्रैफिक कंट्रोलर लगातार पूछता है: "क्या अभी एक और बैटरी खर्च करना या एक और कॉल करना सार्थक है?"
यह VOI (Value of Information - सूचना का मूल्य) नामक एक स्कोर का उपयोग करता है। इसे एक स्मार्ट GPS की तरह समझें जो न केवल दूरी बताता है, बल्कि अगले मोड़ के मूल्य की भी गणना करता है।
- दुविधा: क्या जासूस को एक नए मुखबिर को फोन करना चाहिए (खोज/Search)? क्या उन्हें बड़े रहस्य को छोटे, आसान पहेलियों में तोड़ देना चाहिए (विघटन/Decompose)? या उनके पास अंतिम रिपोर्ट लिखने के लिए पर्याप्त सुराग हैं (उत्तर/Answer)?
- कंट्रोलर का काम: यह देखता है कि कितनी बैटरी और कॉल शेष हैं।
- यदि बजट अधिक है, तो यह जासूस को अधिक खोजने के लिए प्रोत्साहित कर सकता है।
- यदि बजट कम हो रहा है, तो यह महंगे कार्यों पर "जुर्माना" (penalty) लगाता है। यह कह सकता है, "खोजना बंद करो! तुम्हारी बैटरी खत्म हो रही है। तुम्हें अभी एक उत्तर देने के लिए प्रतिबद्ध होना होगा, भले ही तुम 100% निश्चित न हो।"
- परिणाम: यह AI को बेकार की खोजों में संसाधन बर्बाद करने या एक लूप में फंसने से रोकता है। यह AI को अपने "पैसे" को उन कार्यों पर खर्च करने के लिए मजबूर करता है जिनसे उन्हें सबसे अधिक "लाभ" मिले।
चरण 2: फिनिश लाइन पर "सुरक्षा निरीक्षक" (The "Safety Inspector" at the Finish Line)
एक बार जब खोज समाप्त हो जाती है और जासूस एक ड्राफ्ट उत्तर लिख लेता है, तो ट्रैफिक कंट्रोलर उसे केवल जाने नहीं देता। वह एक सुरक्षा निरीक्षक (Safety Inspector) को साथ लाता है।
- समस्या: कभी-कभी जासूस सभी सही सुराग ढूंढ लेता है लेकिन अंतिम वाक्य में एक छोटी सी टाइपो (लिखने की गलती), गलत "हाँ/नहीं" उत्तर, या थोड़ा सा गलत दिनांक लिख देता है।
- जोखिम: यदि आप किसी सामान्य AI को उत्तर को "ठीक करने" के लिए कहते हैं, तो वह अनजाने में पूरे कहानी के अर्थ को बदल सकता है, एक सही उत्तर को गलत उत्तर में बदल सकता है।
- समाधान: सुरक्षा निरीक्षक केवल कम जोखिम वाली स्थितियों में हस्तक्षेप करता है।
- ठीक करने के लिए सुरक्षित: साक्ष्य स्पष्ट रूप से समर्थन करते हैं यदि "हाँ" को "नहीं" में बदला जाए, या किसी विशिष्ट संख्या (जैसे दिनांक या क्षमता) को ठीक किया जाए।
- छेड़छाड़ न करें: यदि उत्तर एक जटिल तर्क श्रृंखला (जैसे दो चीजों की तुलना करना) पर निर्भर करता है, तो निरीक्षक उसे अकेला छोड़ देता है। वह जानता है कि एक जटिल तर्क श्रृंखला को फिर से लिखने की कोशिश करना खतरनाक है और सही उत्तर को तोड़ सकता है।
- परिणाम: अंतिम उत्तर को उसकी सटीकता के लिए पॉलिश किया जाता है बिना उसके मूल तर्क को जोखिम में डाले।
प्रयोगों ने क्या दिखाया
शोधकर्ताओं ने इस "ट्रैफिक कंट्रोलर" का परीक्षण तीन अलग-अलग AI "मस्तिष्क" का उपयोग करके चार अलग-अलग प्रकार की कठिन पहेलियों पर किया। उन्होंने इसकी तुलना उन अन्य तरीकों से की जिनमें इस तरह का सख्त बजट प्रबंधन नहीं था।
- बेहतर संसाधन प्रबंधन: नया तरीका अधिक पहेलियों को सही ढंग से हल करता है, विशेष रूप से जब बजट कम हो। यह यह जानने में बेहतर था कि कब खोजना बंद करना है और उत्तर देना शुरू करना है।
- "जुर्माना" ही कुंजी है: इस प्रणाली का सबसे महत्वपूर्ण हिस्सा वह नियम था जो बजट कम होने पर खर्च करने पर जुर्माना लगाता था। यह सुधार का मुख्य कारण था।
- स्मार्ट फिनिशिंग: "सुरक्षा निरीक्षक" ने छोटी गलतियों (जैसे गलत नंबर या हाँ/ना का उलटना) को ठीक करने में मदद की, लेकिन बुद्धिमानी से जटिल उत्तरों को छूने से इनकार कर दिया, जिससे AI द्वारा गलती से एक अच्छे समाधान को तोड़ने से बचाव हुआ।
- तेज़: क्योंकि इसने बेकार की खोजों में समय बर्बाद करना बंद कर दिया, इसलिए AI वास्तव में कई मामलों में कार्य तेजी से पूरा करता है।
निचोड़ (The Bottom Line)
यह पेपर तर्क देता है कि AI एजेंटों के वास्तव में उपयोगी होने के लिए, उन्हें केवल एक स्मार्ट मस्तिष्क की ही नहीं, बल्कि एक स्मार्ट मैनेजर की भी आवश्यकता है। इस प्रबंधक को खोज के दौरान अपने सीमित संसाधनों को कैसे खर्च किया जाए, इसका निर्णय लेना चाहिए और अंतिम उत्तर को "ओवर-करेक्ट" (जरूरत से ज्यादा सुधारने) करने में सावधान रहना चाहिए। बजट को एक सख्त बाधा के रूप में मानने और इसे गतिशील रूप से प्रबंधित करने से, AI एक अधिक कुशल और विश्वसनीय जासूस बन जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।