APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and Execution
यह शोध पत्र APEX-Searcher को प्रस्तुत करता है, जो एक नवीन दो-चरणीय एजेंटिक ढांचा (two-stage agentic framework) है जो जटिल मल्टी-हॉप कार्यों के लिए लार्ज लैंग्वेज मॉडल्स की खोज क्षमताओं को सुदृढ़ करने हेतु इस प्रक्रिया को सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से अनुकूलित रणनीतिक योजना और पर्यवेक्षित फाइन-ट्यूनिंग (supervised fine-tuning) के माध्यम से परिष्कृत मजबूत निष्पादन में विभाजित करता है, जिससे अस्पष्ट रिट्रीवल पथ और विरल पुरस्कारों (sparse rewards) जैसी एंड-टू-एंड प्रशिक्षण की सीमाओं को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत ही पेचीदा रहस्य सुलझाने की कोशिश कर रहे हैं। वह रहस्य एक जटिल प्रश्न है जैसे, "क्या फिल्म 'द एक्सोरसिस्ट' के निर्देशक और फिल्म 'एड वुड' के निर्देशक एक ही देश से थे?"
यदि आप एक साधारण AI (एक "नेइव" या "नादान" AI) से यह प्रश्न पूछते हैं, तो यह अपने प्रशिक्षण के दौरान याद किए गए डेटा के आधार पर अनुमान लगा सकता है। लेकिन यदि इसे उत्तर नहीं पता है, तो यह या तो कुछ मनगढ़ंत बना सकता है (एक "हैलुसिनेशन" या भ्रम) या हार मान सकता है।
यदि आप एक मानक "सर्च AI" (जिसे RAG कहा जाता है) का उपयोग करते हैं, तो यह एक ऐसे जासूस की तरह है जो लाइब्रेरी से एक किताब उठाता है, उसे पढ़ता है और उत्तर देने की कोशिश करता है। यदि उत्तर उस एक किताब में नहीं है, तो जासूस विफल हो जाता है, भले ही उत्तर तीन अन्य किताबों में छिपा हो जिन्हें एक विशिष्ट क्रम में पढ़ने की आवश्यकता हो।
APEX-Searcher आपके जासूस को एक मुख्य रणनीतिकार (Chief Strategist) और जांचकर्ताओं की एक टीम वाले मास्टर डिटेक्टिव में अपग्रेड करने जैसा है।
यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:
1. समस्या: "वन-शॉट" की गलती
अधिकांश सर्च AI उन लोगों की तरह हैं जो एक ही बार में पूरी पिज्जा खाने की कोशिश करते हैं। वे एक ही खोज में जटिल प्रश्न का उत्तर खोजने की कोशिश करते हैं। यदि उत्तर के लिए विभिन्न सूचनाओं के टुकड़ों को जोड़ने की आवश्यकता है (जैसे व्यक्ति A की राष्ट्रीयता ढूंढना, फिर व्यक्ति B की राष्ट्रीयता ढूंढना, फिर तुलना करना), तो एक एकल खोज आमतौर पर विफल हो जाती है।
2. समाधान: APEX-Searcher
APEX-Searcher काम को दो अलग-अलग भूमिकाओं में विभाजित करके खेल बदल देता है: द प्लानर (योजनाकार) और द एक्सप्लोरर (खोजकर्ता)।
चरण 1: मुख्य रणनीतिकार (एजेंटिक प्लानिंग)
इससे पहले कि जासूस लाइब्रेरी में दौड़ना शुरू करे, मुख्य रणनीतिकार (प्लानिंग एजेंट) एक मानचित्र के साथ बैठता है।
- यह क्या करता है: यह बड़े, डरावने प्रश्न को देखता है और उसे छोटे, आसान चरणों की एक तार्किक चेकलिस्ट में तोड़ देता है।
- उपमा: "इन दोनों आदमियों के बारे में और वे कहाँ से हैं?" पूछने के बजाय, रणनीतिकार कहता है:
- पहले, यह पता लगाओ कि स्कॉट डेरिकसन कौन है और वह कहाँ से है।
- अगला, यह पता लगाओ कि एड वुड कौन है और वह कहाँ से है।
- अंत में, दोनों देशों की तुलना करो।
- यह कैसे सीखता है: यह पेपर रीइन्फोर्समेंट लर्निंग (RL) नामक एक विशेष प्रशिक्षण पद्धति का उपयोग करता है। इसे एक वीडियो गेम की तरह समझें जहाँ रणनीतिकार को पुरस्कार (पॉइंट्स) तभी मिलते हैं जब वह समस्या को पूरी तरह से विभाजित करता है। यदि वह एक खराब योजना बनाता है, तो उसे कोई पॉइंट नहीं मिलता। समय के साथ, वह दुनिया का सबसे अच्छा योजनाकार बनने के लिए सीखता है।
चरण 2: खोजकर्ता (एजेंटिक एक्सप्लोरेशन)
एक बार जब मुख्य रणनीतिकार के पास चेकलिस्ट होती है, तो खोजकर्ता (एग्जीक्यूशन एजेंट) काम पर लग जाता है।
- यह क्या करता है: यह एक बार में एक चेकलिस्ट आइटम को संभालता है। यह चरण 1 के उत्तर के लिए खोज करता है, उसे लिखता है, फिर चरण 2 के लिए खोजने में मदद करने के लिए उस उत्तर का उपयोग करता है, और इसी तरह आगे बढ़ता है।
- उपमा: कल्पना करें कि खोजकर्ता एक बहुत ही व्यवस्थित लाइब्रेरियन है।
- चरण 1: "मुझे स्कॉट की राष्ट्रीयता चाहिए।" -> लाइब्रेरी में खोज करता है। -> "अमेरिकन" पाता है। -> इसे एक नोटबुक में लिखता है।
- चरण 2: "अब मुझे एड की राष्ट्रीयता चाहिए।" -> लाइब्रेरी में खोज करता है। -> "अमेरिकन" पाता है। -> इसे नोटबुक में लिखता है।
- चरण 3: "क्या वे समान हैं?" -> नोटबुक को देखता है। -> "हाँ! दोनों अमेरिकन हैं।"
- यह कैसे सीखता है: खोजकर्ता को सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) का उपयोग करके प्रशिक्षित किया जाता है। यह खोजकर्ता को एक "परफेक्ट उदाहरणों" की पाठ्यपुस्तक देने जैसा है जो ठीक से दिखाती है कि कैसे खोज करनी है, कब पर्याप्त जानकारी मिलने पर रुकना है, और उत्तरों को कैसे जोड़ना है।
3. यह बेहतर क्यों है?
- पुराना तरीका: "मैं एक ही बार में सब कुछ खोज लूँगा और उम्मीद करूँगा कि मैं भाग्यशाली रहूँ।" (अक्सर विफल होता है)।
- APEX-Searcher का तरीका: "मेरे पास एक योजना है। मैं चरण-दर-चरण इस समस्या को हल करूँगा, चरण एक के उत्तर का उपयोग चरण दो को हल करने में मदद के लिए करूँगा।"
परिणाम
इस पेपर ने कई कठिन "मल्टी-हॉप" प्रश्नों (ऐसे प्रश्न जिनमें कई तथ्यों को जोड़ने की आवश्यकता होती है) पर इसका परीक्षण किया।
- परिणाम: APEX-Searcher अन्य तरीकों की तुलना में बहुत अधिक स्मार्ट बन गया। इसने अनुमान लगाना बंद कर दिया और समाधान करना शुरू कर दिया।
- "आहा!" क्षण: प्रयोगों ने दिखाया कि एक अच्छी योजना (रणनीतिकार) होना उतना ही महत्वपूर्ण है जितना कि एक अच्छा खोजकर्ता (एक्सप्लोरर) होना। यदि आपके पास केवल एक अच्छा खोजकर्ता है बिना किसी योजना के, तो वे खो जाएंगे। यदि आपके पास एक योजना है लेकिन एक खराब खोजकर्ता है, तो वे सुराग नहीं ढूंढ पाएंगे। आपको दोनों की आवश्यकता है।
संक्षेप में
कल्पना कीजिए कि आप लेगो (Lego) का एक जटिल महल बनाने की कोशिश कर रहे हैं।
- मानक AI मुट्ठी भर ईंटें पकड़ने और यह उम्मीद करने की कोशिश करता है कि वे फिट हो जाएंगी।
- APEX-Searcher एक आर्किटेक्ट की तरह है जो पहले ब्लूप्रिंट बनाता है (प्लानिंग), और फिर एक बिल्डर जो ब्लूप्रिंट का पालन करता है और हर ईंट के बाद निर्देशों की जाँच करता है (एक्सप्लोरेशन)।
सोचने (प्लानिंग) को करने (सर्चिंग) से अलग करके, APEX-Searcher AI को उन समस्याओं को हल करने में मदद करता है जो पहले उनके लिए बहुत भ्रमित करने वाली थीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।