PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use
PEARL एक नवीन दो-चरणीय ढांचा है जो जटिल मल्टीहॉप टूल उपयोग के लिए लार्ज लैंग्वेज मॉडल्स की योजना बनाने और निष्पादन करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए ऑफलाइन टूल एक्सप्लोरेशन को ऑनलाइन ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) के साथ जोड़ता है, जिससे ToolHop बेंचमार्क पर 56.5% की एक नई स्टेट-ऑफ-द-आर्ट सफलता दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान सहायक (एक लार्ज लैंग्वेज मॉडल) है जो दुनिया के बारे में बहुत कुछ जानता है, लेकिन उसने अपने हाथों से कभी कुछ किया नहीं है। वह कार को कैसे ठीक किया जाए या केक कैसे बनाया जाए, इस बारे में बात तो कर सकता है, लेकिन यदि आप उससे वास्तव में एक रिंच (wrench) का उपयोग करने या ओवन का उपयोग करने के लिए कहते हैं, तो वह गलत उपकरण का अनुमान लगा सकता है, डायल को गलत दिशा में घुमा सकता है, या ऐसे उपकरण का उपयोग करने की कोशिश कर सकता है जो अस्तित्व में ही नहीं है।
यह पेपर PEARL का परिचय देता है, जो एक नया प्रशिक्षण तरीका (training method) है जिसे इस "केवल बोलने वाले" सहायक को एक विश्वसनीय "करने वाला" बनाने के लिए डिज़ाइन किया गया है, जब उसे जटिल समस्याओं को हल करने के लिए डिजिटल उपकरणों (जैसे API) की एक श्रृंखला (chain) का उपयोग करने की आवश्यकता होती है।
PEARL कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
समस्या: "दिन में सपने देखने वाला" सहायक
वर्तमान AI सहायक अक्सर बहु-चरणीय कार्यों (multi-step tasks) के साथ संघर्ष करते हैं। यदि आप उनसे कहते हैं, "एक पार्क खोजें, फिर पता लगाएं कि इसे किसने बनाया, फिर उनके नाम में अक्षरों की गिनती करें," तो वे अक्सर:
- योजना भूल जाते हैं: वे पहले चरण के बाद ही भटक जाते हैं।
- भ्रम (Hallucinate) पैदा करते हैं: वे ऐसे उपकरणों का आविष्कार करते हैं जो मौजूद ही नहीं हैं।
- गलतियाँ करते हैं: वे सही उपकरण का उपयोग करते हैं लेकिन गलत सेटिंग्स के साथ (जैसे दरवाजे को हथौड़े से खोलने की कोशिश करना)।
- हार मान लेते हैं: यदि वे कोई गलती करते हैं, तो उन्हें नहीं पता होता कि उसे कैसे ठीक किया जाए और वे बस गोल-गोल घूमते रहते हैं।
समाधान: PEARL का दो-चरणीय प्रशिक्षण (Two-Stage Training)
PEARL इसे दो अलग-अलग चरणों में विभाजित करके ठीक करता है, जैसे कि एक पायलट को विमान उड़ाने से पहले प्रशिक्षित करना।
चरण 1: "प्लेग्राउंड" (ऑफलाइन टूल एक्सप्लोरेशन)
इससे पहले कि AI कभी किसी वास्तविक उपयोगकर्ता की समस्या को हल करने की कोशिश करे, वह एक सुरक्षित, नियंत्रित "प्लेग्राउंड" में जाता है।
- उपमा (Analogy): कल्पना कीजिए कि एक शेफ जिसने कभी खाना नहीं बनाया है। ग्राहक को परोसने से पहले, वह रसोई में हर बर्तन, पैन और मसाले को छूकर घंटों बिताता है। वह चूल्हा चालू और बंद करने की कोशिश करता है, सामग्री मिलाता है, और देखता है कि गलती करने पर क्या होता है।
- PEARL क्या करता है: AI सक्रिय रूप से परीक्षण-और-त्रुटि (trial-and-error) के तरीके से प्रत्येक उपलब्ध उपकरण का उपयोग करने की कोशिश करता है। यह सीखता है कि "रिंच" (उपकरण) को बिल्कुल कैसे पकड़ना है और क्या होता है यदि वह इसे गलत दिशा में घुमाता है। इससे यह एक "मानसिक यूजर मैनुअल" बनाता है ताकि जब वास्तव में काम करना हो, तो वह लड़खड़ाए नहीं या नकली उपकरण न बनाए।
चरण 2: "जनरल" (रणनीतिक योजना के लिए सुदृढीकरण सीखना - Reinforcement Learning)
एक बार जब AI उपकरणों का उपयोग करना सीख जाता है, तो उसे यह सीखना होता है कि चालों का एक क्रम (sequence) कैसे बनाया जाए।
- उपमा: कल्पना कीजिए कि एक शतरंज खिलाड़ी। यह जानना पर्याप्त नहीं है कि मोहरे कैसे चलते हैं (चरण 1); आपको खेल जीतने के लिए रणनीति की आवश्यकता होती।
- नवाचार: PEARL एक विशेष प्रशिक्षण पद्धति का उपयोग करता है जिसे सुदृढीकरण सीखना (Reinforcement Learning) (विशेष रूप से GRPO) कहा जाता है।
- केवल कार्य के अंत में "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, सिस्टम AI को उसके प्लान के प्रत्येक चरण के लिए एक "स्कोरकार्ड" देता है।
- यदि AI सही कारण के लिए सही उपकरण का उपयोग करने की योजना बनाता है, तो उसे एक अंक मिलता है। यदि वह कोई चरण छोड़ देता है या गलत उपकरण चुनता है, तो उसके अंक कट जाते हैं।
- यह AI को आगे की सोच रखने और कुछ भी शुरू करने से पहले एक सटीक "ब्लूप्रिंट" बनाने के लिए प्रशिक्षित करता है।
परिणाम: एक अत्यंत विश्वसनीय एजेंट
पेपर ने इसका परीक्षण दो कठिन बेंचमार्क (ToolHop और T-Eval) पर किया जहाँ AI को सवालों के जवाब देने के लिए कई उपकरणों को एक साथ जोड़ने की आवश्यकता थी।
- स्कोर: PEARL ने 56.5% सफलता दर हासिल की, जो कि एक नया रिकॉर्ड (State-of-the-Art) है।
- तुलना: इसने बहुत बड़े, अधिक महंगे मॉडलों (जैसे GPT-4o) और उन मॉडलों को मात दी जो केवल मानक प्रशिक्षण के साथ "याद" किए गए थे।
- विश्वसनीयता: इसने वास्तव में उपकरणों को कॉल करते समय बहुत कम गलतियाँ कीं (केवल 3.8% त्रुटि दर), जिससे सिद्ध हुआ कि "प्लेग्राउंड" प्रशिक्षण काम कर गया।
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि PEARL "योजना बनाम निष्पादन" (planning vs. execution) की समस्या को उन्हें अलग करके हल करता है। यह एक समर्पित "प्लानर" (Planner) को रणनीतिक रूप से सोचने के लिए और एक अलग "एक्सेक्यूटर" (Executor) को प्रशिक्षित करता है जो उपकरणों का उपयोग करने में पहले से ही विशेषज्ञ है।
सबसे रोमांचक खोज यह है कि प्लानर योजना बनाने में इतना कुशल है कि यदि आप उसकी योजनाओं को अन्य शक्तिशाली AI मॉडलों को देते हैं, तो वे अन्य मॉडल भी अचानक कार्य में बहुत बेहतर हो जाते हैं। यह एक प्रतिभाशाली जनरल की तरह है जो युद्ध की योजनाएँ लिख सकता है जिसे कोई भी सैनिक, चाहे वह कितना भी अनुभवहीन क्यों न हो, युद्ध जीतने के लिए पालन कर सके।
संक्षेप में: PEARL AI को पहले एक सैंडबॉक्स में उपकरणों का उपयोग करने का अभ्यास करना सिखाता है ताकि वह उन्हें तोड़ न दे, और फिर उसे कुछ भी शुरू करने से पहले एक सटीक चरण-दर-चरण गेम प्लान लिखना सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।