In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
यह शोध पत्र AgentFlow को प्रस्तुत करता है, जो एक प्रशिक्षित इन-द-फ्लो एजेंटिक फ्रेमवर्क है जो एक मल्टी-टर्न लूप के भीतर एक विशेषीकृत प्लानर को अनुकूलित करने के लिए एक नवीन Flow-GRPO एल्गोरिदम का उपयोग करता है, जो विविध रीजनिंग और टूल-यूज़ बेंचमार्क में मौजूदा बेसलाइन्स और बड़े प्रोप्रायटरी मॉडल्स की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को रहस्य सुलझाना सिखाने की कोशिश कर रहे हैं। आप नहीं चाहते कि वह केवल अनुमान लगाए; आप चाहते हैं कि वह सच का पता लगाने के लिए एक मानचित्र, एक आवर्धक लेंस (मैग्नीफाइंग ग्लास) और एक कैलकुलेटर का उपयोग करे। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो विशाल, सुशिक्षित दिमागों की तरह हैं जो बात कर सकते हैं और तर्क कर सकते हैं। हाल ही में, वैज्ञानिकों ने इन दिमागों को और भी तेज बनाने का एक तरीका खोजा है: वे एक समस्या को हल करने का प्रयास करते हैं, अंत में उन्हें "अच्छा काम किया" या "फिर से प्रयास करें" का संकेत मिलता है, और वे उस परिणाम से सीखते हैं। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है।
हालाँकि, इसमें एक पेंच है। जब समस्याएँ बहुत लंबी और जटिल हो जाती हैं—जैसे कि बीस सुरागों और पांच अलग-अलग उपकरणों (एक सर्च इंजन, एक कोड लेखक, एक तथ्य-जांचकर्ता) वाली एक जासूसी कहानी—तो इन रोबोटों को एक साथ सिखाना गड़बड़ हो जाता है। यह एक साथ कार चलाना, विमान उड़ाना और नाव चलाना सीखने जैसा है, जबकि आपकी आँखों पर पट्टी बंधी हो। रोबोट भ्रमित हो जाता है, शुरुआत में गलतियाँ करता है, और यह समझ नहीं पाता कि किस विशिष्ट कदम के कारण दुर्घटना हुई। वर्तमान की अधिकांश प्रणालियाँ या तो एक विशाल मस्तिष्क के रूप में सब कुछ करने की कोशिश करती हैं (जो लंबे कार्यों के लिए संघर्ष करता है) या रोबतों की एक ऐसी टीम का उपयोग करती हैं जो एक-दूसरे से नहीं सीखतीं (जो अपनी मूल, अपरिवर्तनीय आदतों में फंसी रहती हैं)।
यह शोध पत्र इन AI टीमों को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे AGENTFLOW कहा जाता है। इसे एक गतिशील, जीवंत कार्यशाला के रूप में सोचें जहाँ विशेषज्ञ रोबोटों की एक टीम वास्तविक समय में मिलकर काम करती है। एक विशाल मस्तिष्क द्वारा सब कुछ करने के बजाय, AGENTFLOW काम को विभाजित करता है: एक प्लानर (Planner) अगला कदम तय करता है, एक एक्सेक्यूटर (Executor) कार्य करता है (जैसे वेब पर खोजना), एक वेरिफायर (Verifier) जाँचता है कि क्या परिणाम तर्कसंगत है, और एक जेनरेटर (Generator) अंतिम उत्तर लिखता है। वे सभी एक "मेमोरी बोर्ड" साझा करते हैं जो हर एक कदम के बाद अपडेट होता है। जादू यह है कि प्लानर कार्य पूरा होने के बाद नहीं, बल्कि टीम के काम करने के दौरान ही सीखता है।
शोधकर्ताओं ने एक विशेष प्रशिक्षण पद्धति विकसित की है जिसे Flow-GRPO कहा जाता है। "हॉट पोटैटो" (गर्म आलू) के खेल की कल्पना करें जहाँ टीम हर मोड़ पर प्रत्येक खिलाड़ी को एक एकल "सफलता" या "विफलता" टोकन वापस पास करती है। यदि टीम अंत में रहस्य सुलझा लेती है, तो उनके द्वारा उठाए गए हर एक कदम को "अच्छा काम किया!" का संकेत मिलता है। यदि वे विफल होते हैं, तो हर कदम को "फिर से प्रयास करें" का संकेत मिलता है। यह प्लानर को यह समझने में मदद करता है कि शुरुआत में लिए गए छोटे निर्णय भी अंतिम परिणाम के लिए कितने महत्वपूर्ण हैं। इस तरह से प्रशिक्षित करके, सिस्टम तुरंत अनुकूलित होना, अपनी गलतियों को सुधारना और काम के लिए सही उपकरण चुनना सीख जाता है।
परिणाम प्रभावशाली हैं। टीम ने दस अलग-अलग प्रकार की कठिन पहेलियों पर इस प्रणाली का परीक्षण किया, जिसमें दुर्लभ तथ्यों को खोजने से लेकर जटिल गणितीय समस्याओं और वैज्ञानिक प्रश्नों को हल करना शामिल है। भले ही उन्होंने एक अपेक्षाकृत छोटा "मस्तिष्क" (7-बिलियन पैरामीटर मॉडल) का उपयोग किया, AGENTFLOW ने GPT-4o (जिसमें लगभग 200 बिलियन पैरामीटर हैं) जैसे बड़े, प्रसिद्ध मॉडलों और अन्य विशेष AI प्रणालियों को भी पीछे छोड़ दिया। उदाहरण के लिए, खोज-प्रधान कार्यों पर, इसने सटीकता में लगभग 15% का सुधार किया, और गणित की समस्याओं पर, यह 14% से अधिक बढ़ गया। अध्ययन यह दर्शाता है कि AI टीम को बातचीत के प्रवाह में, अलगाव में रहने के बजाय, एक साथ सीखने देने से, वे योजना बनाने, उपकरणों का उपयोग करने और कई चरणों वाले समाधानों को हल करने में बहुत बेहतर हो जाते हैं। यह केवल एक बड़ा मस्तिष्क रखने के बारे में नहीं है; यह टीम को प्रभावी ढंग से एक साथ काम करना सिखाने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।