← नवीनतम पेपर
💬 NLP

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

यह शोध पत्र AgentFlow को प्रस्तुत करता है, जो एक प्रशिक्षित इन-द-फ्लो एजेंटिक फ्रेमवर्क है जो एक मल्टी-टर्न लूप के भीतर एक विशेषीकृत प्लानर को अनुकूलित करने के लिए एक नवीन Flow-GRPO एल्गोरिदम का उपयोग करता है, जो विविध रीजनिंग और टूल-यूज़ बेंचमार्क में मौजूदा बेसलाइन्स और बड़े प्रोप्रायटरी मॉडल्स की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

मूल लेखक: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

प्रकाशित 2026-07-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को रहस्य सुलझाना सिखाने की कोशिश कर रहे हैं। आप नहीं चाहते कि वह केवल अनुमान लगाए; आप चाहते हैं कि वह सच का पता लगाने के लिए एक मानचित्र, एक आवर्धक लेंस (मैग्नीफाइंग ग्लास) और एक कैलकुलेटर का उपयोग करे। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो विशाल, सुशिक्षित दिमागों की तरह हैं जो बात कर सकते हैं और तर्क कर सकते हैं। हाल ही में, वैज्ञानिकों ने इन दिमागों को और भी तेज बनाने का एक तरीका खोजा है: वे एक समस्या को हल करने का प्रयास करते हैं, अंत में उन्हें "अच्छा काम किया" या "फिर से प्रयास करें" का संकेत मिलता है, और वे उस परिणाम से सीखते हैं। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है।

हालाँकि, इसमें एक पेंच है। जब समस्याएँ बहुत लंबी और जटिल हो जाती हैं—जैसे कि बीस सुरागों और पांच अलग-अलग उपकरणों (एक सर्च इंजन, एक कोड लेखक, एक तथ्य-जांचकर्ता) वाली एक जासूसी कहानी—तो इन रोबोटों को एक साथ सिखाना गड़बड़ हो जाता है। यह एक साथ कार चलाना, विमान उड़ाना और नाव चलाना सीखने जैसा है, जबकि आपकी आँखों पर पट्टी बंधी हो। रोबोट भ्रमित हो जाता है, शुरुआत में गलतियाँ करता है, और यह समझ नहीं पाता कि किस विशिष्ट कदम के कारण दुर्घटना हुई। वर्तमान की अधिकांश प्रणालियाँ या तो एक विशाल मस्तिष्क के रूप में सब कुछ करने की कोशिश करती हैं (जो लंबे कार्यों के लिए संघर्ष करता है) या रोबतों की एक ऐसी टीम का उपयोग करती हैं जो एक-दूसरे से नहीं सीखतीं (जो अपनी मूल, अपरिवर्तनीय आदतों में फंसी रहती हैं)।

यह शोध पत्र इन AI टीमों को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे AGENTFLOW कहा जाता है। इसे एक गतिशील, जीवंत कार्यशाला के रूप में सोचें जहाँ विशेषज्ञ रोबोटों की एक टीम वास्तविक समय में मिलकर काम करती है। एक विशाल मस्तिष्क द्वारा सब कुछ करने के बजाय, AGENTFLOW काम को विभाजित करता है: एक प्लानर (Planner) अगला कदम तय करता है, एक एक्सेक्यूटर (Executor) कार्य करता है (जैसे वेब पर खोजना), एक वेरिफायर (Verifier) जाँचता है कि क्या परिणाम तर्कसंगत है, और एक जेनरेटर (Generator) अंतिम उत्तर लिखता है। वे सभी एक "मेमोरी बोर्ड" साझा करते हैं जो हर एक कदम के बाद अपडेट होता है। जादू यह है कि प्लानर कार्य पूरा होने के बाद नहीं, बल्कि टीम के काम करने के दौरान ही सीखता है।

शोधकर्ताओं ने एक विशेष प्रशिक्षण पद्धति विकसित की है जिसे Flow-GRPO कहा जाता है। "हॉट पोटैटो" (गर्म आलू) के खेल की कल्पना करें जहाँ टीम हर मोड़ पर प्रत्येक खिलाड़ी को एक एकल "सफलता" या "विफलता" टोकन वापस पास करती है। यदि टीम अंत में रहस्य सुलझा लेती है, तो उनके द्वारा उठाए गए हर एक कदम को "अच्छा काम किया!" का संकेत मिलता है। यदि वे विफल होते हैं, तो हर कदम को "फिर से प्रयास करें" का संकेत मिलता है। यह प्लानर को यह समझने में मदद करता है कि शुरुआत में लिए गए छोटे निर्णय भी अंतिम परिणाम के लिए कितने महत्वपूर्ण हैं। इस तरह से प्रशिक्षित करके, सिस्टम तुरंत अनुकूलित होना, अपनी गलतियों को सुधारना और काम के लिए सही उपकरण चुनना सीख जाता है।

परिणाम प्रभावशाली हैं। टीम ने दस अलग-अलग प्रकार की कठिन पहेलियों पर इस प्रणाली का परीक्षण किया, जिसमें दुर्लभ तथ्यों को खोजने से लेकर जटिल गणितीय समस्याओं और वैज्ञानिक प्रश्नों को हल करना शामिल है। भले ही उन्होंने एक अपेक्षाकृत छोटा "मस्तिष्क" (7-बिलियन पैरामीटर मॉडल) का उपयोग किया, AGENTFLOW ने GPT-4o (जिसमें लगभग 200 बिलियन पैरामीटर हैं) जैसे बड़े, प्रसिद्ध मॉडलों और अन्य विशेष AI प्रणालियों को भी पीछे छोड़ दिया। उदाहरण के लिए, खोज-प्रधान कार्यों पर, इसने सटीकता में लगभग 15% का सुधार किया, और गणित की समस्याओं पर, यह 14% से अधिक बढ़ गया। अध्ययन यह दर्शाता है कि AI टीम को बातचीत के प्रवाह में, अलगाव में रहने के बजाय, एक साथ सीखने देने से, वे योजना बनाने, उपकरणों का उपयोग करने और कई चरणों वाले समाधानों को हल करने में बहुत बेहतर हो जाते हैं। यह केवल एक बड़ा मस्तिष्क रखने के बारे में नहीं है; यह टीम को प्रभावी ढंग से एक साथ काम करना सिखाने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →