← नवीनतम पेपर
🤖 AI

Planner Matters! An Efficient and Unbalanced Multi-agent Collaboration Framework for Long-horizon Planning

यह शोध पत्र "प्लैनर मैटर्स" (Planner Matters) का प्रस्ताव करता है, जो एक कुशल मल्टी-एजेंट फ्रेमवर्क है जो व्यवस्थित विश्लेषण और सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से यह प्रदर्शित करता है कि मॉडल की क्षमता और अनुकूलन को एक उच्च-स्तरीय प्लैनर पर केंद्रित करना—जबकि निष्पादन (execution) और मेमोरी घटकों को फ्रीज कर दिया जाता है—वेब नेविगेशन, ओएस कंट्रोल और टूल उपयोग के माध्यम से दीर्घकालिक कार्यों के स्वचालन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Wenyi Wu, Sibo Zhu, Kun Zhou, Biwei Huang

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenyi Wu, Sibo Zhu, Kun Zhou, Biwei Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: क्यों एक दिमाग काफी नहीं है

कल्पना कीजिए कि आप आंखों पर पट्टी बांधकर एक फ्लैट-पैक बॉक्स से फर्नीचर का एक जटिल हिस्सा बनाने की कोशिश कर रहे हैं, और आप केवल उस व्यक्ति पर निर्भर हैं जो आपको बता रहा है कि आप क्या देख रहे हैं। यदि आप सब कुछ एक साथ करने की कोशिश करते हैं—ब्लूप्रिंट समझना, सही पेंच ढूंढना और उसे कसना—तो आप घबरा सकते हैं। आप गलत पेंच कस सकते हैं क्योंकि आपका पूरा ध्यान ब्लूप्रिंट पर था, या आप ब्लूप्रिंट भूल सकते हैं क्योंकि आपका पूरा ध्यान पेंच पर था।

यह वर्तमान AI एजेंटों के सामने आने वाली समस्या है। वे एक "सुपर-ब्रेन" बनने की कोशिश कर रहे हैं जो पूरी यात्रा की योजना भी बनाए और कार भी चलाए। इस पेपर के लेखक तर्क देते हैं कि यह दृष्टिकोण अक्षम है। इसके बजाय, वे काम को तीन अलग-अलग भूमिकाओं में विभाजित करने का प्रस्ताव देते हैं, जैसे कि एक छोटी निर्माण टीम:

  1. द प्लानर (फोरमैन/सुपरवाइजर): यह एजेंट कभी भी औजारों को हाथ नहीं लगाता। इसका एकमात्र काम बड़े चित्र (big picture) को देखना, प्रोजेक्ट को चरणों में तोड़ना और रणनीति तय करना है।
  2. द एक्टर (वर्कर/मजदूर): यह एजेंट शारीरिक कार्य करता है। यह फोरमैन के निर्देशों को पढ़ता है और बटन क्लिक करता है, टेक्स्ट टाइप करता है या स्क्रीन स्क्रॉल करता है। यह "क्यों" की चिंता नहीं करता, बस "कैसे" पर ध्यान देता है।
  3. द मेमोरी मैनेजर (लाइब्रेरियन/पुस्तकालयाध्यक्ष): यह एजेंट एक नोटबुक रखता है कि क्या हुआ है। यह फोरमैन को पिछली गलतियों या सफल युक्तियों की याद दिलाता है ताकि उन्हें पहिया दोबारा बनाने (reinvent the wheel) की जरूरत न पड़े।

बड़ी खोज: फोरमैन सबसे महत्वपूर्ण है

शोधकर्ताओं ने यह देखने के लिए प्रयोगों की एक श्रृंखला चलाई कि उन्हें अपनी "कंप्यूटिंग पावर" (AI की दिमागी शक्ति) कहाँ खर्च करनी चाहिए। उन्होंने पूछा: यदि हम फोरमैन को स्मार्ट बनाते हैं, या वर्कर को मजबूत करते हैं, या लाइब्रेरियन को तेज करते हैं, तो किससे सबसे अधिक मदद मिलेगी?

जवाब चौंकाने वाला था: सब कुछ फोरमैन (प्लानर) के बारे में है।

  • उपमा (Analogy): कल्पना कीजिए कि आपके पास तीन लोगों की एक टीम है। यदि आप एक जीनियस आर्किटेक्ट (प्लानर) को काम पर रखते हैं लेकिन उन्हें एक साधारण राजमिस्त्री (एक्टर) और एक मानक नोट-टेकर (मेमोरी) देते हैं, तो इमारत सफलतापूर्वक बन जाती है। लेकिन यदि आप एक विश्व स्तरीय राजमिस्त्री और एक सुपर-फास्ट नोट-टेकर को काम पर रखते हैं लेकिन उन्हें एक भ्रमित आर्किटेक्ट देते हैं, तो इमारत फिर भी गिर जाएगी।
  • निष्कर्ष: पेपर दिखाता है कि प्लानर की बुद्धिमत्ता को अपग्रेड करने से सफलता दर में भारी सुधार होता है। इसके विपरीत, एक्टर या मेमोरी मैनेजर को बहुत बड़ा या स्मार्ट बनाने से परिणाम में बहुत कम बदलाव आता है। "बॉटलनेक" (रुकावट) लगभग हमेशा प्लानिंग ही होती है।

समाधान: फोरमैन को प्रशिक्षित करें, बाकी को फ्रीज रखें

इस खोज के आधार पर, लेखकों ने एक नई प्रशिक्षण विधि बनाई। आमतौर पर, जब आप एक AI को प्रशिक्षित करते हैं, तो आप पूरे सिस्टम को एक साथ सुधारने की कोशिश करते हैं। लेकिन यहाँ, उन्होंने कुछ अलग किया:

  1. उन्होंने एक्टर और मेमोरी मैनेजर को बिल्कुल वैसा ही रखा (फ्रीज कर दिया)। उन्होंने उनमें कोई बदलाव नहीं किया।
  2. उन्होंने अपनी 100% प्रशिक्षण ऊर्जा केवल प्लानर पर केंद्रित की।
  3. उन्होंने एक "VLM-as-judge" (एक बहुत ही स्मार्ट AI जज) का उपयोग किया जो पूरे पूरे कार्य को देखता है। क्या एजेंट सफल रहा? यदि हाँ, तो प्लानर को उच्च स्कोर मिलता है। यदि नहीं, तो प्लानर को कम स्कोर मिलता है।
  4. प्लानर इन स्कोर से बेहतर योजनाएं बनाना सीखता है, जबकि वर्कर बस वही करता रहता है जो उसे बताया जाता है।

परिणाम: स्मार्ट प्लानिंग, सस्ता कंप्यूटिंग

परिणाम प्रभावशाली थे। केवल प्लानर पर ध्यान केंद्रित करके:

  • प्रदर्शन आसमान छू गया: एक ओपन-सोर्स AI मॉडल (Qwen2.5-7B) ने इस "प्लानर-सेंट्रिक" सेटअप के साथ जटिल वेब कार्यों पर GPT-4o और Gemini-2.5-Pro जैसे बहुत अधिक महंगे, क्लोज्ड-सोर्स दिग्गजों से बेहतर प्रदर्शन किया।
  • दक्षता (Efficiency): उन्हें पूरी टीम के लिए अधिक शक्तिशाली कंप्यूटर खरीदने की आवश्यकता नहीं पड़ी। उन्होंने बस "फोरमैन" को स्मार्ट बनाया, और पूरी टीम बेहतर काम करने लगी।
  • बहुमुखी प्रतिभा (Versatility): यह दृष्टिकोण न केवल वेबसाइट ब्राउज़ करने के लिए, बल्कि कंप्यूटर ऑपरेटिंग सिस्टम को नियंत्रित करने और सॉफ्टवेयर टूल्स का उपयोग करने के लिए भी काम आया।

सारांश

यह पेपर तर्क देता है कि AI एजेंटों को लंबे, जटिल कार्यों को संभालने के लिए, हमें केवल पूरे AI को बड़ा नहीं बनाना चाहिए। इसके बजाय, हमें विशेषज्ञता (specialize) हासिल करनी चाहिए। हमें एक समर्पित, अत्यधिक बुद्धिमान "प्लानर" की आवश्यकता है जो रणनीति को संभाले, जबकि सरल, छोटे मॉडलों को निष्पादन (execution) और मेमोरी संभालने दें। प्लानर को विशेष रूप से सर्वश्रेष्ठ निर्णय लेने वाला बनाने के लिए प्रशिक्षित करके, हम ऐसे एजेंट बना सकते हैं जो अधिक स्मार्ट, अधिक विश्वसनीय और अधिक कुशल हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →