EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems
EvoMAS एक नवीन ढांचा है जो मेटा-स्तर की क्रमिक निर्णय प्रक्रिया के माध्यम से निष्पादन-समय वर्कफ्लो (execution-time workflows) को गतिशील रूप से निर्मित और अनुकूलित करना सीखकर स्थिर, वन-शॉट मल्टी-एजेंट डिज़ाइनों की सीमाओं को संबोधित करता है, जिससे जटिल, दीर्घ-अवधि वाले कार्यों पर प्रदर्शन में उल्लेखनीय सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, बहु-चरणीय पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि एक जटिल यात्रा की योजना बनाना जिसमें उड़ानें बुक करना, होटल खोजना, वीज़ा आवश्यकताओं की जांच करना और दैनिक गतिविधियों का खाका तैयार करना शामिल है।
पुराना तरीका ("वन-शॉट" योजना)
अधिकांश वर्तमान AI सिस्टम एक ऐसे व्यक्ति की तरह काम करते हैं जो घर से निकलने से पहले एक कठोर यात्रा कार्यक्रम (itinerary) लिख देता है। वे तय करते हैं: "पहले, मैं वेब पर खोज करूँगा। फिर, मैं एक ईमेल लिखूँगा। फिर, मैं बजट की गणना करूँगा।" वे शुरू से अंत तक इसी सटीक योजना पर टिके रहते हैं, भले ही उन्हें आधे रास्ते में एहसास हो जाए कि उन्हें गंतव्य बदलना है या कोई उड़ान रद्द हो गई है। यदि योजना शुरुआत में थोड़ी भी गलत थी, तो पूरी यात्रा विफल हो जाती है क्योंकि वे अनुकूलित (adapt) नहीं हो सकते।
नया तरीका: EvoMAS
यह पेपर पेश करता है कि EvoMAS एक कठोर योजनाकार के बजाय एक लचीले अभियान नेता (flexible expedition leader) की तरह कार्य करता है। एक निश्चित स्क्रिप्ट पहले से लिखने के बजाय, EvoMAS कार्य के दौरान ही निर्णय लेता है।
यह कैसे काम करता है, इसे सरल भागों में यहाँ दियाया गया है:
1. "मिशन कंट्रोल" (टास्क स्टेट कंस्ट्रक्शन)
कल्पना कीजिए कि गुफा में खोजकर्ताओं की एक टीम है। हर बार जब वे एक कदम उठाते हैं, तो वे केवल चलते नहीं रहते; वे एक नक्शा अपडेट करने के लिए रुकते हैं।
- प्लानर (Planner): यह देखता है कि वे कहाँ हैं और तय करता है, "ठीक है, हमें पहला सुराग मिल गया है, लेकिन हमें और गहराई में जाने की आवश्यकता है। चलिए अपनी अगली चाल बदलते हैं।"
- इवैल्यूएटर (Evaluator): एक गुणवत्ता निरीक्षक (quality inspector) की तरह कार्य करता है। "क्या हमें वास्तव में सुराग मिला, या हमने सिर्फ एक पत्थर पाया जो एक सुराग जैसा दिखता है?"
- अपडेटर (Updater): नक्शा, नए निष्कर्ष और निरीक्षक के नोट्स लेकर, वर्तमान स्थिति का एक ताज़ा, अपडेटेड सारांश लिखता है।
यह सारांश टास्क स्टेट (Task State) है। यह सिस्टम को ठीक-ठीक बताता है कि क्या हुआ है, क्या गायब है, और अभी इस समय क्या ठीक करने की आवश्यकता है।
2. "टूलबॉक्स" (एजेंट पूल)
EvoMAS के पास विभिन्न "एजेंटों" (विशेषज्ञ AI सहायकों) का एक निश्चित टूलबॉक्स है। कुछ वेब खोजने में अच्छे हैं, कुछ कोड लिखने में अच्छे हैं, कुछ तथ्यों की दोबारा जांच करने में अच्छे हैं, और कुछ बस एक त्वरित उत्तर देने में अच्छे हैं।
- पुराना तरीका: टीम शुरुआत में तीन उपकरण चुनती है और पूरी यात्रा के लिए केवल उन्हीं तीन का उपयोग करती है।
- EvoMAS का तरीका: यात्रा के हर चरण में, मिशन कंट्रोल अपडेटेड मैप (टास्क स्टेट) को देखता है और पूछता है, "हमें अभी किसकी आवश्यकता है?"
- यात्रा की शुरुआत में? "हमें जानकारी जुटाने के लिए वेब सर्च (Web Search) एजेंट की आवश्यकता है।"
- यात्रा के बीच में? "हमें अपनी एक गलती को सुधारने के लिए सेल्फ-रिफाइन (Self-Refine) एजेंट की आवश्यकता है।"
- यात्रा के अंत में? "हमें अपने सभी नोट्स को एक अंतिम उत्तर में संयोजित करने के लिए एन्सेम्बल (Ensemble) एजेंट की आवश्यकता है।"
3. "लर्निंग कोच" (वर्कफ़्लो अडैप्टर)
सिस्टम को यह कैसे पता चलता है कि किन उपकरणों को चुनना है? यह प्रयास और त्रुटि (trial and error) के माध्यम से सीखता है, ठीक वैसे ही जैसे एक वीडियो गेम का पात्र लेवल को जीतने के लिए सीखता है।
- सिस्टम एजेंटों के विभिन्न संयोजनों (वर्कफ्फ़्लो) को आज़माता है।
- यदि संयोजन एक सफल समाधान की ओर ले जाता है, तो "कोच" (वर्कफ़्लो अडैप्टर) को एक इनाम मिलता है और वह याद रखता है, "हे, सर्च एजेंट के बाद रिफाइन एजेंट को चुनना अच्छा रहा!"
- यदि यह विफल होता है, तो कोच उस विशिष्ट संयोजन से बचना सीख जाता है।
- महत्वपूर्ण बात यह है कि सिस्टम मुख्य रूप से अंतिम परिणाम से सीखता है (क्या हमने पहेली सुलझाई? हाँ/नहीं)। इसे हर एक चरण को ग्रेड करने के लिए किसी इंसान की आवश्यकता नहीं होती है, जो इसे बहुत कुशल बनाता है।
यह बेहतर क्यों है?
पेपर में EvoMAS का परीक्षण उन कठिन कार्यों पर किया गया जिनमें कई चरणों की आवश्यकता होती है, जैसे जटिल शोध या बहु-भाग वाली गणित की समस्याओं को हल करना।
- स्थिर सिस्टम (Static systems) (पुराना तरीका) अक्सर फंस जाते हैं क्योंकि वे चीजें गलत होने पर अपनी योजना नहीं बदल सकते।
- EvoMAS अनुकूलित होता है। यदि पहला प्रयास विफल होता है, तो यह अपने "मिशन स्टेट" को अपडेट करता है, महसूस करता है कि योजना टूट गई है, और तुरंत एक अलग दृष्टिकोण आज़माने के लिए अपनी टीम को पुनर्गठित करता है।
परिणाम
प्रयोगों में, EvoMAS ने निम्नलिखित को हराया:
- सिंगल AI एजेंट्स (सिर्फ एक स्मार्ट रोबोट जो सब कुछ अकेले करने की कोशिश कर रहा है)।
- अन्य स्वचालित सिस्टम जो शुरू करने से पहले एक आदर्श योजना बनाने की कोशिश करते हैं।
पेपर दिखाता है कि लगातार "मैप" (टास्क स्टेट) की जांच करके और उस सटीक क्षण में जो आवश्यक है उसके आधार पर "टीम" (वर्कफ़्लो) को पुनर्गठित करके, यह सिस्टम पहले की तुलना में बहुत कठिन समस्याओं को हल कर सकता है।
संक्षेप में: EvoMAS केवल एक स्क्रिप्ट का पालन नहीं करता है; यह पिछले दृश्य के परिणाम के आधार पर फिल्म के हर दृश्य के लिए एक नई स्क्रिप्ट लिखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।