Mango: Multi-Agent Web Navigation via Global-View Optimization
मैंगो (Mango) एक मल्टी-एजेंट वेब नेविगेशन फ्रेमवर्क है जो मल्टी-आर्म्ड बैंडिट दृष्टिकोण के माध्यम से इष्टतम शुरुआती यूआरएल (URLs) को गतिशील रूप से चुनकर और एपिसोडिक मेमोरी का लाभ उठाकर अन्वेषण दक्षता को अनुकूलित करता है, जिससे वेबवॉयेजर (WebVoyager) और वेबवॉकरक्यूए (WebWalkerQA) बेंचमार्क पर अत्याधुनिक सफलता दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अव्यवस्थित लाइब्रेरी वेबसाइट पर एक विशिष्ट, दुर्लभ रेसिपी (व्यंजन विधि) खोजने की कोशिश कर रहे हैं।
पुराना तरीका (पारंपरिक वेब एजेंट्स):
वर्तमान के अधिकांश AI वेब एजेंट्स एक ऐसे व्यक्ति की तरह काम करते हैं जो लाइब्रेरी में प्रवेश करता है और मुख्य दरवाजे (होमपेज) से शुरुआत करता है। उन्हें हर एक गलियारे में जाना पड़ता है, हर शेल्फ की जांच करनी पड़ती है, और एक-एक करके हर किताब का शीर्षक पढ़ना पड़ता है, इस उम्मीद में कि शायद उन्हें वह रेसिपी मिल जाए। यदि लाइब्रेरी में 10,000 गलियारे हैं, तो यह व्यक्ति थक जाता है, उसका समय (बजट) समाप्त हो जाता है, और वह रेसिपी खोजने से पहले ही हार मान लेता है। वे अक्सर गलत गलियारों में फंस जाते हैं या "इतिहास" वाले हिस्से में भटकते रहते हैं जबकि उन्हें "कुकिंग" वाले हिस्से की जरूरत थी।
नया तरीका (MANGO):
यह पेपर MANGO को पेश करता है, जो AI एजेंट्स की एक स्मार्ट टीम है जो खेल को पूरी तरह बदल देती है। बिना सोचे-समझे चलने के बजाय, MANGO तीन चतुर चीजें करता है:
1. "मैप मेकर" (ग्लोबल स्ट्रक्चर एनालिसिस)
टीम के चलने से पहले ही, MANGO एक छोटे, तेज़ ड्रोन को लाइब्रेरी के लेआउट को जल्दी से स्कैन करने के लिए भेजता है। यह हर किताब नहीं पढ़ता; यह केवल दरवाजों पर लगे संकेतों को देखता है।
- यह क्या करता है: यह वेबसाइट का एक रफ मैप बनाता है।
- जादू: कहाँ से शुरू करना है इसका अनुमान लगाने के बजाय, यह एक सर्च इंजन (जैसे Google) का उपयोग करके पूछता है, "रेसिपी सेक्शन कहाँ है?" और फिर प्रवेश करने के लिए 10 सबसे संभावित दरवाजों को चुन लेता है। यह "इतिहास" और "स्पोर्ट्स" जैसे सेक्शन को पूरी तरह से छोड़ देता है।
2. "गैम्बलर्स स्ट्रेटेजी" (थॉम्पसन सैंपलिंग)
अब, टीम के पास 10 संभावित दरवाजे हैं। उनके पास केवल कुछ ही आज़माने की ऊर्जा है। वे यह कैसे तय करते हैं कि पहले कौन सा दरवाजा खोलना है?
- उपमा: कल्पना करें कि 10 लीवर वाली एक स्लॉट मशीन है। आपको नहीं पता कि कौन सा लीवर इनाम देगा, लेकिन आप जल्दी से विजेता खोजना चाहते हैं।
- MANGO कैसे काम करता है: यह थॉम्पसन सैंपलिंग नामक एक गणितीय ट्रिक का उपयोग करता है। यह एक स्मार्ट जुआरी की तरह है जो कहता है, "मैप के आधार पर दरवाजा A आशाजनक लग रहा है, इसलिए मैं इसे पहले आज़माऊंगा। लेकिन मैं दरवाजा B को भी ध्यान में रखूंगा, क्योंकि क्या पता वह सही हो।"
- सीखना: यदि दरवाजा A एक डेड एंड (बंद रास्ता) निकलता है, तो टीम उसे "बुरा भाग्य" के रूप में चिह्नित करती है और वहां ऊर्जा बर्बाद करना बंद कर देती है। यदि दरवाजा A एक ऐसा गलियारा है जहाँ अधिक सुराग मिलते हैं, तो टीम उत्साहित हो जाती है और उस रास्ते पर अधिक ऊर्जा केंद्रित करती है। यह अपने "अंतर्ज्ञान" को लगातार अपडेट करती रहती है।
3. "नोटबुक" (एपिसोडिक मेमोरी)
यदि टीम ने एक दरवाजा आज़माया और असफल रही, तो वे उसे केवल भूल नहीं जाते। वे एक साझा नोटबुक में एक नोट लिखते हैं: "दरवाजा 3 एक टूटे हुए लिफ्ट की ओर ले गया। वहां दोबारा न जाएं।"
- क्यों महत्वपूर्ण है: यदि टीम को बाद में फिर से दरवाजा 3 आज़माना पड़ता है (शायद वे भ्रमित हो गए हों), तो वे नोटबुक देखते हैं, चेतावनी पढ़ते हैं, और वही गलती दोबारा करने से बचते हैं। यह उन्हें गोल-गोल घूमने से रोकता है।
परिणाम
शोधकर्ताओं ने दो विशाल वेबसाइटों (जैसे Amazon और शैक्षिक साइटों) पर MANGO का परीक्षण किया, जहाँ समय की बहुत सख्त सीमाएँ थीं।
- परिणाम: MANGO पुराने "सामने के दरवाजे से चलने" वाले तरीके की तुलना में कहीं अधिक बार उत्तर खोजने में सफल रहा।
- समझौता (Trade-off): कभी-कभी MANGO ने किसी बहुत कठिन पहेली को हल करने के लिए कुछ अधिक कदम (एक्शन) लिए, लेकिन यह सार्थक था क्योंकि इसने वास्तव में पहेली को हल किया, बजाय इसके कि वह बीच में ही हार मान ले।
सारांश में
MANGO को एक स्मार्ट जासूस के रूप में समझें जो:
- पहले हेलीकॉप्टर से अपराध स्थल का मुआयना करता है (ग्लोबल व्यू)।
- रैंडम अनुमान लगाने के बजाय, संभावना के आधार पर संदेही चुनने के लिए सबसे अच्छे संदिग्धों का चयन करता है (थॉम्पसन सैंपलिंग)।
- एक केस फाइल रखता है ताकि वे कभी भी एक ही सवाल दोबारा न पूछें या एक ही गलत सुराग के पीछे न भागें (एपिसोडिक मेमोरी)।
यह दृष्टिकोण AI को पहले की तुलना में बहुत तेज़ी से और अधिक सफलतापूर्वक गहरे, अव्यवस्थित इंटरनेट को नेविगेट करने की अनुमति देता है, जिससे एक अंधेरी खोज एक लक्षित शिकार में बदल जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।