AI Planning Framework for LLM-Based Web Agents
यह शोध पत्र एक एआई प्लानिंग फ्रेमवर्क प्रस्तावित करता है जो सिद्धांतों के आधार पर विफलता निदान (failure diagnosis) को सक्षम करने के लिए एलएलएम-आधारित वेब एजेंट आर्किटेक्चर को पारंपरिक खोज प्रतिमानों (बीएफएस, डीएफएस, बेस्ट-फर्स्ट) के साथ मैप करता है, और यह प्रदर्शित करने के लिए नए मूल्यांकन मेट्रिक्स और एक मानव-लेबल वाले डेटासेट को पेश करता है कि विभिन्न एजेंट रणनीतियाँ कार्य निष्पादन के विशिष्ट पहलुओं, जैसे कि मानव-समान प्रक्षेपवक्र संरेखण बनाम तकनीकी तत्व सटीकता में उत्कृष्ट होती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भ्रमित रोबोट को इंटरनेट पर आपके काम करने के लिए सिखाने की कोशिश कर रहे हैं। आप उसे कहते हैं, "दुकान पर जाओ, दूध खरीदो, और फिर मौसम चेक करो।"
अतीत में, ये रोबोट एक स्क्रिप्ट का पालन करने वाले कठोर रोबोटों की तरह थे: "यहाँ क्लिक करें, फिर वहाँ क्लिक करें।" यदि वेबसाइट थोड़ी सी भी बदल जाती (जैसे कि "Buy" बटन का स्थान बदल जाना), तो रोबोट क्रैश हो जाता था।
अब, हमारे पास AI Agents हैं जो Large Language Models (LLMs) द्वारा संचालित हैं। ये सुपर-स्मार्ट इंटर्न की तरह हैं जो आपकी रिक्वेस्ट को पढ़ और समझ सकते हैं। लेकिन एक समस्या है: वे अक्सर एक ब्लैक बॉक्स (black box) की तरह व्यवहार करते हैं। आप उन्हें क्लिक करते हुए देखते हैं, लेकिन आपको पता नहीं चलता कि उन्होंने वह क्यों क्लिक किया, या वे अचानक दूध खरीदने के बजाय बिल्ली के वीडियो देखने क्यों लगे।
यह पेपर इन AI इंटर्न के लिए एक डायग्नोस्टिक मैनुअल (diagnostic manual) की तरह है। यह हमें यह समझने का एक नया तरीका देता है कि वे कैसे सोचते हैं, हम कैसे पहचान सकते हैं कि वे कहाँ गलत हो रहे हैं, और हम यह कैसे माप सकते हैं कि वे वास्तव में कितना अच्छा काम कर रहे हैं।
यहाँ उनके विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. यात्रा की योजना बनाने के तीन तरीके
लेखक कहते हैं कि ये सभी AI एजेंट मूल रूप से एक भूलभुलैया (maze) को हल करने की कोशिश कर रहे हैं। वे उन्हें तीन अलग-अलग "प्लानिंग स्टाइल" में वर्गीकृत करते हैं, जो क्लासिक सर्च मेथड्स से तुलना करते हैं:
"स्टेप-बाय-स्टेप" एजेंट (The Breadth-First Explorer):
- उपमा: कल्पना कीजिए कि आप एक जंगल में चल रहे हैं। हर एक कदम पर, आप रुकते हैं, अपने सामने के तीन रास्तों को देखते हैं, सबसे अच्छा रास्ता चुनते हैं, एक कदम उठाते हैं, और फिर नए तीन रास्तों को देखने के लिए फिर से रुक जाते हैं।
- यह कैसे काम करता है: AI वर्तमान वेबपेज को देखता है, एक क्रिया (जैसे "लॉगिन बटन पर क्लिक करें") तय करता है, उसे करता है, देखता है कि क्या हुआ, और फिर अगला निर्णय लेता है।
- फायदे: यह बहुत लचीला है। यदि वेबसाइट बदल जाती है, तो यह तुरंत ढल जाता है।
- नुकसान: यह आसानी से "खो" सकता है। यह बड़े लक्ष्य (दूध खरीदना) को भूल सकता है क्योंकि यह अगले तत्काल कदम पर बहुत अधिक केंद्रित है।
"ट्री सर्च" एजेंट (The Branching Detective):
- उपमा: यह एजेंट एक जासूस की तरह है जो आगे बढ़ने से पहले हर संभावित रास्ते का नक्शा बनाता है। वह कल्पना करता है "यदि मैं यहाँ क्लिक करता हूँ, तो क्या होगा? यदि मैं वहाँ क्लिक करता हूँ, तो क्या होगा?" वह सबसे अच्छे मार्ग को खोजने के लिए एक साथ कई शाखाओं (branches) की खोज करता है।
- यह कैसे काम करता है: यह संभावनाओं के एक मानसिक पेड़ (mental tree) को बनाए रखता है और सबसे आशाजनक शाखा को चुनकर उसका अनुसरण करता है।
"फुल-प्लान-इन-एडवांस" एजेंट (The Depth-First Planner):
- उपमा: यह परम योजनाकार है। घर से निकलने से पहले, यह पूरा कार्यक्रम लिख देता है: "1. ब्राउज़र खोलें। 2. Amazon पर जाएँ। 3. दूध खोजें। 4. खरीदें (Buy) पर क्लिक करें। 5. वेदर साइट पर जाएँ।" यह एक भी कदम उठाने से पहले इस पूरी सूची के प्रति प्रतिबद्ध हो जाता है।
- यह कैसे काम करता है: AI पहले चरणों की एक पूरी सूची तैयार करता है, फिर उन्हें एक-एक करके निष्पादित करने का प्रयास करता है।
- फायदे: इसके पास एक स्पष्ट लक्ष्य है और इसके भटकने की संभावना कम है।
- नुकसान: यदि वेबसाइट उम्मीद से थोड़ी अलग है (जैसे, "Buy" बटन अलग जगह पर है), तो पूरी योजना बिगड़ जाती है, और एजेंट अटक सकता है या हार मान सकता है।
2. "पास या फेल" के साथ समस्या
वर्तमान में, हम इन एजेंटों को एक शिक्षक की तरह आंकते हैं जो केवल दो विकल्पों के साथ टेस्ट ग्रेड करता है: पास (Pass) या फेल (Fail)।
- खामी: यदि एजेंट को 5 रिव्यू खोजने थे और उसने 4 खोजे, तो उसे "फेल" माना जाता है। लेकिन यह अनुचित है! उसने 80% काम किया।
- पुराना तरीका: हम केवल अंतिम परिणाम को देखते थे।
- नया तरीका: लेखक कहते हैं कि हमें केवल परिणाम को नहीं, बल्कि प्रक्रिया को ग्रेड करने की आवश्यकता है। क्या एजेंट ने एक अजीब मोड़ लिया? क्या उसने एक ही गलती को 10 बार दोहराया? क्या उसने गलती होने पर सुधार किया?
3. नया रिपोर्ट कार्ड (5 नए मेट्रिक्स)
"पास/फेल" की समस्या को ठीक करने के लिए, उन्होंने पांच विशिष्ट ग्रेड के साथ एक नया रिपोर्ट कार्ड बनाया है:
- रिकवरी रेट (Recovery Rate): यदि एजेंट गलत रास्ते पर चला जाता है, तो वह कितनी जल्दी अपनी गलती को पहचानता है और सही रास्ते पर वापस आता है? (जैसे GPS आपके रूट को फिर से कैलकुलेट करता है)।
- रिपिटेटिवनेस रेट (Repetitiveness Rate): क्या एजेंट भ्रमित होने के कारण बार-बार एक ही बटन पर क्लिक करता रहता है? (जैसे कुत्ता अपनी ही पूंछ का पीछा कर रहा हो)।
- स्टेप सक्सेस रेट (Step Success Rate): एजेंट द्वारा लिए गए कितने कदम वास्तव में उस काम से मेल खाते थे जो एक इंसान करता।
- पार्शियल सक्सेस रेट (Partial Success Rate): यदि कार्य "3 फिल्में सूचीबद्ध करें" था, तो क्या उसने 1, 2 या सभी 3 सूचीबद्ध कीं?
- एलिमेंट एक्यूरेसी (Element Accuracy): क्या एजेंट ने कहा कि वह "सबमिट" पर क्लिक करने वाला है, लेकिन वास्तव में "कैंसिल" पर क्लिक किया? यह मापता है कि एजेंट का इरादा (intent) उसके एक्शन से कितना मेल खाता है।
4. प्रयोग: मानव बनाम रोबोट
लेखकों ने 794 कार्यों का एक नया डेटासेट बनाया जहाँ मनुष्यों ने वास्तव में समस्याओं को स्टेप-बाय-स्टेप हल किया था। यह "गोल्ड स्टैंडर्ड" (परफेक्ट आंसर की) बन गया।
इसके बाद उन्होंने दो एजेंटों का परीक्षण किया:
- स्टेप-बाय-स्टेप एजेंट (WebArena Agent): मानक, लचीला वाला।
- फुल-प्लान-इन-एडवांस एजेंट (उनका नया निर्माण): कठोर योजनाकार।
परिणाम:
- स्टेप-बाय-स्टेप एजेंट मानव पथ का पालन करने में बेहतर था। यह अधिक लचीला था, गलतियों से बेहतर संभला, और कुल मिलाकर अधिक कार्य पूरे किए (38% सफलता बनाम 36%)।
- फुल-प्लान-इन-एडवांस एजेंट जब इसने क्लिक किया तो यह वास्तव में अधिक सटीक था। इसने शायद ही कभी गलत बटन दबाया (90% सटीकता), लेकिन यह बहुत कठोर था। यदि योजना वास्तविकता से मेल नहीं खाती थी, तो यह अटक जाता था या हार मान लेता था।
मुख्य निष्कर्ष (The Big Takeaway)
कोई भी "एक आकार सभी के लिए उपयुक्त" (one size fits all) AI एजेंट नहीं है।
- यदि आप एक अराजक, बदलती हुई वेबसाइट (जैसे सोशल मीडिया फीड या लाइव डैशबोर्ड) को नेविगेट कर रहे हैं, तो आपको स्टेप-बाय-स्टेप एजेंट चाहिए। यह एक हाइकर की तरह है जो चलते समय इलाके को देखता है।
- यदि आप एक सख्त, अनुमानित सिस्टम (जैसे बैंक पोर्टल या ई-कॉमर्स चेकआउट) को नेविगेट कर रहे हैं, तो फुल-प्लान-इन-एडवांस एजेंट बेहतर हो सकता है। यह पटरी पर चलने वाली ट्रेन की तरह है; यह तेज़ और कुशल है, लेकिन यह टूटा हुआ पुल नहीं संभाल सकती।
संक्षेप में: यह पेपर हमें AI एजेंटों को जादू के ब्लैक बॉक्स की तरह मानना बंद करने के लिए शब्दावली प्रदान करता है। यह हमें यह समझने में मदद करता है कि वे कैसे सोचते हैं, वे क्यों विफल होते हैं, और विशिष्ट कार्य के लिए किस प्रकार की "सोचने की शैली" सबसे अच्छी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।