← नवीनतम पेपर
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO एक कुशल ऑनलाइन स्किल-डिस्टिलेशन फ्रेमवर्क पेश करता है जो मल्टीमॉडल वेब एजेंटों को एक संरचित स्किल लाइब्रेरी बनाए रखने और प्रोग्रेस रिफ्लेक्शन एवं कैश-अवेयर प्रॉम्प्टिंग जैसी तकनीकों को नियोजित करने के माध्यम से प्रदर्शन में सुधार करने और टोकन खपत को कम करने में सक्षम बनाता है, जिससे मौजूदा तरीकों की तुलना में काफी कम इन्फरेंस लागत के साथ VisualWebArena पर 58.3% सफलता दर प्राप्त होती है।

मूल लेखक: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ PANDO पेपर का सरल भाषा में अनुवाद दिया गया है:

बड़ी समस्या: "पे-पर-क्लिक" का जाल

कल्पना कीजिए कि आप ऑनलाइन खरीदारी करने में मदद के लिए एक बहुत ही बुद्धिमान, लेकिन महंगे सहायक को काम पर रख रहे हैं। हर बार जब वह किसी वेबपेज को देखता है, कुछ करने के बारे में सोचता है, या किसी बटन पर क्लिक करता है, तो आपको उसे एक छोटी सी फीस (जिसे "टोकन" कहा जाता है) देनी पड़ती है।

वर्तमान में, अधिकांश AI एजेंट अपने काम में बेहतर होने के लिए अधिक पैसा खर्च करने की कोशिश करते हैं। यदि वे विफल हो जाते हैं, तो वे फिर से प्रयास करते हैं। यदि वे फंस जाते हैं, तो वे दूसरी राय मांगते हैं। वे एक ही कार्य को दस बार करते हैं और सबसे अच्छे परिणाम को चुनते हैं। यह काम तो करता है, लेकिन यह बहुत महंगा और धीमा है—जैसे किराने की दुकान जाने के लिए एक टैक्सी लेना, फिर यह जांचने के लिए दूसरा टैक्सी बुलाना कि क्या आप अपना बटुआ भूल गए हैं, और फिर कीमत दोबारा जांचने के लिए तीसरी टैक्सी बुलाना। यह काम तो पूरा कर देता है, लेकिन यह अविश्वसनीय रूप से महंगा और धीमा है।

इस पेपर के लेखकों ने पूछा: क्या हम एक ऐसा एजेंट बना सकते हैं जो काम करने के साथ-साथ सस्ता और तेज़ होता जाए, बजाय इसके कि वह हर बार अधिक पैसा खर्च करे?

समाधान: PANDO (द "जायंट एस्पेन" एजेंट)

शोधकर्ताओं ने P_ANDO नामक एक एजेंट बनाया। उन्होंने इसका नाम यूटा के "Pando" एस्पेन के पेड़ों के समूह के नाम पर रखा है।

  • रूपक (Metaphor): Pando देखने में 47,000 अलग-अलग पेड़ों जैसा लगता है, लेकिन वास्तव में वे सभी ज़मीन के नीचे एक ही जड़ प्रणाली (root system) से जुड़े हुए हैं। जब एक पेड़ बढ़ता है, तो वह दूसरों के साथ पोषक तत्व साझा करता है। जब एक पेड़ मरता है, तो जड़ प्रणाली उसे याद रखती है और पूरे जंगल को जीवित रखती है।
  • AI संस्करण: PANDO एक ऐसा AI एजेंट है जिसके पास एक साझा "मेमोरी रूट" (एक स्किल लाइब्रेरी) है। हर नए कार्य को एक बिल्कुल नई समस्या मानने के बजाय, यह पिछले कार्यों से सीखी गई बातों को याद रखता है और नए कार्यों को हल करने के लिए उन सीखों का उपयोग करता है।

PANDO कैसे काम करता है (4-चरणीय लूप)

PANDO केवल अनुमान नहीं लगाता। यह एक चक्र का पालन करता है: योजना (Plan) → क्रिया (Act) → चिंतन (Reflect) → सीखना (Learn)।

  1. योजना (Plan): "दिमाग" (एक स्मार्ट, महंगा AI) एक बड़े कार्य (जैसे "500 डॉलर से कम में सबसे सस्ता गिटार खोजें") को छोटे चरणों में तोड़ता है।
  2. क्रिया (Act): "हाथ" (एक सस्ता, तेज़ AI) वास्तव में बटन क्लिक करता है।
  3. चिंतन (Reflect): एक "मैनेजर" जाँचता है कि क्या चरण सफल रहे। क्या प्राइस फ़िल्टर ने वास्तव में लिस्ट बदल दी? यदि नहीं, तो क्यों?
  4. सीखना (Learn - जादुई हिस्सा): यहीं से PANDO स्मार्ट बनता है।
    • स्किल लाइब्रेरी (Skill Library): यदि एजेंट सफलतापूर्वक सस्ता गिटार ढूंढ लेता है, तो वह इसकी रेसिपी लिख देता है: "सस्ती चीजें खोजने के लिए, 'Sort by Price' पर क्लिक करें और फिर 'Low to High' चुनें।" यह इसे एक नियम (Rule) या रूटीन (Routine) के रूप में सहेज लेता है।
    • कौशल का पुन: उपयोग (Reusing Skills): अगली बार जब एजेंट को "सबसे महंगी" वस्तु ढूंढनी होती है, तो उसे बहुत अधिक सोचने की आवश्यकता नहीं होती। वह बस अपनी लाइब्रेरी देखता है, नियम देखता है, और "High to Low" का स्विच चालू कर देता है।
    • डिमोशन (Demotion - सफाई का काम): यदि कोई नियम काम करना बंद कर देता है (उदाहरण के लिए, वेबसाइट का लेआउट बदल जाता है), तो एजेंट उसे "टूटा हुआ" मार्क कर देता है और उसका उपयोग करना बंद कर देता है। यह एजेंट को पुराने, टूटे हुए निर्देशों का उपयोग करने के चक्कर में लूप में फंसने से रोकता है।

यह गेम चेंजर क्यों है

पेपर में PANDO का परीक्षण 910 विभिन्न वेब कार्यों (शॉपिंग, क्लासिफाइड, रेडिट) पर किया गया। यहाँ क्या हुआ:

  • सफलता दर (Success Rate): PANDO 58.3% बार सफल रहा। यह वर्तमान के शीर्ष एजेंटों (जो लगभग 54% के आसपास थे) से बेहतर है।
  • लागत (Cost): यही सबसे बड़ी जीत है। PANDO ने अगले सबसे अच्छे एजेंट की तुलना में 58% कम टोकन (पैसे) का उपयोग किया।
  • "फ्री लंच" प्रभाव:
    • शुरुआत में: PANDO थोड़ा धीमा है क्योंकि वह नियम सीख रहा है।
    • बाद में: जैसे-जैसे यह अपनी कौशल लाइब्रेरी बनाता है, यह तेज़ और सस्ता होता जाता है। परीक्षण के अंत तक, यह कम चरणों और कम पैसे के साथ कार्यों को हल कर रहा था।
    • उपमा: कल्पना कीजिए कि एक छात्र गणित का टेस्ट दे रहा है।
      • पुराने एजेंट: हर बार जब वे एक नई समस्या देखते हैं, तो वे सूत्र (formula) को शून्य से फिर से बनाने की कोशिश करते हैं। इसमें बहुत समय लगता है।
      • PANDO: पहली बार जब वे एक समस्या देखते हैं, तो वे उसे हल करते हैं और सूत्र को एक 'चीट शीट' पर लिख लेते हैं। अगली 99 बार, वे बस उस चीट शीट को देखते हैं। वे टेस्ट को तेज़ी से और कम मानसिक शक्ति के साथ पूरा करते हैं।

"छिपी हुई लागतें" जिनसे PANDO बचता है

पेपर बताता है कि अन्य एजेंट दो तरीकों से अपनी लागत छिपाते हैं:

  1. प्री-इवैल्यूएशन डिस्कवरी: कुछ एजेंट टेस्ट शुरू होने से पहले ही हफ्तों तक टूल्स को "खोजने" या "प्रशिक्षण" देने में खर्च करते हैं। PANDO टेस्ट के दौरान सीखता है, इसलिए कोई छिपी हुई अग्रिम लागत नहीं होती है।
  2. रोलआउट स्केलिंग: कुछ एजेंट बस कार्य को 10 बार आज़माते हैं और विजेता को चुनते हैं। PANDO एक बार प्रयास करता है, लेकिन अपने मेमोरी का उपयोग करके उस एक प्रयास को सार्थक बनाता है।

निष्कर्ष

PANDO साबित करता है कि AI को बेहतर बनाने के लिए आपको केवल अधिक पैसा लगाने की आवश्यकता नहीं है। इसे एक संरचित स्मृति (कौशल की लाइब्रेरी) और खराब यादों को साफ करने का तरीका (डिमोशन) देकर, एजेंट काम करने के साथ अधिक कुशल हो जाता है।

यह एक ऐसे कर्मचारी और एक ऐसे कर्मचारी के बीच का अंतर है जो हर दिन सब कुछ भूल जाता है और जिसे लगातार फिर से प्रशिक्षित करना पड़ता है, बनाम एक ऐसे कर्मचारी के बीच जो "चीजें कैसे करनी हैं" का नोटबुक रखता है और हर दिन तेज़ होता जाता है।

मुख्य बात: PANDO केवल स्मार्ट नहीं होता; यह अनुभव प्राप्त करने के साथ-साथ सस्ता भी होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →