MELLON - Multimodal Enhanced LLM for Online Navigation
यह शोध पत्र MELLON को प्रस्तुत करता है, जो एक मल्टीमॉडल फ्रेमवर्क है जो तर्क और योजना में सुधार करने के लिए टेक्स्ट और इमेज को संरेखित करके WebShop बेंचमार्क पर वेब नेविगेशन एजेंट के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, और प्रशिक्षण के केवल एक इपोक (epoch) के बाद ही 9.26% सटीकता में वृद्धि प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंटरनेट पर खरीदारी करना सिखा रहे हैं। आप सोच सकते हैं, "बस इसे टेक्स्ट निर्देश दे दो, जैसे 'एक लाल शर्ट खरीदो,' और यह वेबसाइट को पढ़ेगा और बटन दबा देगा।" लेकिन यहाँ एक पेंच है: वेबसाइटें केवल टेक्स्ट की दीवारें नहीं हैं। वे रंगीन, दृश्य रूप से समृद्ध स्थान हैं जो चित्रों, लेआउट और डिज़ाइनों से भरे होते हैं। यदि आप किसी इंसान को जूतों की एक विशिष्ट जोड़ी खोजने के लिए कहते हैं, तो वे केवल विवरण नहीं पढ़ते; वे रंग, शैली और आकार देखने के लिए फोटो देखते हैं। लंबे समय तक, वेब पर नेविगेट करने की कोशिश करने वाले सबसे स्मार्ट कंप्यूटर प्रोग्राम अंधे खरीदारों की तरह थे—वे टेक्स्ट को पूरी तरह से पढ़ सकते थे लेकिन वे छवियों को "देख" नहीं सकते थे। यह शोध पत्र आर्टिफिशियल इंटेलिजेंस की दुनिया में रहता है, विशेष रूप से "वेब नेविगेशन एजेंटों" पर ध्यान केंद्रित करता है। ये डिजिटल सहायक हैं जिन्हें प्राकृतिक भाषा के आदेशों को समझने और वास्तविक वेबसाइटों पर कार्य करने के लिए डिज़ाइन किया गया है, जैसे सामान खरीदना या टिकट बुक करना। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम इन एजेंटों को अपने "आंखों" (छवियों को देखने के लिए) और अपने "दिमाग" (टेक्स्ट पढ़ने के लिए) का एक साथ उपयोग करना सिखा सकते हैं, ठीक वैसे ही जैसे इंसान करते हैं?
इस अध्ययन पर काम करने वाले शोधकर्ताओं ने, MELLON नामक एक प्रोजेक्ट पर काम करते हुए, इस विचार का परीक्षण एक सिम्युलेटेड ऑनलाइन स्टोर 'WebShop' पर करने का निर्णय लिया। वे यह देखना चाहते थे कि क्या एजेंट को उत्पाद के चित्रों का दृश्य देना, टेक्स्ट विवरणों के साथ, उसे बेहतर निर्णय लेने में मदद करेगा। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने इस पहेली को सुलझाने के लिए तीन अलग-अलग प्रयोगात्मक उपकरण बनाए। पहला, और सबसे सफल, स्वयं MELLON था। MELLON को एक सुपर-स्मार्ट शॉपर के रूप में समझें जो विशेष चश्मा पहनता है जो दृश्य दुनिया को उस भाषा में अनुवादित करता है जिसे AI का दिमाग समझ सके। टीम ने पाया कि इस एजेंट को सीखने के केवल एक दौर (एक "इपोक") के लिए प्रशिक्षित करने से, यह अपने काम में काफी बेहतर हो गया। विशेष रूप से, कार्यों को पूरा करने की सटीकता उस बुनियादी संस्करण की तुलना में 9.26% बढ़ गई जो केवल टेक्स्ट को देखता था। यह सुझाव देता है कि विजन और टेक्स्ट को मिलाना AI को वेब नेविगेट करने में मदद करने का एक शक्तिशाली तरीका है, भले ही सिस्टम में अभी भी कुछ शुरुआती मुश्किलें हों।
हालाँकि, कहानी केवल एक "मल्टीमॉडल हमेशा बेहतर होता है" वाली जीत नहीं है। टीम ने दो अन्य रचनात्मक दृष्टिकोण भी आजमाए जो उनकी उम्मीद के मुताबिक काम नहीं कर पाए। एक विचार यह था कि खरीदारी के कार्य को एक "विजुअल क्वेश्चन आंसरिंग" खेल (VQAgent) की तरह माना जाए, जहाँ AI एक चित्र और एक प्रश्न को देखता है, फिर सही उत्तर चुनता है। उन्हें लगा कि यह काम करेगा क्योंकि खरीदारी छवियों के बारे में प्रश्न पूछने के समान है। लेकिन उन्होंने पाया कि WebShop के अव्यवस्थित, वास्तविक दुनिया के संदर्भ में, टेक्स्ट विवरणों में चित्रों की तुलना में अधिक महत्वपूर्ण सुराग थे। क्योंकि AI को छवियों पर बहुत अधिक निर्भर रहने के लिए प्रशिक्षित किया गया था, इसलिए जब टेक्स्ट ही समाधान की असली कुंजी थी, तो वह भ्रमित हो गया। यह एक पहेली को चित्र देखकर सुलझाने की कोशिश करने जैसा है जबकि उत्तर बारीक अक्षरों में छिपा हो।
तीसरा प्रयास एक "मल्टीमॉडल रेंकर" शामिल था, एक ऐसा उपकरण जिसे एजेंट को कोई भी चीज़ चुनने से पहले, पेज पर मौजूद हर एक आइटम की सावधानीपूर्वक तुलना करने के लिए रोकने हेतु डिज़ाइन किया गया था। उम्मीद यह थी कि इस अतिरिक्त सोचने के समय से बेहतर परिणाम मिलेंगे। इसके बजाय, प्रयोग ने दिखाया कि इस अतिरिक्त सावधानी ने एजेंट को धीमा और कम सटीक बना दिया। शोधकर्ताओं ने पाया कि छवियों और टेक्स्ट के बीच समानता मापने के उपकरण (जिन्हें BERT और CLIP स्कोर कहा जाता है) इस बात से मेल नहीं खाते थे कि वास्तव में एक उत्पाद को गेम के स्कोरिंग सिस्टम में "अच्छा मिलान" क्या बनाता है। यह पता चला कि हर एक विकल्प को रैंक करने की कोशिश करना एक ऐसे शॉपर की तरह था जो दुकान में हर शर्ट की तुलना करने में एक घंटा बिता देता है, और अंत में गलत शर्ट खरीद लेता है क्योंकि वह अभिभूत हो गया था।
तो, इस डिजिटल शॉपिंग एडवेंचर से अंतिम निष्कर्ष क्या निकलता है? यह पेपर सुझाव देता है कि जबकि AI एजेंटों को वेब को "देखने" की क्षमता देना एक आशाजनक मार्ग है, यह कोई जादुई छड़ी नहीं है। MELLON एजेंट ने साबित किया कि छवियों और टेक्स्ट को संरेखित करने से प्रदर्शन में वृद्धि होती है, लेकिन अन्य प्रयोगों ने दिखाया कि केवल अधिक जटिल दृश्य तर्क जोड़ना या एजेंट को सब कुछ देखने के लिए मजबूर करना हमेशा सही रणनीति नहीं होती है। शोधकर्ता निष्कर्ष निकालते हैं कि हमें यह खोजने के लिए कि इन दृश्य और पाठ्य संकेतों को सर्वोत्तम रूप से कैसे मिलाया जाए, निरंतर अन्वेषण करने की आवश्यकता है, शायद भविष्य में एजेंटों को लंबे समय तक प्रशिक्षित करके या और भी स्मार्ट "मस्तिष्क" (लार्ज लैंग्वेज मॉडल्स) का उपयोग करके। फिलहाल, उन्होंने दिखाया है कि थोड़ा सा विजन बहुत काम आता है, लेकिन AI को अभी भी यह सीखने की जरूरत है कि उसे कब तस्वीर देखनी है और कब बारीक अक्षरों को पढ़ना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।