VISUALSKILL: Multimodal Skills for Computer-Use Agents
यह शोध पत्र VISUALSKILL को पेश करता है, जो एक मल्टीमॉडल स्किल फ्रेमवर्क है जो विजुअल फिगर्स (visual figures) को टेक्स्ट में बदलने के बजाय उन्हें स्किल आर्टिफैक्ट्स (skill artifacts) में बनाए रखकर लॉन्ग-होराइजन कार्यों पर कंप्यूटर-उपयोग एजेंटों के प्रदर्शन को बढ़ाता है, जिसके परिणामस्वरूप बेसलाइन और टेक्स्ट-ओनली स्किल अप्रोच दोनों की तुलना में सटीकता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को किसी जटिल सॉफ़्टवेयर का उपयोग करना सिखाने की कोशिश कर रहे हैं, जैसे कि कोई फोटो एडिटर या स्प्रेडशीट प्रोग्राम। रोबोट स्क्रीन देख सकता है और माउस चला सकता है, लेकिन वह सॉफ़्टवेयर को "जानता" नहीं है। यह वैसा ही है जैसे किसी पर्यटक को एक शहर का नक्शा थमा देना जो उन्होंने पहले कभी नहीं देखा, लेकिन वह नक्शा पूरी तरह से एक विदेशी भाषा में लिखा है और उसमें कोई चित्र नहीं है। वे अंदाज़ा लगा सकते हैं कि कहाँ जाना है, लेकिन वे अक्सर भटक जाएंगे, खासकर यदि सड़कें बदल जाएं या उन्हें किसी विशिष्ट, छिपी हुई गली को ढूंढना हो।
यह वह समस्या है जिसे VISUALSKILL पेपर हल करने की कोशिश करता है।
समस्या: केवल टेक्स्ट वाले मानचित्र बनाम दृश्य वास्तविकता
वर्तमान "कंप्यूटर-उपयोग एजेंट" (सॉफ्टवेयर का उपयोग करने वाले रोबट) काफी अच्छे होते जा रहे हैं, लेकिन वे अभी भी लंबे, जटिल कार्यों या उस सॉफ़्टवेयर के साथ संघर्ष करते हैं जिसे उन्होंने पहले नहीं देखा है।
उनकी मदद करने के लिए, शोधकर्ताओं ने "स्किल लाइब्रेरी" बनाई है—जो मूल रूप से रोबोट के लिए निर्देश पुस्तिकाएं हैं। लेकिन यहाँ एक पेंच है: ये मैनुअल केवल टेक्स्ट में लिखे गए हैं।
शोधकर्ता इसके दो कारणों से इसे एक बुरा विचार मानते हैं:
- शब्दों के माध्यम से चित्रों का वर्णन करना कठिन है: कल्पना कीजिए कि आप रोबोट को केवल यह बताकर कि "नीला ब्रश टूल" है, यह बताने की कोशिश कर रहे हैं कि उसे किस आइकन पर क्लिक करना चाहिए। यदि पास में पाँच नीले उपकरण हैं, तो रोबोट गलत वाला चुन सकता है। एक चित्र तुरंत सटीक आकार और स्थान दिखाता है।
- अपने काम की जाँच करना कठिन है: एक बहु-चरणीय कार्य में, रोबोट को यह जाँचने की आवश्यकता होती है, "क्या मैंने वास्तव में सही मेनू खोला?" यदि मैनुअल कहता है, "आपको एक छोटा सा विंडो पॉप अप होना चाहिए," तो रोबोट को अंदाज़ा लगाना होगा कि वह कैसा दिखता है। यदि मैनुअल उस सटीक विंडो का स्क्रीनशॉट दिखाता है, तो रोबोट बस स्क्रीन की तुलना तस्वीर से कर सकता है और निश्चित रूप से जान सकता है।
समाधान: VISUALSKILL
लेखकों ने VISUALSKILL बनाया है, जो इन निर्देश पुस्तिकाओं को बनाने का एक नया तरीका है। केवल टेक्स्ट के बजाय, VISUALSKILL निर्देशों के ठीक बगल में मूल चित्र और स्क्रीनशॉट रखता है।
इसे इस तरह सोचें:
- पुराना तरीका (केवल टेक्स्ट): एक रेसिपी जो कहती है, "लाल सॉस डालें।" (रोबोट को अंदाज़ा लगाना पड़ता है कि कौन सी बोतल लाल है)।
- VISUALSKILL: एक रेसिपी जो कहती है, "लाल सॉस डालें," और उसके ठीक नीचे, शेल्फ पर मौजूद उसी सटीक लाल सॉस की बोतल की एक फोटो है।
यह कैसे बनाया गया है (दो-चरणीय पाइपलाइन)
टीम ने केवल हाथ से ये मैनुअल नहीं लिखे; उन्होंने इन्हें स्वचालित रूप से बनाने के लिए एक प्रणाली बनाई है जो दो चरणों में काम करती है:
चरण 1: द ऑफिशियल मैनुअल माइनर (The Official Manual Miner)।
वे सॉफ़्टवेयर की आधिकारिक यूजर गाइड (वह PDF या वेबसाइट जो कंपनी ने बनाई है) को लेते हैं और उसे एक संरचित स्किल (structured skill) में बदल देते हैं। वे गाइड से सभी मूल आरेख (diagrams) और स्क्रीनशॉट को सुरक्षित रखते हैं। यह रोबोट को एक ठोस आधार प्रदान करता है।चरण 2: द लाइव एक्सप्लोरर (The Live Explorer)।
आधिकारिक गाइड अक्सर पुरानी होती हैं या उन अजीब, छोटे पॉप-अप विंडोज़ को मिस कर देती हैं जो वास्तव में सॉफ़्टवेयर का उपयोग करते समय दिखाई देते हैं। इसलिए, सिस्टम एक "रोबोट एक्सप्लोरर" को वास्तव में सॉफ़्टवेयर का उपयोग करने के लिए भेजता है।- स्वतंत्र अन्वेषण (Free Exploration): एक्सप्लोरर खाली स्क्रीन पर घूमता है, यह देखने के लिए बटन क्लिक करता है कि क्या होता है, और हर नए दिखने वाले विंडो की फोटो लेता है।
- लक्षित अन्वेषण (Targeted Exploration): सिस्टम उन कार्यों को देखता है जहाँ रोबोट पहले विफल रहा था। यह समझता है कि, "आह, रोबोट इस विशिष्ट मेनू पर अटक गया था," और एक्सप्लोरर को विशेष रूप से उस स्थान पर एक फोटो लेने और एक नोट लिखने के लिए भेजता है।
ये नए फोटो और नोट्स को फिर से मैनुअल में जोड़ दिया जाता है, जिससे यह एक "जीवित" गाइड बन जाता है जो वास्तविक सॉफ़्टवेयर के साथ पूरी तरह मेल खाता है।
रोबोट इसका उपयोग कैसे करता है
रोबोट पूरा 100 पन्नों का मैनुअल एक साथ नहीं पढ़ता (क्योंकि यह बहुत अधिक जानकारी होगी)। इसके बजाय, उसके पास एक विशेष टूल है जिसे load_topic कहा जाता है।
- रोबोट अपने वर्तमान कार्य को देखता है।
- वह एक संक्षिप्त इंडेक्स (जैसे विषय-सूची) की जाँच करता है कि कौन सा विषय प्रासंगिक है।
- वह टूल से पूछता है: "इस विषय के लिए निर्देश दिखाएं।"
- टूल तुरंत उस सटीक क्षण के लिए आवश्यक टेक्स्ट और विशिष्ट स्क्रीनशॉट निकाल कर देता है।
परिणाम
शोधकर्ताओं ने एक शक्तिशाली AI एजेंट का उपयोग करके दो प्रमुख बेंचमार्क (कठिन कंप्यूटर कार्यों के सेट) पर इसका परीक्षण किया।
- कोई स्किल नहीं (No Skill): रोबोट के पास कोई मदद नहीं थी। वह लगभग 30% बार सफल रहा।
- केवल टेक्स्ट स्किल (Text-Only Skill): उन्होंने रोबोट को उसी स्रोत से बना टेक्स्ट-ओनली मैनुअल दिया। सफलता बढ़कर 37% हो गई।
- VISUALSKILL (मल्टीमॉडल): उन्होंने रोबोट को चित्रों के साथ मैनुअल दिया। सफलता उछलकर 45% हो गई।
मुख्य निष्कर्ष: चित्रों ने बहुत बड़ा अंतर पैदा किया। रोबोट इसमें बहुत बेहतर था:
- सही बटन ढूँढने में: वह विवरण के आधार पर अंदाज़ा लगाने के बजाय आइकन को देख सकता था।
- अपनी प्रगति की जाँच करने में: वह स्क्रीन की तुलना संदर्भ फोटो से कर सकता था कि क्या वह सही रास्ते पर है।
यह क्यों महत्वपूर्ण है
पेपर निष्कर्ष निकालता है कि कंप्यूटर का उपयोग करने वाले रोबोट के लिए, विजुअल्स केवल "अच्छे होने के लिए" नहीं हैं—वे अनिवार्य हैं। केवल शब्दों का उपयोग करके ग्राफिकल इंटरफेस का वर्णन करना वैसा ही है जैसे किसी को पेंटिंग का वर्णन करना जिसे उसने पहले कभी नहीं देखा। मैनुअल में चित्रों को रखकर, रोबोट वास्तव में "देख" सकता है कि उसे क्या करना है, ठीक वैसे ही जैसे एक इंसान करता है।
शोधकर्ताओं ने यह भी पाया कि रोबोट जानकारी कैसे प्राप्त करता है यह मायने रखता है। यदि वे केवल रोबोट को फाइलों को पढ़ने देते हैं जैसे कि एक इंसान किताब पढ़ता है, तो वह अक्सर चित्रों को छोड़ देता है। load_topic जैसे विशेष टूल का उपयोग करके, जो टेक्स्ट और चित्रों को एक साथ एक ही बार में डिलीवर करता है, रोबोट वास्तव में दृश्य संकेतों (visual clues) का प्रभावी ढंग से उपयोग करता है।
संक्षेप में: रोबोट को केवल यह न बताएं कि क्या करना है; उसे दिखाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।