MMSkills: Towards Multimodal Skills for General Visual Agents
यह शोध पत्र MMSkills प्रस्तुत करता है, जो एक ऐसा ढांचा है जो टेक्स्ट-आधारित कौशल निरूपण की सीमाओं को संबोधित करता है, और सामान्य विज़ुअल एजेंटों की रनटाइम निर्णय लेने की क्षमताओं को बढ़ाने के लिए पुन: प्रयोज्य मल्टीमॉडल प्रक्रियात्मक ज्ञान (टेक्स्टुअल प्रक्रियाओं को स्थिति-सशर्त दृश्य साक्ष्यों के साथ संयोजित करके) को औपचारिक रूप देता है और कार्यान्वित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "MMSkills: Towards Multimodal Skills for General Visual Agents" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।
मुख्य विचार: रोबोट को इंसानों की तरह "देखना" सिखाना
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखा रहे हैं।
- पुराना तरीका (केवल टेक्स्ट कौशल): आप रोबोट को एक लिखित रेसिपी देते हैं: " 'File' मेनू पर क्लिक करें, फिर 'New' पर, फिर 'Sheet' पर।"
- समस्या: यदि रोबोट गलत स्क्रीन पर है, या यदि कोई पॉप-अप विंडो मेनू को ब्लॉक कर रही है, तो रोबोट आँख बंद करके टेक्स्ट का पालन करता है। वह "File" पर क्लिक करता है भले ही मेनू वहाँ न हो, अटक जाता है और विफल हो जाता है। उसे पता है कि क्या करना है, लेकिन यह नहीं पता कि कब करना है या काम पूरा होने पर वह कैसा दिखना चाहिए।
- नया तरीका (MMSkills): आप रोबलेट को एक "स्मार्ट गाइड" (Smart Guide) देते हैं। इस गाइड में केवल टेक्स्ट नहीं है; इसमें हर चरण पर स्क्रीन कैसी दिखनी चाहिए, इसके फोटो और साथ ही चेकलिस्ट भी हैं ताकि यह सत्यापित किया जा सके कि रोबोट सही रास्ते पर है या नहीं।
यह पेपर MMSkills पेश करता है, जो एक ऐसा सिस्टम है जो इन "स्मार्ट गाइड्स" को AI एजेंटों (जो कंप्यूटर का उपयोग करते हैं या गेम खेलते हैं) के लिए पुन: प्रयोज्य (reusable) उपकरणों में बदल देता है।
तीन मुख्य समस्याएँ जिन्हें उन्होंने हल किया
लेखकों ने इन स्मार्ट गाइड्स को काम करने में आने वाली तीन बड़ी बाधाओं की पहचान की:
पैकेज के अंदर क्या होना चाहिए?
- उदाहरण: यदि आप किसी को केक बनाना सिखा रहे हैं, तो केवल एक लिखित रेसिपी काफी नहीं है। आपको बैटर (batter) की फोटो चाहिए (यह जानने के लिए कि वह तैयार है या नहीं), ओवन की फोटो चाहिए (यह जानने के लिए कि वह गर्म है या नहीं), और एक चेकलिस्ट चाहिए (यह सुनिश्चित करने के लिए कि आप अंडे डालना नहीं भूले)।
- समाधान: एक MMSkill पैकेज में तीन चीजें होती हैं:
- टेक्स्ट (The Text): चरण-दर-चरण निर्देश।
- स्टेट कार्ड्स (State Cards): एक "ट्रैफिक लाइट" प्रणाली। यह एजेंट को बताता है: "आगे बढ़ें यदि आप नीला बटन देखते हैं," या "रुकें! क्लिक न करें यदि आप लाल एरर मैसेज देखते हैं।"
- विजुअल एविडेंस (Visual Evidence): महत्वपूर्ण क्षणों पर स्क्रीन कैसी दिखनी चाहिए, इसके फोटो (कीफ्रेम्स) (जैसे, "पहले" और "बाद के" शॉट्स)।
हमें ये गाइड्स कहाँ से मिलते हैं?
- उदाहरण: आप हर एक केक के लिए एक नया रेसिपी लिखने के लिए किसी इंसान को काम पर नहीं रखना चाहते। आप लोगों को केक बनाते हुए देखना चाहते हैं, सामान्य चरणों को समझना चाहते हैं, और खुद एक सामान्य रेसिपी लिखना चाहते हैं।
- समाधान: उन्होंने एक स्वचालित "जेनरेटर" (Generator) बनाया। यह लोगों द्वारा कंप्यूटर का उपयोग करने के हजारों सार्वजनिक वीडियो (ट्रैजेक्टरीज) को देखता है, समान कार्यों को एक साथ समूह में बाँटता है, और स्वचालित रूप से ये स्मार्ट गाइड्स लिखता है। यह केवल वीडियो की नकल नहीं करता; यह तर्क (logic) और विजुअल संकेतों (visual cues) को निकालता है।
रोबोट इन्हें बिना भ्रमित हुए कैसे उपयोग करे?
- उदाहरण: कल्पना कीजिए कि आप कार चलाते समय एक विशाल, 50-पेज का फोटो एल्बम पढ़ने की कोशिश कर रहे हैं। यह ध्यान भटकाने वाला और खतरनाक है। रोबोट पुराने फोटो में इतना खो सकता है कि वह वास्तविक दुनिया में टकरा जाए।
- समाधान: उन्होंने "ब्रांच लोडिंग" (Branch Loading) का आविष्कार किया।
- पूरे फोटो एल्बम को रोबोट के मुख्य मस्तिष्क में डालने के बजाय, रोबोट एक अस्थायी साइड विंडो (एक ब्रांच) खोलता है।
- इस साइड विंडो में, वह निर्णय लेने के लिए केवल उस विशिष्ट फोटो को जल्दी से देखता है जिसकी उसे अभी आवश्यकता है।
- फिर वह साइड विंडो को बंद कर देता है और मुख्य रोबोट को बताता है: "ठीक है, मैंने फोटो देख लिया। आप सही रास्ते पर हैं। अब, बटन पर क्लिक करें।"
- यह मुख्य रोबोट को लाइव स्क्रीन पर केंद्रित रखता है, न कि पुराने संदर्भ फोटो पर।
यह असल जिंदगी में कैसे काम करता है (द "चार्ट" उदाहरण)
यह पेपर यह दिखाने के लिए एक विशिष्ट उदाहरण का उपयोग करता है कि यह बेहतर क्यों है: स्प्रेडशीट में चार्ट बनाना।
- परिदृश्य: कार्य है "Sheet 2 पर चार्ट बनाएं।"
- टेक्स्ट-ओनली एजेंट: "चार्ट बनाएं" पढ़ता है। वह एक चार्ट बनते हुए देखता है। वह "Done" पर क्लिक करता है।
- परिणाम: उसने Sheet 1 पर चार्ट बना दिया (गलत शीट पर) क्योंकि टेक्स्ट ने यह नहीं बताया कि यह देखना है कि कौन सी शीट सक्रिय है। स्कोर: 0।
- MMSkills एजेंट:
- यह "Create Chart" स्किल लोड करता है।
- स्टेट कार्ड कहता है: "जांचें: क्या सक्रिय शीट का नाम 'Sheet 2' है?"
- विजुअल एविडेंस सही शीट टैब का एक फोटो दिखाता है।
- रोबोट देखता है कि वह वर्तमान में Sheet 1 पर है। "ब्रांच" कहता है: "रुको! आप गलत शीट पर हैं। पहले Sheet 2 पर स्विच करें।"
- रोबोट स्विच करता है, चार्ट बनाता है, और सत्यापित करता है कि शीर्षक फोटो से मेल खाता है।
- परिणाम: सही शीट पर परफेक्ट चार्ट। स्कोर: 1।
इसके परिणाम क्या रहे
शोधकर्ताओं ने दो प्रकार के कार्यों पर इसका परीक्षण किया:
- डेस्कटॉप कार्य: जैसे Excel, Chrome, या Word का उपयोग करना (OSWorld, macOSWorld)।
- गेम कार्य: जैसे Minecraft या Super Mario Bros खेलना।
निष्कर्ष:
- बेहतर सफलता दर: MMSkills का उपयोग करने वाले रोबोटों ने बिना किसी स्किल या केवल टेक्स्ट स्किल्स वाले रोबोटों की तुलना में बहुत अधिक कार्य सफलतापूर्वक पूरे किए।
- छोटे रोबोटों की मदद की: इन विजुअल गाइड्स को दिए जाने पर छोटे और कम शक्तिशाली AI मॉडल भी कार्यों में बहुत बेहतर हो गए।
- कम गलतियाँ: रोबोटों ने बार-बार होने वाली गलतियाँ (जैसे एक ही बटन को 10 बार दबाना) कम कीं और कार्य तेजी से पूरे किए।
- केवल कंप्यूटर तक सीमित नहीं: यह सिस्टम वीडियो गेम में भी उतना ही अच्छा काम करता है, जो यह साबित करता है कि चाहे आप फाइलों को मैनेज कर रहे हों या बाधाओं के ऊपर से कूद रहे हों, "स्टेट को देखना" महत्वपूर्ण है।
सारांश
MMSkills एक ऐसा तरीका है जिससे AI एजेंटों को न केवल यह सिखाया जाता है कि क्या करना है, बल्कि यह भी कि कैसे पहचानना है कि वे इसे सही ढंग से कर रहे हैं। टेक्स्ट निर्देशों को "ट्रैफिक लाइट" चेकलिस्ट और विशिष्ट फोटो के साथ जोड़कर, और "साइड-विंडो" पद्धति का उपयोग करके, यह सिस्टम रोबोट को रास्ता भटकने, भ्रमित होने या गलत स्क्रीन पर अटकने से बचने में मदद करता है। यह एक ऐसे रोबोट को बदल देता है जो केवल आदेशों का आँख बंद करके पालन करता है, एक ऐसे रोबोट में जो वास्तव में उस दृश्य दुनिया (visual world) को समझता है जिसमें वह काम कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।