← नवीनतम पेपर
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

यह शोध पत्र MMSkills प्रस्तुत करता है, जो एक ऐसा ढांचा है जो टेक्स्ट-आधारित कौशल निरूपण की सीमाओं को संबोधित करता है, और सामान्य विज़ुअल एजेंटों की रनटाइम निर्णय लेने की क्षमताओं को बढ़ाने के लिए पुन: प्रयोज्य मल्टीमॉडल प्रक्रियात्मक ज्ञान (टेक्स्टुअल प्रक्रियाओं को स्थिति-सशर्त दृश्य साक्ष्यों के साथ संयोजित करके) को औपचारिक रूप देता है और कार्यान्वित करता है।

मूल लेखक: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "MMSkills: Towards Multimodal Skills for General Visual Agents" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ स्पष्टीकरण दिया गया है।

मुख्य विचार: रोबोट को इंसानों की तरह "देखना" सिखाना

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखा रहे हैं।

  • पुराना तरीका (केवल टेक्स्ट कौशल): आप रोबोट को एक लिखित रेसिपी देते हैं: " 'File' मेनू पर क्लिक करें, फिर 'New' पर, फिर 'Sheet' पर।"
    • समस्या: यदि रोबोट गलत स्क्रीन पर है, या यदि कोई पॉप-अप विंडो मेनू को ब्लॉक कर रही है, तो रोबोट आँख बंद करके टेक्स्ट का पालन करता है। वह "File" पर क्लिक करता है भले ही मेनू वहाँ न हो, अटक जाता है और विफल हो जाता है। उसे पता है कि क्या करना है, लेकिन यह नहीं पता कि कब करना है या काम पूरा होने पर वह कैसा दिखना चाहिए
  • नया तरीका (MMSkills): आप रोबलेट को एक "स्मार्ट गाइड" (Smart Guide) देते हैं। इस गाइड में केवल टेक्स्ट नहीं है; इसमें हर चरण पर स्क्रीन कैसी दिखनी चाहिए, इसके फोटो और साथ ही चेकलिस्ट भी हैं ताकि यह सत्यापित किया जा सके कि रोबोट सही रास्ते पर है या नहीं।

यह पेपर MMSkills पेश करता है, जो एक ऐसा सिस्टम है जो इन "स्मार्ट गाइड्स" को AI एजेंटों (जो कंप्यूटर का उपयोग करते हैं या गेम खेलते हैं) के लिए पुन: प्रयोज्य (reusable) उपकरणों में बदल देता है।


तीन मुख्य समस्याएँ जिन्हें उन्होंने हल किया

लेखकों ने इन स्मार्ट गाइड्स को काम करने में आने वाली तीन बड़ी बाधाओं की पहचान की:

  1. पैकेज के अंदर क्या होना चाहिए?

    • उदाहरण: यदि आप किसी को केक बनाना सिखा रहे हैं, तो केवल एक लिखित रेसिपी काफी नहीं है। आपको बैटर (batter) की फोटो चाहिए (यह जानने के लिए कि वह तैयार है या नहीं), ओवन की फोटो चाहिए (यह जानने के लिए कि वह गर्म है या नहीं), और एक चेकलिस्ट चाहिए (यह सुनिश्चित करने के लिए कि आप अंडे डालना नहीं भूले)।
    • समाधान: एक MMSkill पैकेज में तीन चीजें होती हैं:
      • टेक्स्ट (The Text): चरण-दर-चरण निर्देश।
      • स्टेट कार्ड्स (State Cards): एक "ट्रैफिक लाइट" प्रणाली। यह एजेंट को बताता है: "आगे बढ़ें यदि आप नीला बटन देखते हैं," या "रुकें! क्लिक न करें यदि आप लाल एरर मैसेज देखते हैं।"
      • विजुअल एविडेंस (Visual Evidence): महत्वपूर्ण क्षणों पर स्क्रीन कैसी दिखनी चाहिए, इसके फोटो (कीफ्रेम्स) (जैसे, "पहले" और "बाद के" शॉट्स)।
  2. हमें ये गाइड्स कहाँ से मिलते हैं?

    • उदाहरण: आप हर एक केक के लिए एक नया रेसिपी लिखने के लिए किसी इंसान को काम पर नहीं रखना चाहते। आप लोगों को केक बनाते हुए देखना चाहते हैं, सामान्य चरणों को समझना चाहते हैं, और खुद एक सामान्य रेसिपी लिखना चाहते हैं।
    • समाधान: उन्होंने एक स्वचालित "जेनरेटर" (Generator) बनाया। यह लोगों द्वारा कंप्यूटर का उपयोग करने के हजारों सार्वजनिक वीडियो (ट्रैजेक्टरीज) को देखता है, समान कार्यों को एक साथ समूह में बाँटता है, और स्वचालित रूप से ये स्मार्ट गाइड्स लिखता है। यह केवल वीडियो की नकल नहीं करता; यह तर्क (logic) और विजुअल संकेतों (visual cues) को निकालता है।
  3. रोबोट इन्हें बिना भ्रमित हुए कैसे उपयोग करे?

    • उदाहरण: कल्पना कीजिए कि आप कार चलाते समय एक विशाल, 50-पेज का फोटो एल्बम पढ़ने की कोशिश कर रहे हैं। यह ध्यान भटकाने वाला और खतरनाक है। रोबोट पुराने फोटो में इतना खो सकता है कि वह वास्तविक दुनिया में टकरा जाए।
    • समाधान: उन्होंने "ब्रांच लोडिंग" (Branch Loading) का आविष्कार किया।
      • पूरे फोटो एल्बम को रोबोट के मुख्य मस्तिष्क में डालने के बजाय, रोबोट एक अस्थायी साइड विंडो (एक ब्रांच) खोलता है।
      • इस साइड विंडो में, वह निर्णय लेने के लिए केवल उस विशिष्ट फोटो को जल्दी से देखता है जिसकी उसे अभी आवश्यकता है।
      • फिर वह साइड विंडो को बंद कर देता है और मुख्य रोबोट को बताता है: "ठीक है, मैंने फोटो देख लिया। आप सही रास्ते पर हैं। अब, बटन पर क्लिक करें।"
      • यह मुख्य रोबोट को लाइव स्क्रीन पर केंद्रित रखता है, न कि पुराने संदर्भ फोटो पर।

यह असल जिंदगी में कैसे काम करता है (द "चार्ट" उदाहरण)

यह पेपर यह दिखाने के लिए एक विशिष्ट उदाहरण का उपयोग करता है कि यह बेहतर क्यों है: स्प्रेडशीट में चार्ट बनाना।

  • परिदृश्य: कार्य है "Sheet 2 पर चार्ट बनाएं।"
  • टेक्स्ट-ओनली एजेंट: "चार्ट बनाएं" पढ़ता है। वह एक चार्ट बनते हुए देखता है। वह "Done" पर क्लिक करता है।
    • परिणाम: उसने Sheet 1 पर चार्ट बना दिया (गलत शीट पर) क्योंकि टेक्स्ट ने यह नहीं बताया कि यह देखना है कि कौन सी शीट सक्रिय है। स्कोर: 0।
  • MMSkills एजेंट:
    1. यह "Create Chart" स्किल लोड करता है।
    2. स्टेट कार्ड कहता है: "जांचें: क्या सक्रिय शीट का नाम 'Sheet 2' है?"
    3. विजुअल एविडेंस सही शीट टैब का एक फोटो दिखाता है।
    4. रोबोट देखता है कि वह वर्तमान में Sheet 1 पर है। "ब्रांच" कहता है: "रुको! आप गलत शीट पर हैं। पहले Sheet 2 पर स्विच करें।"
    5. रोबोट स्विच करता है, चार्ट बनाता है, और सत्यापित करता है कि शीर्षक फोटो से मेल खाता है।
    • परिणाम: सही शीट पर परफेक्ट चार्ट। स्कोर: 1।

इसके परिणाम क्या रहे

शोधकर्ताओं ने दो प्रकार के कार्यों पर इसका परीक्षण किया:

  1. डेस्कटॉप कार्य: जैसे Excel, Chrome, या Word का उपयोग करना (OSWorld, macOSWorld)।
  2. गेम कार्य: जैसे Minecraft या Super Mario Bros खेलना।

निष्कर्ष:

  • बेहतर सफलता दर: MMSkills का उपयोग करने वाले रोबोटों ने बिना किसी स्किल या केवल टेक्स्ट स्किल्स वाले रोबोटों की तुलना में बहुत अधिक कार्य सफलतापूर्वक पूरे किए।
  • छोटे रोबोटों की मदद की: इन विजुअल गाइड्स को दिए जाने पर छोटे और कम शक्तिशाली AI मॉडल भी कार्यों में बहुत बेहतर हो गए।
  • कम गलतियाँ: रोबोटों ने बार-बार होने वाली गलतियाँ (जैसे एक ही बटन को 10 बार दबाना) कम कीं और कार्य तेजी से पूरे किए।
  • केवल कंप्यूटर तक सीमित नहीं: यह सिस्टम वीडियो गेम में भी उतना ही अच्छा काम करता है, जो यह साबित करता है कि चाहे आप फाइलों को मैनेज कर रहे हों या बाधाओं के ऊपर से कूद रहे हों, "स्टेट को देखना" महत्वपूर्ण है।

सारांश

MMSkills एक ऐसा तरीका है जिससे AI एजेंटों को न केवल यह सिखाया जाता है कि क्या करना है, बल्कि यह भी कि कैसे पहचानना है कि वे इसे सही ढंग से कर रहे हैं। टेक्स्ट निर्देशों को "ट्रैफिक लाइट" चेकलिस्ट और विशिष्ट फोटो के साथ जोड़कर, और "साइड-विंडो" पद्धति का उपयोग करके, यह सिस्टम रोबोट को रास्ता भटकने, भ्रमित होने या गलत स्क्रीन पर अटकने से बचने में मदद करता है। यह एक ऐसे रोबोट को बदल देता है जो केवल आदेशों का आँख बंद करके पालन करता है, एक ऐसे रोबोट में जो वास्तव में उस दृश्य दुनिया (visual world) को समझता है जिसमें वह काम कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →