← नवीनतम पेपर
💻 computer science

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM एक प्रतिनिधित्व-केंद्रित (representation-centric) विश्व क्रिया मॉडल पेश करता है जो संरेखित अर्थपूर्ण लेटेंट स्पेस (aligned semantic latent spaces) सीखने के लिए एक नवीन विजुअल-एक्शन टोकेनाइज़र का उपयोग करता है, जो पारंपरिक पुनर्निर्माण-उन्मुख (reconstruction-oriented) दृष्टिकोणों की तुलना में बेहतर निर्देश-अनुपालन और क्लोज्ड-लूप रोबोट हेरफेर प्रदर्शन को सक्षम बनाता है।

मूल लेखक: Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे फल उठाना या दराज खोलना। ऐसा करने के लिए, रोबोट को एक "दिमाग" की आवश्यकता होती है जो यह समझ सके कि वह क्या देख रहा है और उसे आगे क्या हरकतें करनी चाहिए। यह शोध पत्र एक नए प्रकार के दिमाग को पेश करता है जिसे RepWAM कहा जाता है।

यहाँ इसका सरल विवरण दिया गया है कि यह कैसे काम करता है, रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

समस्या: "पिक्सेल-परफेक्ट" बनाम "सार्थक" के बीच का अंतर

अधिकांश वर्तमान रोबोटिक दिमाग वीडियो जनरेटर (जैसे कि नकली वीडियो बनाने वाला AI) के ऊपर बनाए जाते हैं। ये जनरेटर पिक्सेल की पूर्णता (pixel perfection) के प्रति जुनूनी होते हैं।

  • पुराना तरीका: कल्पना कीजिए कि एक छात्र कार की एक फोटो को घूरकर गाड़ी चलाना सीखने की कोशिश कर रहा है। वह पेंट का सटीक रंग, सड़क की बनावट और परछाइयों को याद कर लेता है। लेकिन जब वह स्टीयरिंग व्हील के पीछे बैठता है, तो उसे यह समझ नहीं आता कि स्टीयरिंग व्हील कार को कैसे घुमाता है या कार क्यों चलती है। वह दुनिया के "दिखावे" में फंसा रहता है, उसके "तर्क" में नहीं।
  • समस्या: मौजूदा रोबोट मॉडल भविष्य की भविष्यवाणी करने के लिए यह अनुमान लगाने की कोशिश करते हैं कि हर पिक्सेल बिल्कुल कैसा दिखेगा। यह बहुत अधिक विवरण है और इसमें महत्वपूर्ण चीजें छूट जाती हैं: कौन सी वस्तु हिल रही है? क्या दराज खुल रही है? क्या फल उठाया जा रहा है?

समाधान: एक "सिमेंटिक" (अर्थपूर्ण) अनुवादक

लेखकों ने RepWAM बनाया है, जो एक विशेष अनुवादक का उपयोग करता है जिसे विजुअल-एक्शन टोकनाइज़र (Visual-Action Tokenizer) कहा जाता है। इसे एक ऐसे अनुवादक के रूप में सोचें जो रोबोट के कच्चे कैमरा फीड को "पिक्सेल" के बजाय "अर्थ" की भाषा में बदल देता है।

  1. विजुअल अनुवादक (क्या):
    सिर्फ छवि की नकल करने के बजाय, इस प्रणाली का हिस्सा वीडियो को देखता है और पूछता है, "यहाँ मुख्य कहानी क्या है?" यह वीडियो को सिमेंटिक टोकन (semantic tokens) में संकुचित कर देता है।

    • उदाहरण: बिल्ली की तस्वीर का वर्णन करने के लिए उसके हर बाल के रंग की सूची बनाने के बजाय, यह कहता है, "बिल्ली, मैट पर बैठी है, बाईं ओर देख रही है।" यह महत्वपूर्ण पहचान और संबंधों को रखता है लेकिन अनावश्यक शोर (noise) को हटा देता है।
  2. एक्शन अनुवादक (कैसे):
    यह सबसे चतुर हिस्सा है। सिस्टम केवल देखना नहीं सीखता; यह यह भी सीखता है कि बदलाव कैसे होते हैं। यह लेटेंट एक्शन टोकन (Latent Action Tokens) बनाता है।

    • उदाहरण: एक फ्लिपबुक की कल्पना करें। पुराने तरीके में हर फ्रेम को पूरी तरह से बनाने की कोशिश की जाती थी। RepWAM उस "तीर" (arrow) को सीखता है जो पेज 1 को पेज 2 में बदल देता है। यह सीखता है कि "दराज को धकेलना" एक विशिष्ट संक्रमण (transition) है जो स्थिति को "बंद" से "खुली" अवस्था में ले जाता है। यह क्रियाओं (actions) को दो सार्थक चित्रों के बीच के सेतु के रूप में देखता है।

वे मिलकर कैसे काम करते हैं

RepWAM इन दोनों अनुवादकों को एक ही कमरे में रखता है।

  • प्रशिक्षण (Training): रोबोट वीडियो देखता है और भविष्यवाणी करना सीखता है: "यदि मैं यह (सार्थक चित्र) देखता हूँ और मैं यह (सार्थक क्रिया) करता हूँ, तो अगला चित्र उस जैसा दिखेगा।"
  • परिणाम: क्योंकि रोबोट "पिक्सेल और रंगों" के बजाय "वस्तुओं और गतिविधियों" के संदर्भ में सोच रहा है, इसलिए वह "फल उठाओ" या "दराज को धक्का दो" जैसे निर्देशों का पालन करने में बहुत बेहतर हो जाता है।

परिणाम: क्या यह काम करता है?

लेखकों ने वास्तविक रोबोटों और सिमुलेशन में इसका परीक्षण किया:

  • वास्तविक दुनिया: एक ड्यूल-आर्म रोबोट पर, RepWAM ने पिछले मॉडलों की तुलना में फल उठाने, दराजों को धकेलने और ट्यूबों को रैक में डालने के कार्यों को बहुत बेहतर तरीके से सफलतापूर्वक पूरा किया।
  • सिमुलेशन: एक जटिल वीडियो गेम जैसे सिमुलेशन (RoboTwin 2.0) में, इसने कठिन कार्यों पर बहुत उच्च स्कोर प्राप्त किया, यहाँ तक कि उन मॉडलों को भी पछाड़ दिया जो विशाल वीडियो डेटासेट पर प्री-ट्रेन किए गए थे।
  • मुख्य निष्कर्ष: यह शोध पत्र दिखाता है कि एक अच्छा रोबोट बनने के लिए आपको सटीक पिक्सेल को याद करने की आवश्यकता नहीं है। आपको दृश्य की सिमेंटिक कहानी (semantic story) को समझने की आवश्यकता है। इस "सार्थक" स्थान में रोबोट जो देखता है और जो करता है, उसे एक साथ जोड़कर, रोबोट बहुत अधिक विश्वसनीय हो जाता है।

संक्षेप में

पिछले रोबोट मॉडल उन कलाकारों की तरह थे जो किसी दृश्य को समझने के लिए पेंटिंग के हर स्ट्रोक की नकल करने की कोशिश करते थे। RepWAM एक निर्देशक की तरह है जो कथानक, पात्रों और क्रियाओं को समझता है। पिक्सेल की बनावट के बजाय गति की कहानी पर ध्यान केंद्रित करके, रोबोट अधिक बुद्धिमानी से कार्य करना सीखता है और निर्देशों का अधिक सटीक रूप से पालन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →