← नवीनतम पेपर
💻 computer science

MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction

यह शोध पत्र MVP-LAM का प्रस्ताव करता है, जो एक मल्टी-व्यूपॉइंट मॉडल है जो VLA प्रीट्रेनिंग और डाउनस्ट्रीम रोबोटिक मैनिपुलेशन प्रदर्शन को बेहतर बनाने के लिए क्रॉस-व्यूपॉइंट रिकंस्ट्रक्शन के माध्यम से एक्शन-सेंट्रिक लेटेंट एक्शन्स सीखता है।

मूल लेखक: Jung Min Lee, Dohyeok Lee, Seokhun Ju, Taehyun Cho, Jin Woo Koo, Li Zhao, Sangwoo Hong, Jungwoo Lee

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jung Min Lee, Dohyeok Lee, Seokhun Ju, Taehyun Cho, Jin Woo Koo, Li Zhao, Sangwoo Hong, Jungwoo Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: रोबोट को सीखने की ज़रूरत है, लेकिन वीडियो झूठ बोलते हैं

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाना चाहते हैं। सीखने का सबसे अच्छा तरीका आमतौर पर किसी इंसान को ऐसा करते हुए देखना होता है। लेकिन यहाँ एक पेंच है: वीडियो के साथ कोई "रिमोट कंट्रोल" जुड़ा हुआ नहीं आता।

जब आप किसी को सैंडविच बनाते हुए वीडियो देखते हैं, तो आप परिणाम देखते हैं (ब्रेड हिल रही है, चाकू कट रहा है), लेकिन आप वे सटीक मांसपेशी हलचलें (यानी "एक्शन") नहीं देख पाते जिनका उपयोग इंसान ने किया था। रोबोट को सीखने के लिए आमतौर पर उन सटीक मांसपेशी हलचलों की आवश्यकता होती है।

इससे बचने के लिए, वैज्ञानिक कंप्यूटर को यह "अनुमान" लगाने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं कि वीडियो एक फ्रेम से दूसरे फ्रेम में कैसे बदलता है। वे इन अनुमानों को "लेटेंट एक्शन्स" (Latent Actions) कहते हैं। इन्हें एक गुप्त कोड की तरह समझें जिसे कंप्यूटर यह बताने के लिए बनाता है कि "इन दो तस्वीरों के बीच क्या हुआ।"

द ट्रैप (जाल):
समस्या यह है कि वीडियो शोर (noisy) से भरे होते हैं। यदि कोई व्यक्ति कप पकड़ने के लिए अपना हाथ हिलाता है, तो वीडियो बदल जाता है। लेकिन अगर कैमरा भी हिल जाता है, तो वीडियो फिर से बदल जाता है।

  • गलती: कंप्यूटर वीडियो को देखकर सोच सकता है, "आह, कप इसलिए हिला क्योंकि कैमरा घूम गया!" बजाय इसके कि "कप इसलिए हिला क्योंकि हाथ ने उसे धक्का दिया।"
  • परिणाम: रोबोट गलत सबक सीख जाता है। वह वास्तविक हाथ की हलचल के बजाय कैमरा मूवमेंट पर प्रतिक्रिया करना सीख जाता है। यह एक छात्र की तरह है जो उत्तरों के बजाय प्रश्नों के फॉन्ट साइज (लिखावट के आकार) को याद करके परीक्षा की तैयारी कर रहा है।

समाधान: MVP-LAM (द "टू-कैमरा" ट्रिक)

लेखकों ने एक नई विधि प्रस्तावित की है जिसे MVP-LAM (Multi-ViewPoint Latent Action Model) कहा जाता है। उनका मुख्य मंत्र एक ही घटना को रिकॉर्ड करने के लिए दो कैमरों (या कई दृष्टिकोणों) का उपयोग करना है।

यहाँ इसकी उपमा (analogy) दी गई है:
कल्पना कीजिए कि आप एक जादूगर को उसका करतब दिखाते हुए देख रहे हैं।

  • कैमरा A बाईं ओर खड़ा है।
  • कैमरा B दाईं ओर खड़ा है।

यदि जादूगर अपना हाथ हिलाता है, तो दोनों कैमरे हाथ को हिलते हुए देखते हैं।
यदि जादूगर नहीं हिलता है, लेकिन कैमरा A को टक्कर लगती है और वह हिल जाता है, तो केवल कैमरा A को झटका महसूस होगा। कैमरा B एक स्थिर छवि देखेगा।

MVP-LAM कैसे काम करता है:
सिर्फ एक कैमरा देखकर एक्शन का अनुमान लगाने के बजाय, MVP-LAM "क्रॉस-चेकिंग" का खेल खेलता है:

  1. यह कैमरा A से एक्शन को देखता है।
  2. यह अनुमान लगाने की कोशिश करता है कि अगले सेकंड में कैमरा B क्या देखेगा।
  3. नियम: यदि "गुप्त कोड" (लेटेंट एक्शन) केवल कैमरा A के हिलने के बारे में है, तो यह कैमरा B के दृश्य की भविष्यवाणी करने में मदद नहीं करेगा। एकमात्र चीज़ जिस पर दोनों कैमरे सहमत होते हैं, वह है वस्तुओं की वास्तविक हलचल

कैमरा A के एक्शन का उपयोग करके व्यू B के भविष्य को समझाने के लिए मजबूर करके, कंप्यूटर को कैमरा मूवमेंट को अनदेखा करने और केवल वास्तविक एक्शन (जैसे हाथ द्वारा कप को हिलाना) पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है। यह दो लोगों से एक रहस्य बताने के लिए कहने जैसा है; यदि वे केवल उन हिस्सों पर सहमत होते हैं जो वास्तव में सच हैं, तो आप जान जाते हैं कि आपने सच्चाई ढूंढ ली है।

उन्होंने क्या पाया

लेखकों ने इस पद्धति का परीक्षण Bridge V2 (रोबोट वीडियो का एक संग्रह) नामक डेटासेट पर किया और अन्य तरीकों से तुलना की।

  1. बेहतर "गुप्त कोड": MVP-LAM द्वारा बनाए गए कोड वास्तविक रोबोट मूवमेंट का वर्णन करने में बहुत बेहतर थे। उनमें पिछले तरीकों की तुलना में वास्तविक क्रियाओं के बारे में 62% अधिक उपयोगी जानकारी थी।
  2. मजबूती (Robustness): भले ही कैमरा एंगल थोड़ा बदल गया हो (जैसे कि रोबोट का सिर झुक गया हो), सिस्टम अभी भी जानता था कि रोबोट क्या कर रहा है। वह नए एंगल से भ्रमित नहीं हुआ।
  3. बेहतर रोबोट प्रदर्शन: जब उन्होंने इन "बेहतर कोड्स" का उपयोग करके एक रोबोट को कार्य (जैसे ब्लॉक को स्टैक करना या वस्तुओं को उठाना) करने के लिए प्रशिक्षित किया, तो रोबोट ने तेजी से सीखा और बेहतर प्रदर्शन किया।
    • परिणाम: MVP-LAM के साथ प्रशिक्षित रोबोट अन्य रोबोटों की तुलना में 3 गुना कम ट्रेनिंग डेटा का उपयोग करके जटिल पहेलियों (एक सिमुलेशन में) को हल कर सका। यह उस छात्र की तरह था जो 1 घंटे पढ़ाई करके परीक्षा पास कर सकता है, जबकि दूसरों को 3 घंटे की आवश्यकता होती है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि कई कोणों से वीडियो का उपयोग करके, हम रोबकों को "कारण और प्रभाव" (मैंने हाथ हिलाया -> कप हिला) को समझने के लिए प्रशिक्षित कर सकते हैं, बिना किसी महंगे मानवीय लेबल की आवश्यकता के जो उन्हें ठीक से हिलने के निर्देश दे।

  • उपमा: यह एक ऐसे छात्र के बीच का अंतर है जो कक्षा की विशिष्ट लाइटिंग (रोशनी) को याद रखता है (और रोशनी बदलने पर फेल हो जाता है) बनाम एक छात्र जो पाठ की अवधारणा (concept) को समझता है (और किसी भी कमरे में टेस्ट पास कर सकता है)।

सारांश

  • समस्या: वीडियो से सीखते समय रोबोट कैमरा मूवमेंट से भ्रमित हो जाते हैं।
  • समाधान: दो कैमरों का उपयोग करें और AI को एक कैमरे के एक्शन का उपयोग करके दूसरे कैमरे के दृश्य को समझाने के लिए मजबूर करें।
  • परिणाम: AI "शुद्ध" (pure) एक्शन सीखता है, कैमरा शोर को अनदेखा करता है, और रोबोट को कम डेटा के साथ तेजी से कार्य करने के लिए सिखाता है।

पेपर निष्कर्ष निकालता है कि यह विधि "यूनिवर्सल" रोबोट दिमाग बनाने की दिशा में एक महत्वपूर्ण कदम है, जो इंटरनेट पर पहले से मौजूद मानव वीडियो के विशाल भंडार से सीख सकते हैं, बिना हर एक चाल को लेबल करने के लिए किसी इंसान की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →