← नवीनतम पेपर
🤖 machine learning

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

यह शोधपत्र MaskLAM प्रस्तुत करता है, जो ज़ीरो-शॉट सेगमेंटेशन के माध्यम से प्री-ट्रेनिंग रिकंस्ट्रक्शन ऑब्जेक्टिव को केवल एजेंट पिक्सेल तक सीमित करके विजुअल डिस्ट्रैक्टर्स की उपस्थिति में लेटेंट एक्शन मॉडल्स में सुधार करने की एक विधि है, जिससे बिना किसी अतिरिक्त आर्किटेक्चरल बदलाव या एक्शन लेबल की आवश्यकता के मॉडल को केवल एजेंट-नियंत्रित डायनेमिक्स सीखने के लिए मजबूर किया जाता है।

मूल लेखक: Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

प्रकाशित 2026-05-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के वीडियो के हजारों घंटों को दिखाकर उसे चलना सिखाने की कोशिश कर रहे हैं। लक्ष्य यह है कि रोबोट यह समझ सके कि वीडियो के कौन से हिस्से चलने वाले के पैरों के हिलने (एक "एक्शन") के कारण हैं और कौन से हिस्से केवल बैकग्राउंड के दृश्य बदलने, कैमरे के हिलने या हवा में पत्तों के उड़ने (डिस्ट्रैक्टर्स) के कारण हैं।

यह वह समस्या है जिसे MaskLAM नामक पेपर हल करने की कोशिश करता है।

समस्या: रोबोट का ध्यान भटक जाता है

पिछले तरीकों (जैसे LAPO नामक सिस्टम) ने पूरे वीडियो फ्रेम को देखकर सीखने की कोशिश की। वे पूछते थे: "इस फ्रेम और अगले फ्रेम के बीच क्या बदला?"

एक आदर्श दुनिया में जहाँ सफेद बैकग्राउंड हो, केवल रोबोट की गति ही बदलती है। लेकिन वास्तविक दुनिया में बैकग्राउंड बहुत अस्त-व्यस्त होता है।

  • उपमा: कल्पना कीजिए कि आप एक वीडियो देखकर कार चलाना सीखने की कोशिश कर रहे हैं जहाँ ड्राइवर स्टीयरिंग घुमा रहा है, लेकिन बाहर का दृश्य भी तेजी से पीछे की ओर जा रहा है। यदि आप पूरे चित्र को देखकर सीखने की कोशिश करते हैं, तो आपका मस्तिष्क भ्रमित हो सकता है और सोच सकता है, "ओह, कार इसलिए चल रही है क्योंकि पेड़ तेजी से पीछे जा रहे हैं!" आप स्टीयरिंग व्हील के बजाय पेड़ों को नियंत्रित करना सीख सकते हैं।

तकनीकी शब्दों में, रोबलेट का "लेटेंट एक्शन" (करने के बारे में उसकी आंतरिक समझ) बैकग्राउंड के शोर से प्रदूषित हो जाता है। वह एजेंट के वास्तविक नियंत्रण के बजाय बैकग्राउंड की गति की भविष्यवाणी करना सीख जाता है, जिससे क्रिया करने के समय विफलता होती है।

समाधान: "ब्लाइंडर्स" पहनें (मास्क)

लेखकों ने महसूस किया कि हालांकि "एजेंट" और "डिस्ट्रैक्टर" के विचार अमूर्त हैं, लेकिन वास्तविक वीडियो पिक्सल में, वे आमतौर पर अलग-अलग जगहों पर होते हैं। रोबोट यहाँ है; हिलता हुआ बैकग्राउंड वहाँ है।

उन्होंने MaskLAM बनाया, जो इस प्रकार काम करता है:

  1. एजेंट को पहचानें: ट्रेनिंग शुरू होने से पहले, वे एक स्मार्ट, प्री-ट्रेंड AI (जिसे SAM 2.1 कहा जाता है) का उपयोग करके वीडियो में केवल रोबोट या एजेंट के चारों ओर एक डिजिटल आउटलाइन (एक मास्क) खींचते हैं। वे इसे बिना हर फ्रेम को इंसानों द्वारा लेबल किए, स्वचालित रूप से करते हैं।
  2. बाकी को अनदेखा करें: जब रोबोट वीडियो से सीखने की कोशिश करता है, तो सिस्टम उसे बताता है: "केवल आउटलाइन के अंदर के पिक्सल को देखें। बाहर की हर चीज़ को अनदेखा करें।"
  3. परिणाम: यदि बैकग्राउंड के पेड़ हिलते हैं, तो रोबोट को कोई फर्क नहीं पड़ता क्योंकि वे पिक्सल मास्क के बाहर हैं। यदि रोबोट का पैर हिलता है, तो रोबोट इसे स्पष्ट रूप से देखता है क्योंकि यह मास्क के अंदर है।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि यह सरल ट्रिक बिना किसी जटिल नए आर्किटेक्चर या महंगे मानव लेबल के एक बड़ी समस्या को हल करती है।

  • कोई अतिरिक्त होमवर्क नहीं: अन्य तरीकों के विपरीत, जिन्हें बैकग्राउंड को अनदेखा करने के लिए मानव-लिखित निर्देशों (एक्शन लेबल) के साथ रोबोट को सिखाने की आवश्यकता होती है, MaskLAM केवल मास्क के अंदर के पिक्सल को देखकर बैकग्राउंड को अनदेखा करना सीख जाता है।
  • बेहतर प्रदर्शन: अपने परीक्षणों में (दौड़ते हुए चीते या रोबोटिक आर्म जैसे सिम्युलेटेड वातावरण का उपयोग करके), MaskLAM ने पिछले तरीकों की तुलना में बहुत तेज़ी से और अधिक सटीकता से सीखा।
    • उपमा: यदि पिछले तरीके एक शोर वाले कैफेटेरिया में पढ़ाई करने वाले छात्र की तरह थे, तो MaskLAM उन नॉइज़-कैंसलिंग हेडफ़ोन की तरह है जो केवल शिक्षक की आवाज़ को ही अंदर आने देते हैं।
  • मजबूती (Robustness): भले ही "आउटलाइन" एकदम सटीक न हो (उदाहरण के लिए, यदि यह रोबोट के पैर के एक छोटे से हिस्से को छोड़ देता है या बैकग्राउंड के एक छोटे से हिस्से को शामिल कर लेता है), फिर भी सिस्टम बहुत अच्छी तरह से काम करता है। यह गलतियों के प्रति उदार है।

निष्कर्ष

यह पेपर प्रदर्शित करता है कि रोबोट को अस्त-व्यस्त वीडियो से सिखाने के लिए आपको बहुत जटिल मस्तिष्क बनाने की आवश्यकता नहीं है। आपको बस उन्हें कहाँ देखना है यह सिखाने की आवश्यकता है। प्रक्रिया को केवल एजेंट के पिक्सल तक सीमित करके, रोबोट बैकग्राउंड को नियंत्रित करने के बजाय खुद को वास्तव में कैसे चलाना है, यह सीखना शुरू कर देता है।

यह रोबोट को इंटरनेट पर उपलब्ध विशाल मात्रा में "एक्शन-फ्री" वीडियो से सीखने की अनुमति देता है, बिना यह बताने के लिए कि उन्हें क्या अनदेखा करना है, महंगे मानव लेबल की आवश्यकता के बिना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →