← नवीनतम पेपर
💻 computer science

Latent Actions from Factorized Transition Effects under Agent Ambiguity

यह शोध पत्र ऑब्ज़र्व्ड ट्रांज़िशन फैक्टराइज़ेशन (OTF) और इसके वेरिएंट्स, OTF-LAM और OTF-LAM-Dino को प्रस्तुत करता है, जो अस्पष्ट अवलोकन संक्रमणों (observation transitions) को पुन: प्रयोज्य प्रिमिटिव्स में विघटित करते हैं ताकि बिना पर्यवेक्षण के जटिल, विचलित करने वाले वातावरण में बेसलाइन से बेहतर प्रदर्शन करने वाले सुदृढ़, एक्शन-जैसे लेटेंट रिप्रेजेंटेशन सीखे जा सकें।

मूल लेखक: Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Latent Actions from Factorized Transition Effects under Agent Ambiguity" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "शोर भरी रसोई" (The Noisy Kitchen)

कल्पना कीजिए कि आप एक शेफ को वीडियो देखकर खाना बनाना सीखने की कोशिश कर रहे हैं। हालाँकि, वह वीडियो बहुत अस्त-व्यस्त है। जब शेफ प्याज काट रहा होता है (वह क्रिया जिसे आप सीखना चाहते हैं), तभी कैमरा हिल रहा होता है, फर्श पर एक कुत्ता दौड़ रहा होता है, और हवा से पर्दे लहरा रहे होते हैं।

AI की दुनिया में, इसे एजेंट एम्बिग्युटी (Agent Ambiguity) कहा जाता है।

  • एजेंट (The Agent): शेफ (वह चीज़ जिसे आप नियंत्रित करना चाहते हैं)।
  • क्रिया (The Action): प्याज काटना।
  • एम्बिग्युटी (The Ambiguity): वीडियो में सभी बदलाव एक साथ दिखाई देते हैं (प्याज का हिलना, कुत्ते का दौड़ना, पर्दों का लहराना)।

पुराने AI मॉडल पूरे अस्त-व्यस्त वीडियो को देखकर "प्याज काटने" की क्रिया का अनुमान लगाने की कोशिश करते थे। वे अक्सर भ्रमित हो जाते थे, यह सोचकर कि कुत्ते का दौड़ना भी खाना बनाने की रेसिपी का हिस्सा है, या वे शेफ के हिलने और कैमरा हिलने के बीच अंतर नहीं कर पाते थे।

समाधान: वीडियो को "लेगो ब्रिक्स" (Lego Bricks) में तोड़ना

लेखकों ने एक नई विधि प्रस्तावित की है जिसे OTF-LAM कहा जाता है। पूरे एक्शन का एक साथ अनुमान लगाने के बजाय, वे वीडियो के बदलावों को छोटे, पुन: उपयोग करने योग्य टुकड़ों में तोड़ देते हैं, जैसे कि मिले-जुले लेगो ब्रिक्स के ढेर को छाँटना।

वे इन टुकड़ों को ऑब्जर्व्ड ट्रांज़िशन प्रिमिटिव्स (Observed Transition Primitives) कहते हैं।

  • "शेफ प्याज काट रहा है" देखने के बजाय, AI देखता है: "पिक्सेल का एक छोटा हिस्सा बाईं ओर हिल रहा है," "एक किनारा नीचे की ओर खिसक रहा है," और "बैकग्राउंड धुंधला हो रहा है।"
  • ये लेगो ब्रिक्स हैं। ये गति के सरल, पुन: उपयोग करने योग्य पैटर्न हैं जो कहीं भी हो सकते हैं, चाहे वह शेफ हो, कोई रोबोट हो, या कोई कार्टून कैरेक्टर।

यह कैसे काम करता है: दो-चरणीय प्रक्रिया

चरण 1: "ब्रिक सॉर्टर" (The Brick Sorter - OTF)
सबसे पहले, AI हज़ारों वीडियो देखता है और चित्र में होने वाले हर छोटे बदलाव को अपनी शब्दावली के एक विशिष्ट "ब्रिक" (ईंट) में छाँटना सीखता है।

  • उपमा (Analogy): एक लाइब्रेरियन की कल्पना करें जिसे इस बात से कोई फर्क नहीं पड़ता कि किताब किस बारे में है, बल्कि उसे केवल इस बात से मतलब है कि पन्ने कैसे पलट रहे हैं। वे हर पन्ना पलटने की क्रिया को श्रेणियों में बाँटते हैं: "तेज़ पलटना," "धीरे से खिसकना," या "फटना।"
  • AI सीखता है कि एक "तेज़ पलटना" वैसा ही दिखता है चाहे वह इंसान का हाथ हो जो पन्ना पलट रहा है या एक रोबोट का हाथ जो किसी डायल को घुमा रहा है। यह इन "ब्रिक्स" को पुन: उपयोग योग्य (reusable) बनाता है।

चरण 2: "शेफ का सहायक" (The Chef's Assistant - OTF-LAM)
एक बार जब ब्रिक्स छाँट लिए जाते हैं, तो AI को यह पता लगाना होता है कि कौन से ब्रिक्स शेफ (एजेंट) के कारण थे और कौन से कुत्ते या हवा के कारण थे।

  • उपमा: AI वर्तमान दृश्य (रसोई) को देखता है और पूछता है, "यह देखते हुए कि शेफ ने चाकू पकड़ा हुआ है, इनमें से कौन से 'चलते हुए ब्रिक्स' शेफ की वजह से होने की संभावना है?"
  • यह प्रासंगिक ब्रिक्स को चुनता है, शोर (कुत्ते) को नज़रअंदाज़ करता है, और उन्हें एक एकल "एक्शन सिग्नल" में जोड़ देता है। यह सिग्नल AI को बताता है: "शेफ प्याज काट रहा है।"

"फ्रोजन डिनो" ट्रिक (The "Frozen DINO" Trick - OTF-LAM-Dino)

पेपर में एक स्मार्ट वर्ज़न भी पेश किया गया है जिसे OTF-LAM-Dino कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप किसी वीडियो का अगला फ्रेम प्रेडिक्ट (अनुमान लगाना) करने की कोशिश कर रहे हैं। आमतौर पर, AI हर एक पिक्सेल (प्याज का रंग, मेज की बनावट) को फिर से बनाने की कोशिश करता है। यह कठिन है क्योंकि रोशनी बदल सकती है या मेज अलग दिख सकती है।
  • ट्रिक: पिक्सल्स को फिर से बनाने के बजाय, यह वर्ज़न एक "फ्रोजन" एक्सपर्ट (DINOv2) का उपयोग करता है जो पहले से ही चीजों के आकार और संरचना को समझता है। AI को केवल संरचना (structure) के बदलने की भविष्यवाणी करने की आवश्यकता होती है, न कि सटीक रंगों की।
  • यह शतरंज के खेल की अगली चाल को बोर्ड की स्थिति (संरचना) देखकर प्रेडिक्ट करने जैसा है, न कि लकड़ी के मोहरों को फिर से पेंट करने की कोशिश करने जैसा। यह AI को विकर्षणों (distractions) को नज़रअज़ करने में बहुत बेहतर बनाता है।

उन्होंने क्या साबित किया?

लेखकों ने मुख्य रूप से दो चीजों पर परीक्षण किया:

  1. मूविंग MNIST (The "Digit" Test): उन्होंने AI को चलते हुए नंबरों के वीडियो दिखाए। उन्होंने इसे 0–4 तक के नंबरों पर प्रशिक्षित किया और फिर इसे उन नंबरों (5–9) पर टेस्ट किया जिन्हें इसने पहले कभी नहीं देखा था।

    • परिणाम: क्योंकि AI ने नंबरों के विशिष्ट लुक के बजाय गति के पैटर्न (ब्रिक्स) को सीखा था, इसलिए यह नए नंबरों पर भी पूरी तरह से काम कर गया। इसने साबित किया कि "ब्रिक्स" पुन: उपयोग योग्य हैं।
  2. DCS (The "Robot" Test): उन्होंने एक जटिल रोबोट सिमुलेशन का उपयोग किया जहाँ रोबोट को दौड़ना या चलना होता है जबकि बैकग्राउंड में कुछ हलचल हो रही होती है।

    • परिणाम: नया तरीका (OTF-LAM) पुराने तरीकों की तुलना में रोबोट को नियंत्रित करने के तरीके को सीखने में बेहतर था। इसने सफलतापूर्वक विचलित करने वाले बैकग्राउंड को नज़रअंदाज़ किया और रोबोट की गति पर ध्यान केंद्रित किया।

निष्कर्ष (The Bottom Line)

यह पेपर कहता है: "एक अस्त-व्यस्त वीडियो से पूरे एक्शन का अनुमान लगाने की कोशिश न करें। इसके बजाय, वीडियो के बदलावों को छोटे, पुन: उपयोग करने योग्य 'मूवमेंट ब्रिक्स' में तोड़ दें। पहले इन ब्रिक्स को छाँटें, फिर यह पता लगाएँ कि कौन से ब्रिक्स उस एजेंट के हैं जिसे आप नियंत्रित करना चाहते हैं।"

ऐसा करके, AI वास्तविक दुनिया के वातावरण में बेहतर ढंग से काम करने में सक्षम होता है जहाँ बहुत सारे विकर्षण (distractions) होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →