← नवीनतम पेपर
💻 computer science

Hierarchical Latent Action Model

यह शोध पत्र HiLAM को प्रस्तुत करता है, जो एक पदानुक्रमित लेटेंट एक्शन मॉडल (hierarchical latent action model) है जो अल्पकालिक गतिशील पैटर्न को उच्च-स्तरीय लेटेंट कौशल में संकलित करने के लिए एक पूर्व-प्रशिक्षित लो-लेवल एक्सट्रैक्टर का लाभ उठाता है, जिससे बिना एक्शन वाले वीडियो डेटा से समय-विस्तारित व्यवहारों की खोज संभव हो पाती है।

मूल लेखक: Hanjung Kim, Lerrel Pinto, Seon Joo Kim

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanjung Kim, Lerrel Pinto, Seon Joo Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि लाज़ानिया (lasagna)।

वर्तमान रोबोटों के साथ समस्या
अभी, अधिकांश रोबोट वीडियो देखकर सीखते हैं। लेकिन एक पेंच है: प्रभावी ढंग से सीखने के लिए, रोबोट को आमतौर पर एक "स्क्रिप्ट" की आवश्यकता होती है जो उसे हर एक सेकंड में ठीक-ठीक बताए कि क्या करना है (जैसे, "हाथ को 2 सेमी बाईं ओर ले जाएं," "नॉब को 15 डिग्री घुमाएं")। यह एक भाषा सीखने के लिए हर शब्द के हर एक अक्षर को याद करने जैसा है। यह महंगा, उबाऊ और पर्याप्त डेटा ढूंढना कठिन है।

कुछ नए तरीके केवल वीडियो देखकर सीखने की कोशिश करते हैं बिना स्क्रिप्ट के। वे दो फ्रेम देखते हैं और अनुमान लगाते हैं, "इन दो तस्वीरों के बीच कौन सी छोटी सी हलचल हुई?" यह छोटी, त्वरित गतिविधियों (जैसे, "चम्मच पकड़ना") को सीखने के लिए बहुत अच्छा है। लेकिन यह बड़ी तस्वीर देखने में विफल रहता है। यह देखता है कि रोबोट चम्मच पकड़ रहा है, फिर हिला रहा है, फिर डाल रहा है, लेकिन यह नहीं समझ पाता कि ये तीन छोटी गतिविधियाँ वास्तव में एक ही बड़े विचार का हिस्सा हैं: "सॉस बनाना।" यह क्रिया के "सार" या "कहानी" को समझने में चूक जाता है।

समाधान: HiLAM (द "मूवी एडिटर" रोबोट)
इस शोध पत्र के लेखकों ने HiLAM बनाया है, जो एक स्मार्ट मूवी एडिटर की तरह काम करता है। केवल व्यक्तिगत फ्रेमों को देखने के बजाय, यह पूरे वीडियो को देखता है और "सीन" (दृश्य) को समझता है।

यहाँ बताया गया है कि HiLAM कैसे काम करता है, एक सरल उदाहरण के माध्यम से:

1. दो-स्तरीय मस्तिष्क (Hierarchical)

सोचिए कि HiLAM के पास मिलकर काम करने वाले दो मस्तिष्क हैं:

  • "माइक्रो" मस्तिष्क (लो-लेवल): यह हिस्सा एक फास्ट-फॉरवर्ड बटन की तरह है। यह वीडियो को देखता है और इसे सूक्ष्म, पलक झपकते ही होने वाली गतिविधियों में तोड़ देता है। यह हाथ के हिलने के तरीके को देखने में बहुत अच्छा है, लेकिन इसे यह नहीं पता कि वह क्यों हिल रहा है।
  • "मैक्रो" मस्तिष्क (हाई-लेवल): यही नया जादू है। यह उन सभी सूक्ष्म गतिविधियों को लेकर उन्हें कौशल (Skills) में समूहित करता है। यह समझ जाता है, "ओह, सेकंड 5 से सेकंड 15 तक की वे सभी छोटी हाथ की गतिविधियाँ वास्तव में एक बड़ा कौशल हैं: कटोरा उठाना।"

2. "डायनामिक चंकिंग" (स्मार्ट कट)

अधिकांश पुराने सिस्टम हर क्रिया को एक ही लंबाई का बनाने की कोशिश करते हैं, जैसे कि एक फिल्म को 5-सेकंड के क्लिप में काटना। लेकिन वास्तविक जीवन ऐसा नहीं है। कभी "कटोरा उठाना" में 2 सेकंड लगते हैं; कभी 10 सेकंड लगते हैं यदि कटोरा फिसलन भरा हो।

HiLAM डायनामिक चंकिंग (Dynamic Chunking) नामक एक विशेष तंत्र का उपयोग करता है। कल्पना कीजिए कि एक मूवी एडिटर जो टाइमर का उपयोग नहीं करता, बल्कि क्रिया को देखता है।

  • यदि रोबोट बस स्थिर बैठा है, तो एडिटर क्लिप को जारी रखता है।
  • जैसे ही रोबोट एक नई, अलग क्रिया शुरू करता है (जैसे, कटोरे को एक नई जगह पर ले जाना), एडिटर "कट" (CUT) दबाता है और एक नया सीन शुरू करता है।
  • इसका मतलब है कि रोबोट सीखता है कि "कौशल" छोटे या लंबे हो सकते हैं, जो इस बात पर निर्भर करता है कि वास्तव में क्या हो रहा है।

3. "मूक" फिल्मों से सीखना

सबसे अच्छी बात? HiLAM को स्क्रिप्ट की आवश्यकता नहीं है। यह "एक्शनलेस" वीडियो से सीखता है—बस इंसानों या रोबोटों के काम करने के कच्चे फुटेज से।

  • चरण 1: यह एक वीडियो देखता है और मूवमेंट को समझाने के लिए अपने स्वयं के "घोस्ट एक्शन्स" (लैटेंट एक्शन्स) का आविष्कार करता है।
  • चरण 2: यह उन घोस्ट एक्शन्स को सार्थक कौशलों (जैसे, "डालना," "हिलाना," "परोसना") में समूहित करने के लिए अपने "मैक्रो ब्रेन" का उपयोग करता है।
  • चरण 3: यह आगे क्या होगा, इसकी भविष्यवाणी करने का अभ्यास करता है। यदि यह देखता है कि रोबोट "डालना" शुरू कर रहा है, तो यह तरल पदार्थ के बाहर आने के भविष्य के फ्रेमों की भविष्यवाणी करता है। यदि यह भविष्य की भविष्यवाणी कर सकता है, तो यह वास्तव में उस कौशल को समझता है।

4. परिणाम: एक स्मार्ट, तेज़ सीखने वाला

जब शोधकर्ताओं ने इसे रोबोट को कार्य करने (जैसे, मेज पर वस्तुओं को इधर-उधर ले जाना) सिखाने पर परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • कम डेटा की आवश्यकता: क्योंकि HiLAM ने "बड़ी तस्वीर" वाले कौशलों को समझा, इसलिए इसे एक नया कार्य सीखने के लिए बहुत कम उदाहरणों की आवश्यकता पड़ी। यह एक रेसिपी को हर सामग्री के माप को याद करने के बजाय चरणों को समझकर सीखने जैसा था।
  • लंबे कार्यों में बेहतर: यह जटिल, बहु-चरणीय कार्यों (जैसे, "पूरा किचन साफ करना") में बहुत बेहतर था क्योंकि यह उन्हें तार्किक हिस्सों (बर्तन धोना -> बर्तन सुखाना -> रख देना) में तोड़ सकता था।
  • व्याख्यात्मकता (Interpretability): आप वास्तव में देख सकते हैं कि रोबोट क्या सोचता है कि "कौशल" क्या हैं। यदि आप इसे "कटोरा उठाने" के लिए कहते हैं, तो इसे पता होता है कि उस कौशल के लिए वीडियो का कौन सा हिस्सा जिम्मेदार है।

निचोड़

HiLAM एक रोबोट को फिल्म देखने और उसके कथानक (प्लॉट) को समझने के लिए सिखाने जैसा है, न कि केवल फ्रेम-दर-फ्रेम एनिमेशन को याद करने के लिए। अपने आप को छोटे आंदोलनों को बड़े, सार्थक कौशलों में समूहित करके, यह किसी भी मानव शिक्षक द्वारा चरण-दर-चरण मैनुअल दिए बिना, पहले की तुलना में बहुत तेज़ी से और अधिक कुशलता से नए कार्य सीख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →