← नवीनतम पेपर
🤖 machine learning

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

यह शोध पत्र AIM को प्रस्तुत करता है, जो एक इंटेंट-अवेयर यूनिफाइड वर्ल्ड एक्शन मॉडल है जो विजुअल वर्ल्ड मॉडलिंग और रोबोट कंट्रोल के बीच के अंतर को पाटने के लिए प्रीट्रेन्ड वीडियो जनरेशन प्रायर्स और एक्सप्लिसिट स्पेशियल वैल्यू मैप्स का लाभ उठाता है, जिससे मैनिपुलेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं।

पुराना तरीका (समस्या):
वर्तमान में अधिकांश रोबोट के दिमाग एक फिल्म निर्देशक (movie directors) की तरह होते हैं। वे भविष्य में दृश्य कैसा दिखेगा, इसका पूर्वानुमान लगाने में अद्भुत होते हैं। यदि आप उन्हें कहें, "सैंडविच बनाओ," तो वे ब्रेड, चीज़ और चाकू के एक परफेक्ट मूवी सीक्वेंस में हिलने की जीवंत कल्पना कर सकते हैं।

हालाँकि, इसमें एक पेंच है। सिर्फ इसलिए कि रोबोट सैंडविच बनाने की फिल्म देख सकता है, इसका मतलब यह नहीं है कि वह जानता है कि अपने हाथों को कैसे चलाना है। यह बिल्कुल वैसा ही है जैसे किसी कुकिंग शो को देखकर केवल स्क्रीन को घूरते हुए खाना बनाने की कोशिश करना। रोबोट "क्या" (भविष्य का दृश्य) तो देख लेता है, लेकिन "कहाँ" और "क्यों" (चाकू पकड़ने या ब्रेड को दबाने के लिए आवश्यक विशिष्ट हाथ की गतिविधियों) के साथ संघर्ष करता है। वह फिल्म से सीधे हाथ की गतिविधियों का अनुमान लगाने की कोशिश करता है, जो एक अव्यवस्थित और भ्रमित करने वाला काम है।

नया तरीका (AIM):
यह पेपर AIM (इन्टेंट-अवेयर यूनिफाइड वर्ल्ड एक्शन मॉडलिंग - Intent-Aware Unified World action Modeling) को पेश करता है। AIM को केवल एक फिल्म निर्देशक के रूप में नहीं, बल्कि एक ऐसे फिल्म निर्देशक के रूप में सोचें जो एक खजाने का नक्शा (treasure map) भी बनाता है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "खजाने का नक्शा" (स्पेशियल वैल्यू मैप्स - Spatial Value Maps)

केवल अगला वीडियो फ्रेम प्रेडिक्ट करने के बजाय, AIM वीडियो के साथ-साथ एक हीट मैप (एक "वैल्यू मैप") प्रेडिक्ट करता है।

  • वीडियो: भविष्य का दृश्य दिखाता है (जैसे, रोबोट का हाथ ब्रेड के पास है)।
  • मैप: यह हाइलाइट करता है कि रोबोट को ठीक कहाँ छूना है। यह चाकू के हैंडल और ब्रेड के क्रस्ट पर चमकता हुआ लाल दिखाई देता है, और बाकी हर जगह गहरा (dark) रहता है।
  • उपमा: कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ गेम न केवल आपको अगला लेवल दिखाता है, बल्कि जीतने के लिए कदम रखने हेतु जमीन पर एक चमकता हुआ घेरा भी बनाता है। AIM रोबोटों के लिए यही करता है।

2. "ट्रैफिक पुलिस" (इन्टेंट-कॉज़ल अटेंशन - Intent-Causal Attention)

पुराने मॉडल्स में, रोबोट का "एक्शन ब्रेन" (वह हिस्सा जो हाथों को हिलाता है) पूरे मूवी को देख सकता था और बैकग्राउंड की सभी विवरणों (जैसे टेबल का रंग या लाइटिंग) से भ्रमित हो जाता था।
AIM दिमाग के अंदर एक ट्रैफिक पुलिस (Traffic Cop) स्थापित करता है।

  • ट्रैफिक पुलिस कहता है: "हे, एक्शन ब्रेन! तुम्हें भविष्य की फिल्म को सीधे देखने की अनुमति नहीं है। तुम केवल खजाने के नक्शे (Treasure Map) को देख सकते हो।"
  • यह रोबोट को अप्रासंगिक विवरणों (जैसे बैकग्राउंड के शोर) को अनदेखा करने और पूरी तरह से इन्टेंट (intent) (कहाँ पकड़ना है, कहाँ दबाना है) पर ध्यान केंद्रित करने के लिए मजबूर करता है। यह "कहानी" को "एक्शन" से अलग करता है।

3. "सेल्फ-कोचिंग" (सेल्फ-डिस्टिलेशन आरएल - Self-Distillation RL)

जब रोबोट बुनियादी बातें सीख लेता है, तो लेखक उसे एक विशेष प्रशिक्षण सत्र देते हैं जिसे सेल्फ-डिस्टिलेशन (Self-Distillation) कहा जाता है।

  • सेटअप: रोबोट का "मूवी डायरेक्टर" और "मैप मेकर" फ्रीज (स्थिर) कर दिए जाते हैं (वे सीखना बंद कर देते हैं ताकि वे भूल न जाएं)।
  • खेल: रोबोट अपने हाथ चलाने की कोशिश करता है। यदि उसका हाथ मैप के किसी "हॉट स्पॉट" (एक उच्च-मूल्य वाले क्षेत्र) पर पड़ता है, तो उसे इनाम मिलता है। यदि वह चूक जाता है, तो उसे कुछ नहीं मिलता।
  • परिणाम: रोबमा को पहले से पता है कि मैप सही है, और अब वह उस थ्योरी से मेल खाने के लिए शारीरिक कौशल का अभ्यास करता है। यह एक ऐसे छात्र की तरह है जो थ्योरी (नक्शा) पहले से जानता है और अब बस उस थ्योरी से मेल खाने के लिए फिजिकल स्किल का अभ्यास कर रहा है, बिना किसी मानव शिक्षक के हर एक हरकत को सुधारने की आवश्यकता के।

यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने इसे 30,000 सिम्युलेटेड रोबोट कार्यों (जैसे ब्लॉक स्टैक करना, लैपटॉप खोलना, या स्विच दबाना) पर टेस्ट किया।

  • परिणाम: AIM 94% बार सफल रहा, जिसने पिछले सभी मॉडल्स को पीछे छोड़ दिया।
  • जादू: यह उन कठिन कार्यों में सबसे अधिक चमका जहाँ रोबोट को चीजों को सटीकता से छूना होता है (जैसे स्विच घुमाना या कटोरा स्टैक करना)। क्योंकि यह "खजाने के नक्शे" का उपयोग करता है, यह अव्यवस्था से विचलित नहीं होता; इसे पता है कि वास्तव में कहाँ इंटरैक्ट करना है।

संक्षेप में

पिछले रोबोट भविष्य की फिल्म देखकर हिलना सीखने की कोशिश करते थे। AIM रोबोट को फिल्म देखने के साथ-साथ एक चमकते हुए नक्शे को भी देखना सिखाता है जो कहता है, "यहाँ छुओ।" रोबोट को पूरी फिल्म के बजाय नक्शे का पालन करने के लिए मजबूर करके, यह बहुत अधिक स्मार्ट, सटीक और वास्तविक दुनिया के कार्यों को संभालने में बेहतर बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →