← नवीनतम पेपर
🤖 AI

IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training

IMPACT एक स्केलेबल फ्रेमवर्क है जो इंटरैक्शन-अवेयर वर्ल्ड मॉडल्स को प्रशिक्षित करने के लिए बनाया गया है, जो क्रॉस-अटेंशन का उपयोग करके एक आंतरिक इंटरैक्शन मैप जनरेट करके डीनॉइजिंग सुपरविजन को रीवेट करने के माध्यम से मानक MSE ट्रेनिंग में डायनेमिक ऑब्जेक्ट्स के अंडर-सुपरविजन की समस्या को संबोधित करता है, जिससे बिना किसी बाहरी रिप्रेजेंटेशन के भौतिक संभाव्यता और दृश्य गुणवत्ता में सुधार होता है।

मूल लेखक: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen

प्रकाशित 2026-09-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसा कंप्यूटर है जो एक रोबोटिक हाथ द्वारा कप उठाने के वीडियो को देख सकता है और फिर सटीक रूप से भविष्यवाणी कर सकता है कि आगे क्या होगा। वह जानता है कि कप ऊपर उठेगा, मेज स्थिर रहेगी, और प्रकाश सिरेमिक से टकराकर परावर्तित होगा। इस प्रकार की आर्टिफिशियल इंटेलिजेंस, जिसे 'वर्ल्ड मॉडल' (world model) कहा जाता है, भविष्य की कल्पना करने में तेजी से कुशल होती जा रही है। यह वस्तुओं के हिलने-डुलने और दुनिया समय के साथ कैसे बदलती है, इसे समझने के लिए विशाल वीडियो डेटा से सीखती है। ये सिस्टम रोबोटों को जटिल कार्य करने के लिए सिखाने हेतु अत्यंत महत्वपूर्ण हैं, जैसे इलेक्ट्रॉनिक्स को असेंबल करना या घरेलू कामों में मदद करना, क्योंकि ये मशीनों को किसी वास्तविक वस्तु को छूने से पहले एक आभासी स्थान (virtual space) में अभ्यास करने और योजना बनाने की अनुमति देते हैं। हालाँकि, जबकि ये मॉडल दृश्य के सामान्य प्रवाह की भविष्यवाणी करने में उत्कृष्ट हैं, वे संपर्क के विशिष्ट क्षणों के मामले में अक्सर संघर्ष करते हैं। जब एक रोबोट का हाथ किसी उपकरण को पकड़ता है या मानव उंगली बटन को छूती है, तो वर्तमान तकनीक अक्सर धुंधले, भौतिक रूप से असंभव या असंगत परिणाम देती है। वस्तु हाथ में पिघल सकती है, या गति उस क्रिया से विच्छेदित लग सकती है जिसने उसे प्रेरित किया था।

शोधकर्ताओं ने कंप्यूटर को गहराई के विस्तृत मानचित्र (depth maps) या वस्तुओं के सटीक पथ जैसी अतिरिक्त जानकारी देकर इसे ठीक करने का प्रयास किया है। हालांकि यह मदद करता है, लेकिन इसके लिए महंगी और समय लेने वाली तैयारी की आवश्यकता होती है और अक्सर यह सिस्टम द्वारा सीखे जाने वाले डेटा की मात्रा को सीमित कर देता है। सिंघुआ विश्वविद्यालय और यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी ऑफ चाइना जैसे संस्थानों के शोधकर्ताओं की एक टीम द्वारा किए गए एक नए अध्ययन ने एक अलग समाधान पेश किया है। उन्होंने पाया कि समस्या डेटा की कमी नहीं थी, बल्कि यह था कि कंप्यूटर को डेटा से कैसे सिखाया जा रहा था। प्रशिक्षण प्रक्रिया पर ध्यान केंद्रित करने के तरीके को बदलकर, उन्होंने IMPACT नामक एक विधि विकसित की जो बिना किसी अतिरिक्त बाहरी डेटा या सिस्टम को धीमा किए, इन मॉडलों द्वारा भौतिक अंतःक्रियाओं (physical interactions) को संभालने के तरीके में महत्वपूर्ण सुधार करती है।

शोधकर्ताओं ने जिस मुख्य समस्या की पहचान की है, वह सीखने के तरीके में एक प्रकार का असंतुलन है। इन वर्ल्ड मॉडल्स को प्रशिक्षित करते समय, सिस्टम को आमतौर पर वीडियो का अगला फ्रेम बताने के लिए कहा जाता है और इसकी हर गलती के लिए इसे दंडित किया जाता है। हालाँकि, एक सामान्य वीडियो में, अधिकांश चित्र एक स्थिर पृष्ठभूमि (static background) होते हैं: एक दीवार, एक मेज, या एक फर्श जो बहुत कम बदलता है। क्योंकि ये स्थिर क्षेत्र पिक्सेल का एक बड़ा हिस्सा बनाते हैं, इसलिए कंप्यूटर अपना अधिकांश प्रयास पृष्ठभूमि को सही करने में लगा देता है, क्योंकि इसमें बहुत अधिक भाग है। वे सूक्ष्म, महत्वपूर्ण क्षेत्र जहाँ क्रिया वास्तव में हो रही है—जैसे ग्रिपर का ब्लॉक को छूना या हाथ द्वारा उपकरण को पकड़ना—इतने छोटे हैं कि वे शोर (noise) में खो जाते हैं। कंप्यूटर प्रभावी रूप से उन्हें अनदेखा कर देता है, उन्हें महत्वहीन मान लेता है क्योंकि वे बहुत कम स्थान घेरते हैं। इससे ऐसी स्थिति पैदा होती है जहाँ वीडियो समग्र रूप से सुचारू और सुसंगत दिखता है, लेकिन विशिष्ट अंतःक्रियाएं भौतिक रूप से गलत या दृश्य रूप से अस्त-व्यस्त होती हैं।

इसे हल करने के लिए, शोधकर्ताओं ने एक ऐसी विधि विकसित की जो कंप्यूटर को उन हिस्सों पर अधिक ध्यान देने के लिए सिखाती है जहाँ वास्तव में क्रिया हो रही है। उन्होंने महसूस किया कि कंप्यूटर के पास पहले से ही एक अंतर्निहित संकेत है कि कहाँ देखना है। जब सिस्टम को "नीला कटोरा उठाओ" जैसा निर्देश प्राप्त होता है, तो वह शब्दों "नीला कटोरा" को वीडियो के दृश्य भागों से जोड़ने के लिए 'क्रॉस-अटेंशन' (cross-attention) नामक एक तंत्र का उपयोग करता है। यह एक मानसिक मानचित्र बनाता है जो दिखाता है कि कंप्यूटर के अनुसार कटोरा कहाँ है। शोधकर्ताओं ने इस मौजूदा मानचित्र का उपयोग शुरुआती बिंदु के रूप में किया। फिर उन्होंने कंप्यूटर से उन विशिष्ट क्षेत्रों को देखने और यह जांचने के लिए कहा कि वहां क्या होने वाला है, इसकी भविष्यवाणी करना कितना कठिन था। यदि कंप्यूटर कटोरे की गति की भविष्यवाणी करने में संघर्ष कर रहा था, तो इसका मतलब था कि वह क्षेत्र महत्वपूर्ण था और उस पर अधिक ध्यान देने की आवश्यकता थी।

IMPACT नामक यह सिस्टम इस प्रक्रिया को एक कदम आगे ले जाता है, जिसमें यह वस्तु के आसपास के कई संभावित क्षेत्रों का नमूना (sampling) लेता है और उन्हें इस आधार पर तौलता है कि कंप्यूटर को उन्हें भविष्यवाणी करने में कितनी कठिनाई हुई। इसके बाद, यह एक विशेष मार्गदर्शक, या मानचित्र बनाता है, जो इन अंतःक्रिया क्षेत्रों (interaction zones) को उजागर करता है। प्रशिक्षण के दौरान, कंप्यूटर को इन हाइलाइट किए गए क्षेत्रों में अपनी गलतियों को सुधारने को प्राथमिकता देने का निर्देश दिया जाता है, जो प्रभावी रूप से उसे कहता है, "एक पल के लिए दीवार को भूल जाओ; हाथ और वस्तु पर ध्यान केंद्रित करो।" महत्वपूर्ण बात यह है कि यह मार्गदर्शक पूरी तरह से प्रशिक्षण के दौरान कंप्यूटर के अपने आंतरिक संकेतों से उत्पन्न होता है। इसके लिए किसी बाहरी उपकरण, मैन्युअल लेबलिंग, या अतिरिक्त सेंसर की आवश्यकता नहीं है जो इसे बताए कि क्रिया कहाँ हो रही है। यह इसे अत्यधिक स्केलेबल बनाता है, जिससे यह पिछले दृष्टिकोणों से जुड़ी भारी लागतों के बिना बड़े पैमाने पर डेटा के साथ काम कर सकता है।

शोधकर्ताओं ने इस नई विधि का परीक्षण दो बहुत अलग प्रकार के कार्यों पर किया: एक मेज पर वस्तुओं को संचालित करने वाला रोबोटिक हाथ और प्रथम-व्यक्ति परिप्रेक्ष्य (first-person perspective) से एक मानव हाथ द्वारा सूक्ष्म कार्य करना। दोनों मामलों में, उन्होंने मानक वीडियो जनरेशन तकनीक का उपयोग करके मॉडलों को प्रशिक्षित किया लेकिन सीखने की प्रक्रिया में IMPACT विधि को लागू किया। परिणाम सुसंगत और महत्वपूर्ण थे। IMPACT द्वारा प्रशिक्षित मॉडलों ने ऐसे वीडियो बनाए जहाँ अंतःक्रियाएं कहीं अधिक यथार्थवादी थीं। जब एक रोबोट ग्रिपर ने ब्लॉक को बंद किया, तो ब्लॉक ठोस रहा और सही ढंग से हिला। जब एक मानव हाथ ने कप उठाया, तो उंगलियां उसके चारों ओर स्वाभाविक रूप से लिपटीं, और कप ने सही वजन और गति के साथ प्रतिक्रिया दी। अंतःक्रियाओं की दृश्य गुणवत्ता में नाटकीय सुधार हुआ, जिसमें मानक, समान दृष्टिकोण से प्रशिक्षित मॉडलों की तुलना में कम विरूपण और अधिक भौतिक रूप से प्रशंसनीय गति देखी गई।

रोबोटिक हाथ के परीक्षणों में, इस नई विधि ने समग्र गुणवत्ता स्कोर में एक उल्लेखनीय अंतर से सुधार किया, विशेष रूप से इस मामले में कि रोबोट निर्देशों का कितनी अच्छी तरह पालन करता है और वस्तुओं के भौतिकी का कितनी सटीकता से अनुकरण करता है। मानव हाथ के कार्यों के लिए, दृश्य निष्ठा (visual fidelity) के मामले में सुधार और भी अधिक प्रभावशाली था। IMPACT द्वारा प्रशिक्षित मॉडलों ने ऐसे चित्र उत्पन्न किए जो अधिक स्पष्ट और सुसंगत थे, और हाथ तथा वस्तु के बीच की अंतःक्रिया मानवीय आंखों को स्वाभाविक लगी। शोधकर्ताओं ने पाया कि यह दृष्टिकोण विभिन्न प्रकार के कंप्यूटर आर्किटेक्चर और कंट्रोल सिग्नल पर अच्छी तरह से काम करता है, जो यह दर्शाता है कि समाधान मजबूत और अनुकूलनीय है। केवल सीखने की प्रक्रिया को पुन: भारित (reweighting) करके, वे मूल संरचना को बदले बिना उच्च स्तर की भौतिक वास्तविकता को अनलॉक करने में सक्षम हुए।

यह कार्य यह प्रदर्शित करता है कि आर्टिफिशियल इंटेलिजेंस में बेहतर अंतःक्रिया की कुंजी अधिक जटिल डेटा या बाहरी बाधाओं को जोड़ने में नहीं है, बल्कि इस बात को परिष्कृत करने में है कि सिस्टम पहले से मौजूद डेटा से कैसे सीखता है। शोधकर्ताओं ने दिखाया कि प्रशिक्षण के दौरान ध्यान (attention) के आवंटन में विसंगति की पहचान करके और उसे ठीक करके, वे मॉडल को भौतिक अंतःक्रिया के कठिन और सूक्ष्म विवरणों में महारत हासिल करने के लिए निर्देशित कर सकते हैं। इस विधि के लिए वास्तव में नए वीडियो उत्पन्न करने के दौरान सिस्टम में कोई बदलाव करने की आवश्यकता नहीं है, जिसका अर्थ है कि यह प्रशिक्षण चरण में एक शुद्ध सुधार है। जैसे-जैसे वर्ल्ड मॉडल्स जटिल रोबोटिक कार्यों या सिमुलेशन का समर्थन करने के लिए विकसित हो रहे हैं, IMPACT जैसी तकनीकें एक स्केलेबल मार्ग प्रदान करती हैं, यह सुनिश्चित करती हैं कि जो भविष्य ये मॉडल कल्पना करते हैं वह न केवल दृश्य रूप से सुचारू हो, बल्कि भौतिक रूप से भी सत्य हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →