← नवीनतम पेपर
💻 computer science

SlotDiT: Object-Centric Representations for Diffusion Transformers

यह शोध पत्र SlotDiT को प्रस्तुत करता है, जो एक टेक्स्ट-गाइडेड डिफ्यूजन ट्रांसफॉर्मर है जो पारंपरिक VAE-आधारित दृष्टिकोणों की तुलना में प्रतिस्पर्धी वीडियो जनरेशन गुणवत्ता और रोबोटिक अनुप्रयोगों में काफी बेहतर टास्क-कम्प्लीशन दर प्राप्त करने के लिए ऑब्जेक्ट-सेंट्रिक स्लॉट-आधारित लेटेंट रिप्रेजेंटेशन का उपयोग करता है।

मूल लेखक: Gjergj Plepi, Sven Behnke

प्रकाशित 2026-09-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gjergj Plepi, Sven Behnke

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से दुनिया को केवल पिक्सेल के धुंधलेपन के रूप में नहीं, बल्कि अलग-अलग चलती और परस्पर क्रिया करने वाली वस्तुओं के संग्रह के रूप में समझने के लिए संघर्ष कर रहे हैं। वर्षों से, वीडियो उत्पन्न करने या रोबोट की क्रियाओं की योजना बनाने के लिए डिज़ाइन किए गए आर्टिफिशियल इंटेलिजेंस सिस्टम ने एक ऐसी विधि पर भरोसा किया है जो प्रत्येक छवि को रंगीन बिंदुओं के एक विशाल ग्रिड के रूप में मानती है। हालांकि यह दृष्टिकोण आश्चर्यजनक रूप से वास्तविक चित्र तो बनाता है, लेकिन यह अक्सर तब विफल हो जाता है जब एक रोबोट को कप उठाने या मेज पर ब्लॉक को खिसकाने की आवश्यकता होती है। समस्या यह है कि ये सिस्टम उच्च-परिभाषा (हाई-डेफिनिशन) विवरण के साथ दुनिया को देखते हैं लेकिन इसके भीतर मौजूद व्यक्तिगत वस्तुओं का स्पष्ट मानसिक मानचित्र रखने में असमर्थ होते हैं। वे जानते हैं कि एक दृश्य कैसा दिखता है, लेकिन वे यह समझने में संघर्ष करते हैं कि उसके अंदर क्या हो रहा है। देखने और समझने के बीच के इस अंतर ने मशीनों की वास्तविक वातावरण में सरल निर्देशों का पालन करने या जटिल गतिविधियों की योजना बनाने की क्षमता को सीमित कर दिया है।

बॉन विश्वविद्यालय के शोधकर्ताओं की एक टीम ने मशीनों के देखने का एक अलग तरीका प्रस्तावित किया है। आर्टिफिशियल इंटेलिजेंस को वीडियो के हर एक पिक्सेल को प्रोसेस करने के लिए मजबूर करने के बजाय, उन्होंने इसे एक दृश्य को कुछ अलग, गतिशील हिस्सों में तोड़ने के लिए प्रशिक्षित किया। वे इन हिस्सों को "स्लॉट्स" (slots) कहते हैं। कल्पना कीजिए कि आप एक व्यस्त किचन काउंटर को देख रहे हैं और तुरंत कॉफी मग, टोस्टर और फलों के कटोरे को आकारों और रंगों के एक अराजक ढेर के बजाय अलग-अलग संस्थाओं के रूप में पहचान लेते हैं। यह नया सिस्टम, जिसे शोधकर्ताओं ने 'SlotDiT' नाम दिया है, एक शक्तिशाली वीडियो-जनरेटिंग कंप्यूटर मॉडल को निर्देशित करने के लिए इस वस्तु-केंद्रित दृष्टिकोण का उपयोग करता है। बैकग्राउंड के शोर के बजाय स्वयं वस्तुओं पर ध्यान केंद्रित करके, यह प्रणाली बहुत अधिक सटीकता के साथ भविष्यवाणी कर सकती है कि एक दृश्य समय के साथ कैसे बदलेगा, विशेष रूप से "लाल ब्लॉक को नीले कटोरे में ले जाओ" जैसे सरल टेक्स्ट निर्देश मिलने पर।

शोधकर्ताओं ने अपने सिस्टम को दो मुख्य चरणों में काम करने के लिए बनाया है। पहले, कंप्यूटर एक वीडियो फ्रेम को देखता है और इसे इन व्यक्तिगत ऑब्जेक्ट स्लॉट्स में विभाजित करना सीखता है। यह दृश्य में मौजूद संस्थाओं की पहचान करता है और प्रत्येक को एक संक्षिप्त डिजिटल प्रतिनिधित्व (representation) सौंपता है। एक बार जब दृश्य को तोड़ दिया जाता है, तो सिस्टम एक टेक्स्ट निर्देश का उपयोग करके यह भविष्यवाणी करने के लिए मार्गदर्शन करता है कि आगे क्या होगा। भविष्य के हर पिक्सेल के रंग का अनुमान लगाने के बजाय, मॉडल केवल यह भविष्यवाणी करता है कि ये कुछ ऑब्जेक्ट स्लॉट्स कैसे हिलेंगे और बदलेंगे। फिर यह इन भविष्यवाणियों को वापस जोड़कर भविष्य का एक वीडियो बनाता है। टीम ने इस पद्धति का परीक्षण पुराने सिस्टमों के विरुद्ध किया जो पारंपरिक, पिक्सेल-भारी दृष्टिकोण पर निर्भर थे। उन्होंने चार अलग-अलग डेटासेट्स पर प्रयोग किए, जिनमें टेबलटॉप गेम्स के सरल कंप्यूटर सिमुलेशन से लेकर घरेलू कार्यों को करने वाले रोबोट के जटिल, वास्तविक फुटेज तक शामिल थे।

परिणामों ने दुनिया को विस्तार से देखने और उसे संरचनात्मक रूप से समझने के बीच एक स्पष्ट विभाजन दिखाया। पुराने सिस्टम, जो उच्च दृश्य निष्ठा (visual fidelity) पर केंद्रित थे, अक्सर ऐसे वीडियो बनाते थे जो मानवीय आंखों को सहज और वास्तविक लगते थे। हालांकि, किसी विशिष्ट निर्देश का पालन करने के लिए कहे जाने पर, ये सिस्टम अक्सर विफल हो जाते थे। वे एक ब्लॉक के फिसलने का सुंदर वीडियो तो बना सकते थे, लेकिन ब्लॉक गलत जगह पर पहुँच जाता या अनुरोध के अनुसार लक्ष्य वस्तु के साथ परस्पर क्रिया करने में विफल रहता। इसके विपरीत, नया SlotDiT सिस्टम, हालांकि कभी-कभी थोड़े कम दृश्य रूप से पूर्ण वीडियो बनाता था, लेकिन वास्तव में कार्य को पूरा करने में लगातार सफल रहा। 'CLIPort' नामक एक डेटासेट पर, जहाँ एक रोबोट को एक विशिष्ट ब्लॉक को एक विशिष्ट कटोरे में रखना होता है, नए सिस्टम ने 73.0 प्रतिशत की सफलता दर हासिल की, जो कि अगले सर्वश्रेष्ठ तरीके से कहीं अधिक था, जिसने केवल 50 प्रतिशत तक ही सफलता प्राप्त की थी। अधिक जटिल, वास्तविक दुनिया के घरेलू परिदृश्यों में भी, वस्तु-केंद्रित सिस्टम ने अपने पिक्सेल-केंद्रित प्रतिद्वंद्वियों की तुलना में उच्च सफलता दर बनाए रखी।

केवल काम पूरा करने के अलावा, नया दृष्टिकोण काफी तेज़ और अधिक कुशल भी साबित हुआ। क्योंकि सिस्टम को हजारों पिक्सेल के बजाय केवल कुछ चुनिचकी ऑब्जेक्ट स्लॉट्स को ट्रैक करना होता है, इसलिए इसे भविष्यवाणियां उत्पन्न करने के लिए बहुत कम कंप्यूटिंग पावर की आवश्यकता होती है। अपने परीक्षणों में, शोधकर्ताओं ने पाया कि नया सिस्टम मानक हाई-डेफिनिशन मॉडल की तुलना में पांच गुना अधिक तेजी से भविष्यवाणियां उत्पन्न कर सकता है। यह गति का लाभ रोबोटिक्स के लिए अत्यंत महत्वपूर्ण है, जहाँ एक मशीन को वास्तविक समय (real-time) में सोचने और प्रतिक्रिया करने की आवश्यकता होती है। अध्ययन बताता है कि रोबोट के वास्तव में उपयोगी होने के लिए, उन्हें आवश्यक रूप से पूर्ण हाई-डेफिनिशन में दुनिया को देखने की आवश्यकता नहीं है; उन्हें इसे इस तरह देखने की आवश्यकता है जो उन वस्तुओं को उजागर करे जो मायने रखती हैं। दृश्य के सूक्ष्म विवरणों के बजाय दृश्य की संरचना को प्राथमिकता देकर, शोधकर्ताओं ने दिखाया है कि मशीनें निर्देशों का पालन करने और अपनी क्रियाओं की योजना बनाने में बहुत बेहतर हो सकती हैं।

यह कार्य आर्टिफिशियल इंटेलिजेंस के बारे में एक आश्चर्यजनक सत्य को भी उजागर करता है: बेहतर दिखने का मतलब हमेशा बेहतर सोचना नहीं होता है। शोधकर्ताओं ने स्पष्ट रूप से पाया कि जो सिस्टम सबसे प्रभावशाली वीडियो उत्पन्न करते थे, वे अक्सर कार्यों को हल करने में सबसे खराब थे। यह इंगित करता है कि वीडियो जनरेशन के लिए वर्तमान मानक—कि वह कितना वास्तविक दिखता है—भ्रामक हो सकता है जब लक्ष्य ऐसी मशीनें बनाना हो जो भौतिक दुनिया के साथ परस्पर क्रिया कर सकें। अध्ययन निष्कर्ष निकालता है कि रोबरों को दुनिया का एक ऑब्जेक्ट-सेंट्रिक (वस्तु-केंद्रित) दृष्टिकोण देना उनकी गतिविधियों की योजना बनाने और नियंत्रण करने की क्षमता में सुधार करने का एक शक्तिशाली तरीका है। हालांकि इस प्रणाली में अभी भी कुछ सीमाएं हैं, जैसे कि ट्रैक करने के लिए वस्तुओं की एक निश्चित संख्या की आवश्यकता, लेकिन ये निष्कर्ष एक आशाजनक मार्ग प्रदान करते हैं। यह सुझाव देता है कि रोबोटिक इंटेलिजेंस का भविष्य केवल मशीनों को अधिक देखने में नहीं, बल्कि उन्हें यह समझने में मदद करने में निहित है कि वे क्या देख रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →