← नवीनतम पेपर
🤖 AI

Improved Object-Centric Diffusion Learning with Registers and Contrastive Alignment

यह शोध पत्र CODA को प्रस्तुत करता है, जो एक ऐसी विधि है जो स्लॉट एंटैंगलमेंट (slot entanglement) को कम करने के लिए रजिस्टर स्लॉट्स को एकीकृत करके और स्लॉट-इमेज पत्राचार (slot-image correspondence) को मजबूत करने के लिए एक कंट्रास्टिव अलाइनमेंट लॉस (contrastive alignment loss) लागू करके ऑब्जेक्ट-सेंट्रिक लर्निंग को उन्नत करती है, जिसके परिणामस्वरूप सिंथेटिक और वास्तविक दुनिया के डेटासेट दोनों पर बेहतर ऑब्जेक्ट डिस्कवरी और जनरेशन प्रदर्शन प्राप्त होता है।

मूल लेखक: Bac Nguyen, Yuhta Takida, Naoki Murata, Chieh-Hsin Lai, Toshimitsu Uesaka, Stefano Ermon, Yuki Mitsufuji

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bac Nguyen, Yuhta Takida, Naoki Murata, Chieh-Hsin Lai, Toshimitsu Uesaka, Stefano Ermon, Yuki Mitsufuji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक खिड़की से देखते हुए एक व्यस्त सड़क के दृश्य को देख रहे हैं। आप एक लाल कार, एक व्यक्ति को कुत्ता टहलाते हुए, एक ट्रैफिक लाइट और एक कॉफी शॉप देखते हैं।

समस्या: "कीचड़ वाली बाल्टी" वाला दृष्टिकोण (The "Muddy Bucket" Approach)
वर्तमान AI मॉडल जो इस दृश्य को समझने की कोशिश करते हैं, वे "स्लॉट अटेंशन" (Slot Attention) नामक एक विधि का उपयोग करते हैं। इसे ऐसे समझें जैसे आपके पास श्रमिकों की एक टीम (जिन्हें "स्लॉट्स" कहा जाता है) है जिन्हें सड़क से विशिष्ट वस्तुओं को उठाने और उन्हें अपनी बाल्टियों में रखने के लिए कहा गया है।

हालाँकि, पुराने तरीके में, श्रमिक बहुत अस्त-व्यस्त थे:

  1. कीचड़ वाली बाल्टी (एंटैंगलमेंट/उलझाव): एक श्रमिक लाल कार को उठाने की कोशिश कर सकता है, लेकिन वह गलती से कुत्ते और कॉफी शॉप के साइन बोर्ड का एक हिस्सा भी उठा लेता है। उनकी बाल्टी सब कुछ का एक कीचड़ भरा मिश्रण बन जाती है। यदि आप AI से कहें, "मुझे केवल कार दिखाओ," तो वह ऐसा नहीं कर सकता, क्योंकि कार कुत्ते के साथ मिल गई है।
  2. भ्रमित श्रमिक (कम संरेखण/Weak Alignment): कभी-कभी, एक श्रमिक कार के बजाय पूरी सड़क को ही उठा लेता है। अन्य मामलों में, वे कार को तीन अलग-अलग बाल्टियों में विभाजित कर देते हैं। उन्हें यह नहीं पता होता कि एक वस्तु कहाँ समाप्त होती है और दूसरी कहाँ शुरू होती है।

यह AI के लिए कुछ शानदार चीजें करना कठिन बना देता है जैसे कि "कुत्ते को रखते हुए कार को हटाना" या "लाल कार को नीले ट्रक से बदलना।"

समाधान: CODA (एक व्यवस्थित गोदाम)
यह पेपर एक नया सिस्टम पेश करता है जिसे CODA (कॉन्ट्रास्टिव ऑब्जेक्ट-सेंट्रिक डिफ्यूजन अलाइनमेंट) कहा जाता है। यह इस अव्यवस्था को दो चतुर तरीकों से ठीक करता है:

ट्रिक 1: "कचरे के डिब्बे" वाले श्रमिक (रजिस्टर स्लॉट्स)

कल्पना कीजिए कि आपके पास श्रमिकों की एक टीम है, लेकिन आपने कुछ अतिरिक्त श्रमिकों को भी काम पर रखा है जिनका एकमात्र काम कचरे के डिब्बे (Trash Cans) होना है।

  • जब मुख्य श्रमिक "लाल कार" को उठाने की कोशिश कर रहे होते हैं, तो वे बैकग्राउंड के शोर (आसमान, फुटपाथ, या यह तथ्य कि कार एक पेड़ के पास है) से विचलित हो सकते हैं।
  • मुख्य श्रमिकों को इस भ्रमित करने वाले बैकग्राउंड शोर को थामे रखने के लिए मजबूर करने के बजाय, वे इसे बस कचरे के डिब्बे वाले श्रमिकों में डाल सकते हैं।
  • परिणाम: मुख्य श्रमिक अब केवल "लाल कार" की शुद्ध और साफ अवधारणा को थामे रखते हैं। कचरे के डिब्बे वाले श्रमिक सारा बचा हुआ कचरा सोख लेते हैं। यह मुख्य बाल्टियों को पूरी तरह से व्यवस्थित और अलग रखता है।

ट्रिक 2: "सख्त मैनेजर" (कॉन्ट्रास्टिव अलाइनमेंट)

पुराने सिस्टम में, श्रमिकों को बस यह कहा जाता था, "सड़क के दृश्य को फिर से बनाने की कोशिश करो।" उन्हें आलसी या भ्रमित होने के लिए दंडित नहीं किया जाता था।

CODA एक सख्त मैनेजर जोड़ता है जो "अंतर पहचानो" के खेल का उपयोग करता है:

  • मैनेजर एक श्रमिक को दिखाता है जिस पर "लाल कार" का लेबल लगा है और पूछता है, "क्या यह फोटो में दिख रही लाल कार जैसा दिखता है?"
  • फिर, मैनेजर उन्हें एक "लाल कार" वाली बाल्टी दिखाता है लेकिन वह "कुत्ते" या "कॉफी शॉप" से भरी हुई है (एक गलत मेल)।
  • मैनेजर कहता है, "यदि तुम गलत चुनते हो, तो तुम्हें पेनल्टी मिलेगी!"
  • परिणाम: श्रमिक बहुत सटीक होना सीख जाते हैं। वे समझते हैं, "ओह, मुझे केवल लाल कार ही उठानी होगी, वरना मुझे सजा मिलेगी।" यह उन्हें छवि के विशिष्ट वस्तुओं के साथ पूरी तरह से संरेखित होने के लिए मजबूर करता है।

यह क्यों मायने रखता है (सुपरपावर)

क्योंकि अब श्रमिक व्यवस्थित और सटीक हैं, AI को एक सुपरपावर प्राप्त होती है: कंपोजिशनल एडिटिंग (संरचनात्मक संपादन)

  • पहले: यदि आप AI को "कार हटाने" के लिए कहते, तो वह कार के साथ कुत्ते को भी हटा देता, या आसमान में एक अजीब सा छेद छोड़ देता।
  • CODA के साथ: आप कह सकते हैं, "कार को हटाओ," और AI जानता है कि कौन सी बाल्टी कार को थामे हुए है। वह उस बाल्टी को हटा देता है, और बाकी का दृश्य (कुत्ता, ट्रैफिक लाइट) पूरी तरह से बरकरार रहता है। आप "लाल कार" की बाल्टी को "नीले ट्रक" की बाल्टी से बदल भी सकते हैं, और AI उसी स्थान पर एक नीला ट्रक दिखाते हुए एक बिल्कुल नया, वास्तविक दिखने वाला चित्र बना देता है।

निचोड़ (The Bottom Line)

लेखकों ने एक ऐसा सिस्टम बनाया है जो AI को एक बिखरी हुई तस्वीर को देखने, हर एक वस्तु को उसके अपने साफ, अलग बॉक्स में छाँटने और बैकग्राउंड के शोर को फेंक देने के लिए सिखाता है। यह AI को न केवल दुनिया को देखने की अनुमति देता है, बल्कि इसे इतनी अच्छी तरह से समझने की अनुमति देता है कि वह इसे पुनर्व्यवस्थित कर सके, संपादित कर सके और पूर्ण तर्क के साथ नए दृश्यों की कल्पना कर सके।

यह एक बच्चे द्वारा फर्श पर लेगो (LEGO) के पूरे डिब्बे को खाली करने से लेकर, एक मास्टर बिल्डर तक जाने जैसा है जिसने हर ईंट को रंग और आकार के आधार पर छाँट लिया है, और अब वह जो चाहे बनाने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →