← नवीनतम पेपर
🤖 AI

When Do Diffusion Models learn to Generate Multiple Objects?

यह शोध पत्र यह प्रदर्शित करने के लिए मोज़ेक (Mosaic) फ्रेमवर्क प्रस्तुत करता है कि मल्टी-ऑब्जेक्ट जनरेशन में टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स की अविश्वसनीयता मुख्य रूप से दृश्य जटिलता और लो-डेटा रेजीम में काउंटिंग और कंपोजिशनल जनरलाइजेशन सीखने की कठिनाई से उत्पन्न होती है, न कि कॉन्सेप्ट इम्बैलेंस से।

मूल लेखक: Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन थोड़े भ्रमित कलाकार को आपके विवरणों के आधार पर चित्र बनाना सिखा रहे हैं। आप चाहते हैं कि वह कई वस्तुओं वाली एक दृश्य बनाए, जैसे कि "एक नीले कुत्ते के बगल में बैठा एक लाल बिल्ली।"

यह शोध पत्र इस बात की जांच करता है कि क्यों आधुनिक एआई कलाकार (जिन्हें डिफ्यूजन मॉडल कहा जाता) एकल वस्तुओं को बनाने में तो माहिर हैं लेकिन एक साथ कई चीजों को बनाने के लिए कहे जाने पर अक्सर विफल हो जाते हैं। वे एक बिल्ली के बजाय दो बिल्लियाँ बना सकते हैं, रंगों को आपस में मिला सकते हैं (यानी यह भूल सकते हैं कि कौन सा रंग किस जानवर का है), या जानवरों के बैठने के स्थान के बारे में निर्देश को पूरी तरह से अनदेखा कर सकते हैं।

शोधकर्ता जानना चाहते थे कि: क्या कलाकार चित्र बनाने में बुरा है, या निर्देश पुस्तिका (डेटा) दोषपूर्ण है?

यह पता लगाने के लिए, उन्होंने एक विशेष, नियंत्रित "प्रशिक्षण जिम" बनाया जिसे MOSIC कहा जाता है। वास्तविक दुनिया की अव्यवस्थित तस्वीरों के बजाय, उन्होंने ज्यामितीय आकृतियों (जैसे गोले और घन) के साथ सरल दृश्य बनाए जहाँ वे हर एक विवरण को नियंत्रित कर सकते थे।

यहाँ उनके निष्कर्ष दिए गए हैं, जिन्हें सरल अवधारणाओं में विभाजित किया गया है:

1. "गिनती" की समस्या (जादुई संख्या)

उपमा: कल्पना कीजिए कि आप कलाकार को "एक सेब," फिर "दो सेब," फिर "दस सेब" बनाने के लिए कहते हैं।

  • क्या हुआ: जब कलाकार के पास उदाहरणों का एक विशाल पुस्तकालय (एक बड़ा डेटासेट) था, तो वे सटीक रूप से गिन सकते थे। लेकिन जब पुस्तकालय छोटा था, तो कलाकार भ्रमित हो गया।
  • ट्विस्ट: यह केवल इस बारे में नहीं था कि उन्होंने "दस" शब्द को कितनी बार देखा। भले ही उन्होंने "दस" को अक्सर देखा हो, यदि दृश्य दस वस्तुओं से भरा हुआ था, तो कलाकार संघर्ष करता रहा।
  • निष्कर्ष: गिनती करना विशिष्ट रूप से कठिन है। छोटे प्रशिक्षण सेटों में, कलाकार पहले गिनती सही करने की कोशिश करता था, लेकिन जैसे-जैसे वे अभ्यास करते गए, वे वास्तव में और भी खराब होते गए, अक्सर दस वस्तुओं को केवल तीन या चार में बदल देते थे। यह ऐसा है जैसे कलाकार भीड़ से घबरा जाता है और चित्र को "साफ" दिखाने के लिए कम चीजें बनाने का निर्णय लेता है।
  • समाधान: यदि आप कलाकार को वस्तुओं को बिखराव के बजाय एक व्यवस्थित ग्रिड (जैसे टिक-टैक-टो बोर्ड) में बनाने के लिए मजबूर करते हैं, तो वे गिनती करने में बहुत बेहतर हो जाते हैं। यह सुझाव देता है कि एआई को केवल अधिक डेटा की नहीं, बल्कि स्थान को व्यवस्थित करने के लिए एक "सहायक" (इंडक्टिव बायस) की आवश्यकता है।

2. "मिक्स-एंड-मैच" की समस्या (कंपोजिशनल जनरलाइजेशन)

उपमा: कल्पना कीजिए कि आप कलाकार को अलग-अलग "लाल गेंद" और "नीला घन" बनाना सिखाते हैं। फिर आप उनसे एक साथ "एक लाल गेंद और एक नीला घन" बनाने के लिए कहते हैं।

  • अपेक्षा: आप सोचेंगे, "वे लाल जानते हैं, वे नीला जानते हैं, वे गेंद जानते हैं, वे घन जानते हैं। उन्हें इन्हें मिलाने में सक्षम होना चाहिए!"
  • वास्तविकता: आप उन्हें जितने भी नए संयोजन बनाने के लिए कहेंगे जो उन्होंने पहले नहीं देखे हैं, वे उतने ही खराब होते जाएंगे।
  • कठिनाई का पदानुक्रम: शोधकर्ताओं ने एआई के लिए कठिनाई का एक स्पष्ट क्रम पाया:
    1. रंग (सबसे आसान): "एक लाल गेंद और एक नीला घन" आमतौर पर ठीक रहता है।
    2. गिनती (मध्यम): "तीन लाल गेंदें" कठिन है।
    3. स्थानिक संबंध (सबसे कठिन): "एक नीले घन के नीचे एक लाल गेंद" सबसे कठिन है। एआई अक्सर गेंद को घन के ऊपर या बगल में रख देता है बजाय इसके कि उसे उसके नीचे रखे।

3. "डेटा का आकार" बनाम "डेटा का संतुलन" बहस

उपमा: आपके पास कलाकार को प्रशिक्षित करने के दो तरीके हैं:

  • विधि A (असंतुलित): उन्हें 1,000 "लाल गेंदों" के चित्र दिखाएं लेकिन केवल 10 "नीली गेंदों" के।
  • विधि B (संतुलित): उन्हें 100 "लाल गेंदों" और 100 "नीली गेंदों" के चित्र दिखाएं।

निष्कर्ष: आश्चर्यजनक रूप से, असंतुलित डेटा मुख्य खलनायक नहीं था। भले ही डेटा पूरी तरह से संतुलित था, यदि कुल उदाहरणों की संख्या बहुत कम थी, तो भी एआई जटिल कार्यों जैसे गिनती या स्थानिक संबंधों में विफल रहा।

  • असली अपराधी: दृश्य की जटिलता। दृश्य में आप जितने अधिक ऑब्जेक्ट रखते हैं, एआई के लिए सीखना उतना ही कठिन होता जाता है, चाहे डेटा कैसे भी वितरित हो। यदि आपके पास एक छोटा डेटासेट है, तो दृश्य में अधिक वस्तुएं जोड़ने से एआई की सीखने की क्षमता टूट जाती है।

4. "फाइन-ट्यूनिंग" का जाल

शोधकर्ताओं ने एक पूर्व-प्रशिक्षित, प्रसिद्ध एआई (Stable Diffusion 3) को लेकर उसे इन विशिष्ट कार्यों पर "फाइन-ट्यून" करने का भी परीक्षण किया।

  • परिणाम: जब उन्होंने एआई को बेहतर स्थानिक संबंध (जैसे "नीचे" या "ऊपर") सिखाने की कोशिश की, तो वह बेहतर हुआ। लेकिन जब उन्होंने इसे बेहतर गिनती सिखाने की कोशिश की, तो यह वास्तव में और खराब हो गया। जितना अधिक उन्होंने गिनती का अभ्यास कराया, एआई अलग-अलग वस्तुओं को गिनना उतना ही भूलता गया।

निचोड़

यह शोध पत्र निष्कर्ष निकालता है कि वर्तमान एआई कलाकार इसलिए विफल नहीं हो रहे हैं क्योंकि उन्होंने विशिष्ट रंगों या वस्तुओं के पर्याप्त उदाहरण नहीं देखे हैं। वे इसलिए विफल हो रहे हैं क्योंकि:

  1. गिनती एक नाजुक कौशल है जो छोटे डेटासेट में आसानी से टूट जाता है।
  2. स्थानिक तर्क (चीजें एक-दूसरे के सापेक्ष कहाँ हैं, यह जानना) शून्य से सीखने के लिए सबसे कठिन कौशल है।
  3. नए विचारों को मिलाना (जैसे एक नीले घन के नीचे एक लाल गेंद) के लिए एआई को विचारों को पुनर्संयोजित करने की वास्तविक समझ की आवश्यकता होती है, जिसे वर्तमान मॉडल बिना किसी विशिष्ट संरचनात्मक सहायता (जैसे ग्रिड) के करने में संघर्ष करते हैं।

अनिवार्य रूप से, एआई एक ऐसे छात्र की तरह है जो फ्लैशकार्ड को अच्छी तरह से याद कर सकता है लेकिन उन तथ्यों को एक अव्यवस्थित, जटिल परीक्षा प्रश्न पर लागू करने में संघर्ष करता है, जब तक कि शिक्षक उसे पालन करने के लिए एक बहुत ही विशिष्ट संरचना न दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →