← नवीनतम पेपर
💻 computer science

Diffusion Mental Averages

यह शोध पत्र डिफ्यूजन मेंटल एवरेज (DMA) को प्रस्तुत करता है, जो एक नवीन विधि है जो डिफ्यूजन मॉडल के सिमेंटिक स्पेस के भीतर डिनोइजिंग ट्रैजेक्टरीज को संरेखित करके अवधारणाओं के स्पष्ट और यथार्थवादी प्रोटोटाइप उत्पन्न करती है, जिससे पारंपरिक डेटा-केंद्रित औसत तकनीकों की धुंधलेपन की समस्या को दूर किया जा सके।

मूल लेखक: Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई, अति-बुद्धिमान कलाकार है जिसने दुनिया की अरबों तस्वीरें देखी हैं। यदि आप उससे एक "बिल्ली" (cat) बनाने के लिए कहते हैं, तो वह शायद एक नारंगी रंग की रोएँदार बिल्ली बना सकता है। फिर से पूछें, और वह एक चिकनी काली पैंथर बना सकता है। एक हज़ार बार पूछें, और आपको एक हज़ार अलग-अलग बिल्लियाँ मिलेंगी।

लेकिन यहाँ बड़ा सवाल यह है: क्या उस कलाकार के दिमाग में एक एकल "मानसिक औसत" (mental average) बिल्ली मौजूद है? एक आदर्श, सटीक बिल्ली जो इस बात का प्रतिनिधित्व करती है कि उसके अनुसार एक "सामान्य" बिल्ली कैसी दिखनी चाहिए, भले ही उसने कभी वह सटीक बिल्ली न बनाई हो?

यह शोध पत्र डिफ्यूजन मेंटल एवरेज (Diffusion Mental Averages - DMA) नामक एक नया टूल पेश करता है ताकि इस प्रश्न का उत्तर दिया जा सके। यह कलाकार के मस्तिष्क के भीतर झाँकने और उस एक पूर्ण, औसत छवि को बाहर निकालने जैसा है।

समस्या: हम तस्वीरों को "ब्लर" (धुंधला) क्यों नहीं कर सकते?

आप सोच सकते हैं, "आसान है! बस बिल्लियों की एक हज़ार तस्वीरें लें, उन्हें एक के ऊपर एक रखें, और उन्हें आपस में मिला (blur) दें।"

लेखक कहते हैं कि यह काम नहीं करता। इसका कारण यह है:

  • एलाइनमेंट (Alignment) की समस्या: यदि आप बिल्लियों की 1,000 तस्वीरें एक के ऊपर एक रखते हैं, तो एक बिल्ली बाईं ओर देख रही होगी, दूसरी दाईं ओर, एक की पूंछ ऊपर होगी, दूसरी की नीचे। यदि आप उन्हें केवल ब्लर कर देते हैं, तो आपको एक स्पष्ट बिल्ली नहीं मिलेगी; आपको एक धुंधला, पहचानने योग्य न होने वाला ढेर मिलेगा।
  • "पिक्सेल" का जाल: पारंपरिक तरीके पिक्सेल के रंगों को औसत करने की कोशिश करते हैं। लेकिन चूंकि विवरण (जैसे मूंछें या कान का आकार) हर तस्वीर में थोड़े अलग स्थानों पर होते हैं, वे एक-दूसरे को काट देते हैं, जिससे केवल एक धुंधला धब्बा रह जाता है।

समाधान: "कोरियोग्राफ्ड डांस" (एक व्यवस्थित नृत्य)

तस्वीरों को लेने और फिर उनका औसत निकालने के बजाय, लेखकों की विधि (DMA) बहुत अधिक स्मार्ट काम करती है। यह ड्राइंग की प्रक्रिया को एक कोरियोग्राफ्ड डांस की तरह मानती है।

  1. अराजकता से शुरुआत: कल्पना कीजिए कि 1,000 नर्तक (ये "नॉइज़ लेटेंट्स" हैं) एक धुंधले कमरे में शुरू होते हैं। वे अभी नहीं जानते कि उन्हें कैसा दिखना चाहिए।
  2. डांस फ्लोर (मॉडल): डिफ्यूजन मॉडल कोरियोग्राफर है। वह नर्तकों को कदम उठाने के निर्देश देता है, जिससे धीरे-धीरे धुंध एक स्पष्ट छवि में बदल जाती है।
  3. जादुई ट्रिक: आमतौर पर, प्रत्येक नर्तक स्वतंत्र रूप से चलता है। लेकिन DMA के साथ, कोरियोग्राफर हर एक स्टेप पर उन्हें रोकता है।
    • स्टेप 1 पर, कोरियोग्राफर सभी 1,000 नर्तकों को देखता है, गणना करता है कि उन्हें औसत रूप से कहाँ होना चाहिए, और सभी को उस औसत के अनुरूप ढालने के लिए प्रेरित करता है।
    • स्टेप 2 पर, वे फिर से ऐसा करते हैं।
    • स्टेप 3 पर, फिर से।

जैसे-जैसे वे धीरे-धीरे स्पष्ट होते जाते हैं, उन्हें लगातार "समूह के औसत" के साथ तालमेल बिठाने के लिए प्रेरित करने से, वे सभी एक ही छवि पर आकर मिल जाते हैं।

परिणाम क्या है? एक एकल, स्पष्ट, हाइपर-रियलिस्टिक छवि जो उस अवधारणा के "मानसिक औसत" का प्रतिनिधित्व करती है। यह धुंधला नहीं है क्योंकि मॉडल ने पहले संरचना (बिल्ली का आकार) को समझ लिया और फिर विवरणों (फर/बालों) को पूर्ण सामंजस्य में भरा।

"भ्रमित" अवधारणाओं (मोड्स) को संभालना

कभी-कभी, एक शब्द के कई अर्थ होते हैं। यदि आप "क्रेन" (Crane) मांगते हैं, तो मॉडल एक पक्षी या एक निर्माण मशीन के बारे में सोच सकता है। यदि आप उनका औसत निकालते हैं, तो आपको एक अजीब आधा-पक्षी, आधा-मशीन वाला राक्षस मिलेगा।

लेखकों ने इसे सॉर्टिंग हैट (Sorting Hat) दृष्टिकोण के साथ हल किया है:

  1. पहले छाँटें: डांस से पहले, वे एक स्मार्ट टूल (जैसे CLIP) का उपयोग करते हैं और नर्तकों को देखते हैं और कहते हैं, "आप लोगों का समूह पक्षी है, और आप लोगों का समूह मशीन है।"
  2. अलग-अलग डांस: इसके बाद वे पक्षियों और मशीनों के लिए अलग-अलग "कोरियोग्राफ्ड डांस" चलाते हैं।
  3. परिणाम: आपको एक पूर्ण औसत पक्षी और एक पूर्ण औसत मशीन मिलती है, जो अलग-अलग विचारों को अलग रखती है।

यह क्यों मायने रखता है?

यह केवल शानदार तस्वीरें बनाने के बारे में नहीं है। यह AI पूर्वाग्रह (Bias) के लिए एक दर्पण है

  • पूर्वाग्रह को पहचानना: यदि आप मॉडल से औसत "डॉक्टर" मांगते हैं, और परिणाम हमेशा सफेद कोट पहने एक पुरुष होता है, तो आपने दृश्य रूप से सिद्ध कर दिया है कि मॉडल में लैंगिक पूर्वाग्रह है। यदि आप "फायरफाइटर" पूछते हैं और केवल पुरुष मिलते हैं, तो आप उस पूर्वाग्रह को स्पष्ट रूप से देख सकते हैं।
  • "मस्तिष्क" को समझना: यह शोधकर्ताओं को यह समझने में मदद करता है कि AI वास्तव में किसी अवधारणा को क्या "समझता" है। उदाहरण के लिए, पेपर दिखाता है कि एक ही शब्द के लिए अलग-अलग AI संस्करणों (जैसे "रियलिस्टिक विज़न" बनाम "पिक्सेल आर्ट") के अलग-अलग "मानसिक औसत" होते हैं, जो यह प्रकट करते हैं कि उनके प्रशिक्षण डेटा ने उनके व्यक्तित्व को कैसे आकार दिया।

संक्षेप में

डिफ्यूजन मेंटल एवरेज को एक शब्द की 1,000 अलग-अलग व्याख्याओं की अराजक भीड़ को धीरे-धीरे निर्देशित करने के रूप में समझें, जब तक कि वे सभी एक एकल, पूर्ण परिभाषा पर सहमत न हो जाएं। यह AI की "कल्पना" को एक ठोस, दृश्य सारांश में बदल देता है जिसे हम वास्तव में देख और विश्लेषण कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →