← नवीनतम पेपर
💻 computer science

DEGMC: Denoising Diffusion Models Based on Riemannian Equivariant Group Morphological Convolutions

यह शोध पत्र DEGMC का प्रस्ताव करता है, जो एक नवीन डिनोइजिंग डिफ्यूजन मॉडल है जो हैमिल्टन-जेकोबी आंशिक अवकल समीकरणों से व्युत्पन्न रिमानियन ग्रुप मॉर्फोलॉजिकल कन्वोल्यूशन को शामिल करके ज्यामितीय विशेषता निष्कर्षण और नेटवर्क इक्विवेरिएंस (समरूपता) को बढ़ाता है।

मूल लेखक: El Hadji S. Diop, Thierno Fall, Mohamed Daoudi

प्रकाशित 2026-02-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: El Hadji S. Diop, Thierno Fall, Mohamed Daoudi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को बिल्ली का एक सटीक रेखाचित्र (sketch) बनाना सिखाने की कोशिश कर रहे हैं।

वर्तमान में, अधिकांश AI मॉडल (जैसे कि वे जो इमेज जेनरेट करने के लिए उपयोग किए जाते हैं) एक प्रक्रिया के माध्यम से सीखते हैं जिसे "डिफ्यूजन" (Diffusion) कहा जाता है। इसे ऐसे समझें जैसे आप एक सुंदर चित्र ले रहे हैं और उस पर धीरे-धीरे रेत छिड़क रहे हैं जब तक कि वह चित्र पूरी तरह से ढक न जाए और आपको रेत के ढेर के अलावा कुछ भी दिखाई न दे। AI का काम इस "रेत हटाने" (un-sanding) की प्रक्रिया को सीखना है—यानी रेत के ढेर को देखकर यह समझना कि बिल्ली को प्रकट करने के लिए रेत को ठीक से कैसे हटाया जाए।

हालाँकि, यह शोध पत्र पहचानता है कि वर्तमान "रेत हटाने वाले" रोबोटों के साथ दो बड़ी समस्याएँ हैं।

दो समस्याएँ

  1. "ओरिएंटेशन" की समस्या (Equivariance की कमी):
    कल्पना कीजिए कि आपने अपने रोबोट को बिल्ली को केवल तभी पहचानना सिखाया जब वह सीधी बैठी हो। यदि बिल्ली अपनी बगल में लेटी हुई है या उलटी है, तो रोबोट भ्रमित हो जाता है और उसे लगता है कि वह बिल्ली के बजाय रेत के ढेर को देख रहा है। अधिकांश वर्तमान AI मॉडल "ट्रांसलेशन इक्विवेरिएंट" (translation equivariant) होते हैं, जिसका अर्थ है कि वे चीजों को पहचानने में अच्छे हैं यदि वे ऊपर, नीचे, बाएं या दाएं चलती हैं, लेकिन वे संघर्ष करते हैं यदि वस्तु घूम जाती है या पलट जाती है।

  2. "बारीक विवरण" की समस्या (ज्यामितीय निष्कर्षण/Geometric Extraction):
    जब AI रेत हटा रहा होता है, तो वह अक्सर सूक्ष्म, नाजुक हिस्सों के साथ संघर्ष करता है—जैसे कि एक अकेली मूंछ या कान का तीखा किनारा। वह बारीक विवरणों को "धुंधला" (smudge) कर देता है क्योंकि वह वास्तव में उस चीज़ की ज्यामिति (आकार और संरचना) को नहीं समझता जिसे वह देख रहा है।


समाधान: DEGMC (एक "स्मार्ट ब्रश" दृष्टिकोण)

शोधकर्ताओं ने एक नया तरीका बनाया जिसे DEGMC कहा जाता है। रोबोट को एक मानक, कुंद ब्रश देने के बजाय, उन्होंने उसे एक "स्मार्ट ज्योमेट्रिक ब्रश" दिया जो आकारों और समरूपताओं (symmetries) को समझता है।

यहाँ उनका "स्मार्ट ब्रश" कैसे काम करता है, इसके लिए तीन विशेष उपकरणों का उपयोग किया गया है:

1. "कन्वेक्शन" टूल (नेविगेटर)

केवल बेतरतीब ढंग से ब्रश करने के बजाय, यह टूल AI को यह समझने में मदद करता है कि चीजें कहाँ घूम रही हैं। यह ब्रश के लिए एक GPS की तरह कार्य करता है, जिससे यह छवि के प्राकृतिक घुमावों और प्रवाह का अनुसरण कर सकता है। यदि मूंछ मुड़ी हुई है, तो ब्रश उस वक्र (curve) का अनुसरण करेगा, न कि उसके बीच से सीधा जाने की कोशिश करेगा।

2. "डाइलेशन और इरोशन" टूल्स (मूर्तिकार)

गणित की दुनिया में, "डाइलेशन" (dilation) किसी आकार को थोड़ा और भरा हुआ बनाने के लिए उसमें थोड़ी मिट्टी जोड़ने जैसा है, और "इरोशन" (erosion) किसी चीज़ को अधिक तीक्ष्ण बनाने के लिए उसे तराशने जैसा है।

  • उपमा: कल्पना कीजिए कि आप रेत से एक मूर्ति गढ़ रहे हैं। AI इन उपकरणों का उपयोग महत्वपूर्ण विशेषताओं (जैसे आँखें) को "फैलाने" और किनारों (जैसे कान) को "तेज़" करने के लिए करता है। क्योंकि ये उपकरण "इक्विवेरिएंट" (Equivariant) हैं, रोबोट जानता है कि "तेज़ करने" की क्रिया बिल्कुल उसी तरह काम करती है चाहे बिल्ली सीधी हो, बगल में हो या उलटी हो।

3. "हाइपरबोलिक" प्लेग्राउंड (एक घुमावदार मानचित्र)

शोधकर्ताओं ने AI को केवल एक सपाट मेज पर नहीं सिखाया। उन्होंने इसे एक "हाइपरबोलिक मैनिफोल्ड" (Hyperbolic Manifold) पर सिखाया—जिसे आप एक घुमावदार, अनंत सैडल के आकार की सतह के रूप में कल्पना कर सकते हैं।

  • उपमा: एक सपाट मानचित्र पर, दूरियाँ विकृत हो सकती हैं। लेकिन इस विशेष घुमावदार सतह पर, AI जानकारी को अधिक कुशलता से "मोड़" (fold) सकता है। यह AI को एक 2D समस्या को हल करने के लिए 3D मस्तिष्क देने जैसा है, जिससे वह किसी छवि के हिस्सों के बीच के संबंधों को बहुत अधिक स्पष्टता से देख सकता है।

परिणाम: एक बेहतर कलाकार

जब शोधकर्ताओं ने इस "स्मार्ट ब्रश" (DEGMC मॉडल) का परीक्षण पुराने तरीके (मानक DDPM मॉडल) के विरुद्ध किया, तो उन्होंने तीन बड़ी जीत देखीं:

  • यह तेज़ है: AI को अच्छा होने के लिए बहुत अधिक अभ्यास की आवश्यकता नहीं है। यह प्रशिक्षण के बहुत शुरुआती चरण में ही इसे "समझ" लेता है।
  • यह रोटेशन (घूर्णन) के मामले में स्मार्ट है: जब उन्होंने टेस्ट इमेज को घुमाया (RotoMNIST टेस्ट), तो पुराना AI भ्रमित हो गया और धुंधली आकृतियाँ बनाने लगा। नया DEGMC मॉडल प्रभावित नहीं हुआ—उसने बिल्ली को हर कोण से स्पष्ट रूप से देखा।
  • यह अधिक स्पष्ट (Sharp) है: इसके द्वारा बनाई गई छवियां (यहाँ तक कि CIFAR-10 जैसी जटिल रंगीन छवियां भी) बेहतर विवरण और अधिक विविधता वाली थीं।

संक्षेप में: यह पेपर AI को एक "अंधे ब्रश" से, जो केवल शोर को पोंछ देता है, एक "कुशल मूर्तिकार" में बदल देता है जो दुनिया की ज्यामिति, समरूपता और नाजुक संरचना को समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →