← नवीनतम पेपर
🤖 AI

MIDAS: Mosaic Input-Specific Differentiable Architecture Search

MIDAS एक नवीन डिफरेंशिएबल न्यूरल आर्किटेक्चर सर्च विधि है जो इनपुट-विशिष्ट, पैचवाइज सेल्फ-अटेंशन मैकेनिज्म और एक टोपोलॉजी-जागरूक सर्च स्पेस को पेश करके DARTS फ्रेमवर्क को उन्नत करती है ताकि कई बेंचमार्क में अत्याधुनिक प्रदर्शन और मजबूती प्राप्त की जा सके।

मूल लेखक: Konstanty Subbotko

प्रकाशित 2026-02-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Konstanty Subbotko

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक नए व्यंजन के लिए एकदम सही रेसिपी बनाने की कोशिश कर रहे हैं।

पुराना तरीका (पारंपरिक AI डिज़ाइन):
अतीत में, एक न्यूरल नेटवर्क (AI का "मस्तिष्क") को डिज़ाइन करना एक कठोर, पहले से लिखी गई कुकबुक (पाक-कला की पुस्तक) का पालन करने जैसा था। आपको पहले से ही सामग्री और पकाने के चरणों का अनुमान लगाना पड़ता था। यदि आप सबसे अच्छी रेसिपी खोजना चाहते थे, तो आपको हजारों अलग-अलग कुकबुक्स को मैन्युअल रूप से आज़माना पड़ता था, जिसमें बहुत समय लगता था।

पहली बड़ी छलांग (DARTS):
फिर, शोधकर्ताओं ने DARTS नामक एक विधि का आविष्कार किया। अंदाज़ा लगाने के बजाय, उन्होंने एक "सुपर-रेसिपी" बनाई जिसमें हर संभव सामग्री और पकाने के चरण मिले हुए थे। उन्होंने गणित का उपयोग करके खराब सामग्रियों की आवाज़ को धीरे-धीरे कम किया और अच्छी सामग्रियों की आवाज़ को बढ़ाया। यह एक जादुई मिक्सर की तरह था जो खाना पकाते समय अपने आप रेसिपी को एडजस्ट कर देता था।

हालाँकि, एक समस्या थी: पुराना तरीका पूरे व्यंजन को एक बड़े, एकसमान ढेर (blob) के रूप में देखता था। इसने माना कि टमाटर को पकाने का सबसे अच्छा तरीका वही है चाहे वह सलाद में हो, सूप में हो, या सॉस में। इसने उस भोजन के विशिष्ट विवरणों पर ध्यान नहीं दिया जिसे वह देख रहा था। इस वजह से "सुपर-रेसिपी" अस्थिर हो गई और कभी-कभी गलत सामग्री चुन लेती थी।

नया समाधान: MIDAS (स्मार्ट, अनुकूलनशील शेफ)
यह पेपर MIDAS पेश करता है, जो इन AI दिमागों को डिज़ाइन करने का एक नया तरीका है। MIDAS को एक सुपर-स्मार्ट, अनुकूलनशील शेफ के रूप में सोचें जो केवल एक स्थिर रेसिपी का पालन नहीं करता है, बल्कि ठीक उसी के आधार पर अपना दृष्टिकोण बदलता है जो वह अभी देख रहा है।

यहाँ MIDAS कैसे काम करता है, इसे सरल अवधारणाओं में तोड़कर समझाया गया है:

1. "मोज़ेक" दृष्टिकोण (बड़े चित्र को टुकड़ों में देखना)

कल्पना कीजिए कि आप एक विशाल, जटिल पेंटिंग देख रहे हैं।

  • पुराना तरीका: आप दूर से पूरी पेंटिंग को देखते हैं और कहते हैं, "यह एक नीला आकाश लग रहा है, इसलिए मैं हर जगह नीला रंग इस्तेमाल करूँगा।" यह बहुत धुंधला है; आप विवरणों को मिस कर देते हैं।
  • MIDAS का तरीका: आप पेंटिंग को छोटे टाइल्स के एक मोज़ेक में काट देते हैं। आप प्रत्येक टाइल को व्यक्तिगत रूप से देखते हैं।
    • पक्षी वाले टाइल के लिए, आप तय करते हैं, "मुझे यहाँ तीखे, विस्तृत स्ट्रोक की आवश्यकता है।"
    • आकाश वाले टाइल के लिए, आप तय करते हैं, "मुझे चिकने, कोमल स्ट्रोक की आवश्यकता है।"
    • पेड़ वाले टाइल के लिए, आप तय करते, "मुझे खुरदरे, बनावट वाले स्ट्रोक की आवश्यकता है।"

MIDAS डेटा के साथ ऐसा ही करता है। पूरी इमेज के लिए एक वैश्विक निर्णय लेने के बजाय, यह इमेज को छोटे पैच (patches) में तोड़ देता है और प्रत्येक पैच के लिए सबसे अच्छा "आर्किटेक्चर" (AI की संरचना) अलग से तय करता है। यह इसे बहुत सटीक और मजबूत बनाता है।

2. "सेल्फ-अटेंशन" तंत्र (शेफ की अंतर्दृष्टि)

शेफ को कैसे पता चलता है कि किस टाइल के लिए कौन सा स्ट्रोक उपयोग करना है?

  • पुराना तरीका: शेफ के पास एक निश्चित नियम पुस्तिका थी: "यदि यह एक पक्षी है, तो हमेशा स्ट्रोक A का उपयोग करें।"
  • MIDAS का तरीका: शेफ सेल्फ-अटेंशन का उपयोग करता है। यह शेफ की अंतर्दृष्टि की तरह है। स्ट्रोक लगाने से पहले, शेफ उस विशिष्ट टाइल को देखता है और पूछता है, "इस विशिष्ट भाग को अभी किस चीज़ की आवश्यकता है?"
    • यह उत्तर को गतिशील रूप से (dynamically) कैलकुलेट करता है। यदि इनपुट बदलता है (जैसे, तूफान में उड़ता हुआ पक्षी बनाम बैठा हुआ पक्षी), तो शेफ तुरंत उस विशिष्ट स्थान के लिए रेसिपी बदल देता है।

यह AI को एक कठोर मशीन से बदलकर एक लचीली मशीन में बदल देता है जो उसके द्वारा देखे जाने वाले हर इनपुट के अनुकूल हो जाता है।

3. "टोपोलॉजी" ट्रिक (सबसे अच्छी टीम चुनना)

इन AI डिज़ाइनों में, आपको हर चरण के लिए दो "आने वाले पथों" (सामग्रियों) को चुनना होता है।

  • पुरानी समस्या: पुराने तरीकों ने दो सामग्रियों को अलग-अलग चुनने की कोशिश की, जिससे कभी-कभी एक बेमेल टीम बन जाती थी (जैसे कार ठीक करने के लिए हथौड़ा और चम्मच चुनना)।
  • MIDAS का समाधान: MIDAS सामग्रियों के जोड़ों (pairs) को एक साथ देखता है। यह पूछता है, "कौन सा जोड़ा इस विशिष्ट पैच के लिए सबसे अच्छा काम करता है?" इसे यह करने के लिए अतिरिक्त नियमों की आवश्यकता नहीं है; यह अपने अटेंशन मैकेनिज्म के माध्यम से स्वाभाविक रूप से सबसे अच्छा संयोजन खोज लेता है।

यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने कई मानक "कुकिंग प्रतियोगिताओं" (CIFAR-10 और ImageNet जैसे डेटासेट) पर MIDAS का परीक्षण किया।

  • परिणाम: इसने लगभग किसी भी अन्य से बेहतर रेसिपी खोजी। इसने सरल छवियों (CIFAR-10) को पहचानने में 97.4% सटीकता प्राप्त की और यहाँ तक कि एक नियंत्रित परीक्षण में "परफेक्ट" रेसिपी भी खोजी जहाँ उत्तर पहले से ज्ञात था।
  • दक्षता (Efficiency): इसके लिए चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं थी; यह पुराने तरीके की तुलना में केवल थोड़ा अधिक महंगा था लेकिन इसने बहुत बेहतर परिणाम दिए।

निचोड़ (The Bottom Line)

MIDAS एक कठोर, पहले से छपी हुई कुकबुक से एक स्मार्ट, सहज शेफ में अपग्रेड करने जैसा है जो:

  1. भोजन को बारीक विवरणों के साथ देखता है (मोज़ेक)।
  2. जो वह देखता है उसके आधार पर चलते-चलते रेसिपी को अनुकूलित करता है (इनपुट-विशिष्ट)।
  3. सामग्रियों की सबसे अच्छी टीम चुनता है जो एक साथ अच्छी तरह काम करती है (टोपोलॉजी-अवेयर)।

ऐसा करके, यह ऐसे AI दिमाग बनाता है जो अधिक सटीक, अधिक स्थिर और दुनिया को, एक बार में एक छोटे टुकड़े के रूप में, बेहतर समझने में सक्षम होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →