← नवीनतम पेपर
💻 computer science

Slimmable ConvNeXt: Width-Adaptive Inference for Efficient Multi-Device Deployment

यह शोध पत्र Slimmable ConvNeXt को प्रस्तुत करता है, जो एक विड्थ-एडेप्टिव (width-adaptive) इन्फरेंस फ्रेमवर्क है जो ConvNeX के आधुनिक डिज़ाइन का लाभ उठाकर एक ही साझा वेट सेट (shared weight set) के साथ कुशल मल्टी-डिवाइस परिनियोजन को सक्षम बनाता है, और जटिल नॉर्मलाइजेशन तंत्र की आवश्यकता के बिना मौजूदा CNN और विजन ट्रांसफार्मर दृष्टिकोणों की तुलना में विभिन्न कम्प्यूटेशनल बाधाओं में बेहतर सटीकता प्राप्त करता है।

मूल लेखक: Janek Haberer, Jon Eike Wilhelm, Olaf Landsiedel

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Janek Haberer, Jon Eike Wilhelm, Olaf Landsiedel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास शेफ की एक टीम है (एक कंप्यूटर विज़न मॉडल) जिन्हें भीड़ के लिए भोजन पकाने की आवश्यकता है। कभी-कभी, रसोई बहुत बड़ी होती है जिसमें पूरा स्टाफ और शानदार उपकरण होते हैं (एक शक्तिशाली क्लाउड सर्वर)। अन्य समय में, आप एक छोटे से कैंपर वैन में खाना बना रहे होते हैं जिसमें केवल एक बर्नर और सामग्री की सीमित आपूर्ति होती है (एक मोबाइल फोन जिसमें बैटरी कम है)।

पारंपरिक रूप से, यदि आप चाहते थे कि आपके शेफ दोनों सेटिंग्स में काम करें, तो आपको दो पूरी तरह से अलग टीमें रखनी पड़ती: एक बड़ी रसोई के लिए एक बड़ी टीम और कैंपर वैन के लिए एक छोटी, विशिष्ट टीम। आपको उन्हें अलग-अलग प्रशिक्षित करना पड़ता, उनकी रेसिपी अलग-अलग स्टोर करनी पड़ती, और यह देखना पड़ता कि आप कहाँ हैं। यह महंगा और अव्यवस्थित है।

पुराने "लचीले" शेफ की समस्या
कुछ शोधकर्ताओं ने एक "सुपर-शेफ" बनाने की कोशिश की जो जरूरत पड़ने पर सिकुड़ या बढ़ सके। उन्होंने एक एकल टीम बनाई जो 100 शेफ, 50 शेफ, या 10 शेफ के साथ काम कर सकती थी। हालांकि, इन पुराने तरीकों में एक बड़ी खामी थी: उन्हें हर संभावित टीम के आकार के लिए सांख्यिकी (statistics) को ट्रैक रखने के लिए एक जटिल "स्विचबोर्ड" (जिसे स्विच करने योग्य बैच नॉर्मलाइजेशन कहा जाता है) की आवश्यकता होती थी। यह ऐसा था जैसे हर सामग्री के आकार के लिए अलग-अलग मापने वाले कपों की आवश्यकता हो, जिससे रसोई अराजक और कठिन हो जाती थी।

नया समाधान: Slimmable ConvNeXt
यह पेपर एक नए प्रकार की शेफ टीम पेश करता है जिसे Slimmable ConvNeXt कहा जाता है। लेखकों ने पाया कि ConvNexT आर्किटेक्चर का आधुनिक डिज़ाइन स्वाभाविक रूप से बिना किसी जटिल स्विचबोर्ड के सिकुड़ने और बढ़ने के लिए एकदम सही है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "LayerNorm" का जादू (बिना स्विचबोर्ड के)

पुराने लचीले मॉडलों को विभिन्न टीम आकारों को संभालने के लिए विशेष नियमों की आवश्यकता थी। Slimmable ConvNeXT LayerNorm नामक तकनीक का उपयोग करता है।

  • उपमा: एक पारंपरिक टीम की कल्पना करें जहाँ मैनेजर को निर्देश देने के लिए यह जानना आवश्यक है कि कमरे में कितने लोग हैं। यदि कमरे का आकार बदलता है, तो मैनेजर घबरा जाता है और उसे एक नया नियम पुस्तिका की आवश्यकता होती है।
  • नया तरीका: LayerNorm एक ऐसे मैनेजर की तरह है जो इस आधार पर निर्देश देता है कि प्रत्येक व्यक्ति अभी क्या कर रहा है, चाहे कमरे में कितने भी लोग हों। चाहे आपके पास 100 शेफ हों या 10, मैनेजर तुरंत अनुकूलित हो जाता है। इसका मतलब है कि आपको अब उस जटिल "स्कीचबोर्ड" की आवश्यकता नहीं है। प्रशिक्षण प्रक्रिया बहुत सरल और स्वच्छ हो जाती है।

2. "Inverted Bottleneck" (आसानी से स्लाइस करना)

ConvNeXt एक "इनवर्टेड बॉटलनेक" नामक संरचना का उपयोग करता है।

  • उपमा: एक मानक सैंडविच के बारे में सोचें: ब्रेड (छोटी), मीट (बड़ी), ब्रेड (छोटी)। यदि आप एक छोटा सैंडविच बनाना चाहते हैं, तो आपको ब्रेड और मीट को काटना होगा, जो कठिन है।
  • नया तरीका: इनवर्टेड बॉटलनेक एक ऐसे सैंडविच की तरह है जहाँ फिलिंग (भरवां सामग्री) बहुत बड़ी है, लेकिन ब्रेड पतली है। "मीट" (भारी गणना) बीच में केंद्रित है। जब आप मॉडल को छोटा करना चाहते हैं, तो आप बस बाहरी किनारों को काट देते हैं। पूरे ढांचे को खराब किए बिना बीच से एक स्लाइस काटना बहुत आसान है। यह डेटा की चौड़ाई (चैनलों) को "स्लाइस" करके मॉडल के छोटे संस्करण बनाना आसान बनाता है।

3. यह व्यवहार में कैसे काम करता है

शोधकर्ताओं ने एक ही मॉडल को प्रशिक्षित किया जिसमें इसके कई "नेस्टेड" (एक के भीतर एक) संस्करण शामिल हैं।

  • प्रशिक्षण: कल्पना करें कि शेफ हर दिन अभ्यास कर रहे हैं। कुछ दिन वे पूरी टीम के 100 सदस्यों के साथ अभ्यास करते हैं। अन्य दिनों में, वे केवल 50 के साथ अभ्यास करते हैं, और अन्य दिनों में केवल 25 के साथ। वे सभी एक ही ज्ञान आधार (weights) साझा करते हैं। क्योंकि वे इन सभी अलग-अलग आकारों में अभ्यास करते हैं, वे किसी भी आकार में कुशल होने के लिए सीखते हैं।
  • परिणाम: जब आप मॉडल को तैनात (deploy) करते हैं, तो आपको एक नई फ़ाइल लोड करने की आवश्यकता नहीं होती है। आप बस मॉडल को बताते हैं, "हे, आज हमारे पास केवल 25 शेफ के लिए बैटरी है," और यह तुरंत अपने 25-शेफ मोड में स्विच हो जाता है। यदि कल आपके पास पूर्ण शक्ति का स्रोत है, तो यह वापस 100-शेफ मोड में स्विच हो जाता है।

परिणाम: बेहतर प्रदर्शन, कम गणित

शोधकर्ताओं ने एक विशाल डेटासेट जिसे ImageNet-1k (1.28 मिलियन छवियों का पुस्तकालय) कहा जाता है, पर इसका परीक्षण किया। उन्होंने अपने नए "Slimmable ConvNeXT" की तुलना सबसे अच्छे मौजूदा लचीले मॉडलों (जो मुख्य रूप से विजन ट्रांसफॉर्मर, एक अलग प्रकार का AI आर्किटेक्चर, पर आधारित थे) से की।

  • विजेता: Slimmable ConvNeXT तेज़ और अधिक सटीक था।
    • एक मध्यम कंप्यूटिंग स्तर पर, इसने 80.8% सटीकता प्राप्त की। अगले सबसे अच्छे प्रतिस्पर्धी ने 78.4% स्कोर किया।
    • एक बहुत ही निम्न कंप्यूटिंग स्तर पर (जैसे एक कमजोर फोन), इसने 77.4% स्कोर किया, जबकि प्रतिस्पर्धी ने 73.0% स्कोर किया।
  • पैमाना: उन्होंने अपने मॉडल के छोटे, मध्यम और बड़े संस्करणों का परीक्षण किया। बड़े संस्करण बिना बहुत अधिक सटीकता खोए और भी बेहतर प्रदर्शन करते थे। उदाहरण के लिए, सबसे बड़ा संस्करण पूर्ण शक्ति पर 82.8% सटीकता के साथ चल सकता था, और आधे आकार में सिकुड़ने पर भी, यह अविश्वसनीय रूप से मजबूत बना रहा।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि यह इस विशिष्ट "स्लाइसिंग" तकनीक को ConvNext पर लागू करने का पहला मामला है।

  • सरलता: यह पुराने तरीकों के लिए आवश्यक जटिल नॉर्मलाइजेशन स्विचों को हटा देता है।
  • दक्षता: क्योंकि यह "सेल्फ-अटेंशन" (एक भारी प्रक्रिया जिसका उपयोग ट्रांसफॉर्मर मॉडल द्वारा किया जाता है) का उपयोग नहीं करता है, इसलिए इसे समान परिणाम प्राप्त करने के लिए कम गणितीय संचालन (GMACs) की आवश्यकता होती है।
  • बहुमुखी प्रतिभा: यह एक एकल मॉडल को एक विशाल सर्वर, लैपटॉप या मोबाइल फोन पर चलाने की अनुमति देता है, जिसके लिए कई अलग-अलग फ़ाइलों को स्टोर करने की आवश्यकता नहीं होती है।

संक्षेप में, लेखकों ने AI मॉडलों का एक "स्विस आर्मी नाइफ" बनाया है। चाकू, पेचकश और कॉर्कस्क्रू को अलग-अलग ले जाने के बजाय, आपके पास एक ही उपकरण है जो तुरंत किसी भी रूप में बदल सकता है, और यह पिछले पीढ़ी के मल्टी-टूल्स की तुलना में बेहतर और अधिक कुशलता से काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →