← नवीनतम पेपर
💻 computer science

Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing

यह शोध पत्र ParaX को प्रस्तुत करता है, जो विज़न मॉडल्स के लिए एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो साझा विशेषज्ञ केंद्रों (shared expert centers) से इनपुट-निर्भर लो-रैंक वेट मैट्रिसेस उत्पन्न करने के लिए एक गतिशील पैरामीटर रूटिंग तंत्र का उपयोग करता है, जिससे जटिल डेंस प्रेडिक्शन कार्यों में फीचर विविधता और प्रदर्शन में वृद्धि होती है।

मूल लेखक: Meng Lou, Stanley Yu, Yizhou Yu

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Meng Lou, Stanley Yu, Yizhou Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किताबों का एक विशाल, अत्यधिक कुशल पुस्तकालय (एक प्री-ट्रेन्ड AI मॉडल) है जो दुनिया के बारे में बहुत कुछ जानता है। आप इस पुस्तकालय को एक नया, विशिष्ट कौशल सिखाना चाहते हैं, जैसे पक्षियों के विभिन्न प्रकारों को पहचानना या एक अस्त-व्यस्त कमरे में वस्तुओं को खोजना।

पारंपरिक रूप से, इसे करने के दो तरीके हैं:

  1. फुल फाइन-ट्यूनिंग (Full Fine-Tuning): आप पूरे पुस्तकालय को फिर से लिखते हैं। यह बहुत अच्छा काम करता है, लेकिन यह महंगा और धीमा है, और हर नए कौशल को सीखने के लिए आपको पुस्तकालय का एक विशाल नया संस्करण बनाना पड़ता है।
  2. पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग (PEFT): आप पुस्तकालय को केवल कुछ स्टिकी नोट्स या छोटे बुकमार्क का उपयोग करके सिखाने की कोशिश करते हैं। यह सस्ता और तेज़ है, लेकिन अक्सर पुस्तकालय नया कौशल अच्छी तरह से नहीं सीख पाता क्योंकि "बुकमार्क" बहुत सरल होते हैं।

यह पेपर एक नई विधि पेश करता है जिसे ParaX कहा जाता है, जो इन दोनों के बीच का सर्वश्रेष्ठ विकल्प देने की कोशिश करती है: स्टिकी नोट्स की कम लागत और पूरे पुस्तकालय को फिर से लिखने जैसा उच्च प्रदर्शन।

वर्तमान "स्टिकी नोट्स" की समस्या

लेखकों का तर्क है कि वर्तमान विधियों (जैसे LoRA या AdaptFormer) में दो खामियां हैं:

  1. वे "एक ही आकार के सभी के लिए" (One-Size-Fits-All) हैं: कल्पना कीजिए कि एक शिक्षक एक नौसिखिए, एक विशेषज्ञ और एक बच्चे को बिल्कुल एक ही व्याख्यान दे रहा है। वर्तमान विधियाँ हर तस्वीर के लिए, चाहे उसमें कुछ भी हो, एक ही समान "नियमों" का उपयोग करती हैं। वे इनपुट के विशिष्ट विवरणों के अनुसार खुद को ढाल नहीं पातीं।
  2. वे "अलग-थलग" (Isolated) हैं: यदि आपके पास श्रमिकों की एक टीम (AI के लेयर्स) है, तो वर्तमान विधियाँ प्रत्येक श्रमिक को एक अलग दायरे में सीखने के लिए मजबूर करती हैं। वे एक-दूसरे से बात नहीं करते हैं। इसके कारण सभी एक ही चीज़ करने लगते हैं (अतिरेक/redundancy) बजाय इसके कि वे एक जटिल समस्या को हल करने के लिए सहयोग करें।

ParaX समाधान: "शेयर्ड एक्सपर्ट सेंटर" (Shared Expert Center)

ParaX गेम को बदल देता है क्योंकि यह AI के सीखने के उपकरणों के साथ एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) की तरह व्यवहार करता है।

उपमा: मास्टर टूल शेड (The Master Tool Shed)
कल्पना कीजिए कि AI के पास एक विशाल साझा टूल शेड (एक्सपर्ट सेंटर) है जो हजारों विशिष्ट उपकरणों (ट्रेनेबल पैरामीटर मैट्रिसेस) से भरा है।

  • पुरानी विधि: फैक्ट्री के हर कर्मचारी के पास अपना एक छोटा, निश्चित टूलबॉक्स होता है। वे काम के आधार पर अपने उपकरण नहीं बदल सकते।
  • ParaX विधि: प्रत्येक कर्मचारी के पास एक स्मार्ट राउटर होता है। जब कोई नया कार्य आता है (एक इमेज आती है), तो स्मार्ट राउटर उस इमेज को देखता है और कहता है, "ओह, यह एक कठिन दृश्य है जिसमें बहुत से छोटे विवरण हैं। मुझे मास्टर शेड से टूल नंबर 4 और टूल नंबर 12 उठाने और इस विशेष क्षण के लिए एक कस्टम रेंच बनाने की आवश्यकता है।"

यह कैसे काम करता है (जादुई चरण)

  1. डायनेमिक रूटिंग (Dynamic Routing): स्थिर नियमों के सेट के बजाय, ParaX विशिष्ट इमेज को देखता है और गतिशील रूप से तय करता है कि उसे साझा टूल शेड से किन "उपकरणों" (पैरामीटर मैट्रिसेस) का उपयोग करना चाहिए। यह एक शेफ की तरह है जो सूप चखता है और तुरंत तय करता है कि कौन से विशिष्ट मसाले डालने हैं, बजाय इसके कि वह एक कठोर रेसिपी का पालन करे।
  2. साझा ज्ञान (Shared Knowledge): चूंकि सभी कार्यकर्ता (नेटवर्क के लेयर्स) एक ही मास्टर टूल शेड से जानकारी लेते हैं, इसलिए वे स्वाभाविक रूप से एक-दूसरे से सीखना शुरू कर देते हैं। यदि एक लेयर किसी विशिष्ट प्रकार के किनारे (edge) के लिए एक बेहतरीन टूल संयोजन का पता लगा लेती है, तो वह ज्ञान पूरी टीम के लिए उपलब्ध होता है। यह अतिरेक को कम करता है और AI को जटिल दृश्यों को देखने में स्मार्ट बनाता है।
  3. मल्टी-स्केल मिक्सिंग (Multi-Scale Mixing): ParaX एक ऐसी सुविधा भी जोड़ता है जो इसे अलग-अलग "ज़ूम स्तरों" (जैसे पेड़ के आकार को देखने के लिए दूर से देखना और पत्तियों को देखने के लिए करीब से देखना) पर एक साथ देखने की अनुमति देती है, जो चित्र में वस्तुओं को खोजने जैसे कार्यों के लिए महत्वपूर्ण है।

परिणाम: यह क्यों मायने रखता है

लेखकों ने कठिन कार्यों पर ParaX का परीक्षण किया जैसे:

  • सिमेंटिक सेगमेंटेशन (Semantic Segmentation): इमेज के हर पिक्सेल को रंगना ताकि यह बताया जा सके कि वह क्या है (जैसे, "आकाश," "कार," "व्यक्ति")।
  • ऑब्जेक्ट डिटेक्शन (Object Detection): चित्र में वस्तुओं को ढूंढना और उन्हें बॉक्स में बंद करना।
  • पैनोप्टिक सेगमेंटेशन (Panoptic Segmentation): उपरोक्त दोनों का एक अत्यंत कठिन मिश्रण।

दावा:
ParaX ने पिछले सर्वश्रेष्ठ "स्टिकी नोट" तरीकों से बेहतर परिणाम प्राप्त किए, और कुछ मामलों में, इसने महंगे "पूरे पुस्तकालय को फिर से लिखने वाले" तरीके को भी पछाड़ दिया, जबकि इसने 4% से भी कम ट्रेनेबल पैरामीटर्स का उपयोग किया।

सरल शब्दों में: ParaX ने AI को एक मास्टर शेफ बनने के रूप में सिखाया जो व्यंजनों के एक छोटे, साझा सेट और एक स्मार्ट योजना का उपयोग करके एक शानदार भोजन बना सकता है, जबकि अन्य विधियाँ प्री-पैकेज्ड भोजन का उपयोग करने में फंसी हुई थीं जो ठीक तो थे लेकिन बहुत अच्छे नहीं थे।

सारांश

ParaX AI मॉडल को नए कौशल सिखाने का एक नया तरीका है। AI को स्थिर, एक ही आकार के निर्देशों के बजाय, यह एक गतिशील, साझा टूलबॉक्स देता है जिसे वह हर उस इमेज के लिए तुरंत कस्टमाइज़ कर सकता है जिसे वह देखता है। यह AI को जटिल दृश्यों को समझने में बहुत बेहतर बनाता है बिना इसे शुरू से फिर से प्रशिक्षित किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →