← नवीनतम पेपर
🤖 machine learning

Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

यह शोध पत्र CoMET को प्रस्तुत करता है, जो एक ज़ीरो-शॉट मल्टीमॉडल वर्गीकरण ढांचा (framework) है जो PCA संपीड़न और एक हल्के टोकन पूलिंग तंत्र के माध्यम से फ्रोजन प्री-ट्रेंड मोडैलिटी एनकोडर को एक टैबुलर फाउंडेशन मॉडल के साथ संयोजित करके अत्याधुनिक परिणाम प्राप्त करता है, जिससे फाइन-ट्यूनिंग की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Herman Bergström, Aditya Mehrotra, Rahul G. Krishnan

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Herman Bergström, Aditya Mehrotra, Rahul G. Krishnan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास विशेषज्ञों की एक टीम है, जिनमें से प्रत्येक अपने विशिष्ट क्षेत्र का माहिर है। आपके पास एक विज़न एक्सपर्ट (दृष्टि विशेषज्ञ) है जो किसी भी तस्वीर का सटीक वर्णन कर सकता है, एक रीडिंग एक्सपर्ट (पठन विशेषज्ञ) है जो किसी भी किताब का सारांश लिख सकता है, और एक डेटा एनालिस्ट (डेटा विश्लेषक) है जो स्प्रेडशीट्स में पैटर्न पहचानने में बेहद कुशल है।

आमतौर पर, इन विशेषज्ञों को एक नई समस्या पर मिलकर काम करने के लिए तैयार करने हेतु, आपको उन्हें एक-दूसरे की शब्दावली और सहयोग करने के तरीके समझाने के लिए महीनों का समय खर्च करना पड़ता। यह AI में "फाइन-ट्यूनिंग" (fine-tuning) की तरह है: जो धीमा, महंगा और जटिल है।

यह पेपर CoMET पेश करता है, एक ऐसा तरीका जो इन विशेषज्ञों को बिना किसी प्रशिक्षण के तुरंत एक साथ काम करने की अनुमति देता है। यह बिल्कुल वैसा ही है जैसे उन्हें एक साधारण अनुवादक (translator) और एक व्हाइटबोर्ड थमा दिया जाए, और उनसे कहा जाए, "जाओ और इसे हल करो।"

CoMET कैसे काम करता है, यहाँ इसके सरल चरणों में विवरण दिया गया है:

1. "फ्रोजन" विशेषज्ञ (द बैकबोन्स)

सबसे पहले, CoMET पहले से प्रशिक्षित मॉडलों (विशेषज्ञों) को लेता है जिन्होंने पहले से ही छवियों को देखना या टेक्स्ट को पढ़ना सीख लिया है। ये मॉडल "फ्रोजन" (frozen) हैं, जिसका अर्थ है कि हम उनके दिमाग में कोई बदलाव नहीं करते हैं। हम बस उन्हें डेटा देखने के लिए कहते हैं और हमें उसका सारांश देते हैं।

  • समस्या: कभी-कभी, उनके द्वारा दिया गया सारांश बहुत लंबा या अव्यवस्थित होता है। यह वैसा ही है जैसे विज़न एक्सपर्ट को एक 10 पन्नों का निबंध लिखने के लिए कहना जब आपको केवल एक वाक्य के विवरण की आवश्यकता थी।
  • समाधान (PCA): यह पेपर PCA (प्रिंसिपल कंपोनेंट एनालिसिस) नामक एक सरल गणितीय ट्रिक का उपयोग करता है। इसे एक "समराइजर" (सारांशकार) के रूप में सोचें जो उस 10 पन्नों के निबंध को एक संक्षिप्त, 256-शब्दों की बुलेट-पॉइंट सूची में सिकोड़ देता है। आश्चर्यजनक रूप से, लेखकों ने पाया कि केवल इस संपीड़न (compression) को करने से विशेषज्ञ बिना कुछ नया सिखाए भी एक साथ बहुत बेहतर काम करते हैं।

2. "टेबुलर" मस्तिष्क (TFM)

एक बार जब विशेषज्ञ अपने संपीड़ित सारांश दे देते हैं, तो CoMET इस जानकारी को एक टेबुलर फाउंडेशन मॉडल (TFM) को भेज देता है।

  • TFM क्या है? एक सुपर-इंटेलिजेंट जासूस की कल्पना करें जिसे लाखों अलग-अलग मामलों (डेटासेट्स) पर प्रशिक्षित किया गया है, जिनमें डेटा की पंक्तियाँ और कॉलम शामिल हैं। यह जासूस इतना कुशल है कि यदि आप उसे कुछ उदाहरणों के साथ एक नया मामला दिखाते हैं, तो वह बिना किसी पूर्व अध्ययन के तुरंत उसे हल कर सकता है।
  • जादू: CoMET इन संपीड़ित इमेज और टेक्स्ट सारांशों को इस जासूस के पास इस तरह भेजता है जैसे वे स्प्रेडशीट में बस एक और कॉलम हों। जासूस फिर अंतिम भविष्यवाणी करता है (जैसे, "यह एक कुत्ता है" या "यह ईमेल विषाक्त है")।

3. "स्मार्ट हाइलाइटर" (PALPooling)

कभी-कभी, विशेषज्ञ ऐसा सारांश देते हैं जो मुख्य बात को छोड़ देता है। उदाहरण के लिए, यदि आप पार्क में कुत्ते की तस्वीर दिखाते हैं, तो विज़न एक्सपर्ट कुत्ते के बजाय घास और पेड़ों पर ध्यान केंद्रित कर सकता है।

  • पुराना तरीका: इसे ठीक करने के लिए, आपको आमतौर पर विशेषज्ञ को कुत्ते पर ध्यान केंद्रित करने के लिए फिर से प्रशिक्षित करना पड़ता।
  • CoMET का तरीका (PALPooling): लेखकों ने PALPooling नामक एक हल्का टूल बनाया है। इसे फिर से प्रशिक्षित करने के बजाय, यह एक "स्मंत हाइलाइटर" की तरह काम करता है। यह विशेषज्ञ के शुरुआती अनुमान को देखता है, पता लगाता है कि सही उत्तर पाने के लिए छवि या टेक्स्ट के कौन से हिस्से सबसे उपयोगी थे, और फिर उन हिस्सों पर ध्यान केंद्रित करने के लिए सारांश को फिर से वेटेज (re-weight) देता है।
  • गति: यह घंटों के बजाय सेकंडों में यह काम करता है, और इसके लिए भारी "रिट्रेनिंग" प्रक्रिया की आवश्यकता नहीं होती है।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि इन पूर्व-प्रशिक्षित उपकरणों को एक साथ जोड़ने (stacking) से (विज़न + रीडिंग + डेटा जासूस) और डेटा को व्यवस्थित करने के लिए थोड़ी सी गणित का उपयोग करने से, उन्होंने स्टेट-ऑफ-द-आर्ट (सर्वश्रेष्ठ) परिणाम प्राप्त किए।

  • कोई प्रशिक्षण आवश्यक नहीं: उन्हें इस विशिष्ट नई समस्या के लिए सिस्टम को प्रशिक्षित नहीं करना पड़ा। यह "आउट ऑफ द बॉक्स" काम करता है।
  • स्केलेबिलिटी (Scalability): उन्होंने इसका परीक्षण 5,00,000 नमूनों और 2,000 विभिन्न श्रेणियों (जैसे हजारों अलग-अलग प्रकार के कीड़ों या सॉफ़्टवेयर त्रुटियों को छाँटना) वाले विशाल डेटासेट्स पर किया।
  • पदानुक्रमित सफलता (Hierarchical Success): उन्होंने दिखाया कि यह "पदानुक्रमित" (hierarchical) कार्यों के लिए बहुत अच्छा काम करता है। कल्पना कीजिए कि एक लाइब्रेरी है जहाँ आप पहले किताबों को "फिक्शन" के आधार पर, फिर "मिस्ट्री" के आधार से, और फिर "डिटेक्टिव" के आधार से छाँटते हैं। CoMET इन परतों के माध्यम से बिना भ्रमित हुए तेज़ी से नेविगेट कर सकता है, जबकि पारंपरिक तरीके अक्सर ऐसे बड़े और जटिल ढांचों में संघर्ष करते हैं।

निचोड़

पेपर तर्क देता है कि हमें हमेशा शून्य से जटिल, कस्टम AI पाइपलाइन बनाने की आवश्यकता नहीं होती है। इसके बजाय, हम AI मॉडलों को लेगो (Lego) ब्रिक्स की तरह मान सकते हैं। यदि आपके पास छवियों के लिए एक मजबूत ईंट है, टेक्स्ट के लिए एक मजबूत ईंट है, और डेटा टेबल्स के लिए एक मजबूत ईंट है, तो आप उन्हें एक साधारण कनेक्टर (PCA) और एक स्मार्ट निर्णय लेने वाले (TFM) के साथ जोड़कर कठिन समस्याओं को तुरंत हल कर सकते हैं।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह अभी हर प्रकार के डेटा (जैसे ऑडियो या वीडियो) के लिए काम करता है, हालांकि यह सुझाव देता है कि यह विधि वहां भी विस्तारित हो सकती है।
  • यह दावा नहीं करता कि यह सभी भविष्य के AI प्रशिक्षण की जगह लेगा, बल्कि यह कई नई समस्याओं के लिए जटिल प्रशिक्षण की आवश्यकता को चुनौती देता है।
  • यह किसी विशिष्ट चिकित्सा निदान या क्लिनिकल उपयोग का उल्लेख नहीं करता है; यह जानवरों की पहचान, टेक्स्ट सेंटीमेंट या सॉफ़्टवेयर बग्स जैसे सामान्य वर्गीकरण कार्यों पर केंद्रित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →