Vertical Fusion: Condensing Internal Representations for Robust ViT Classification
यह शोध पत्र VFusion प्रस्तुत करता है, जो गलत वर्गीकृत नमूनों को पुनः प्राप्त करने और मजबूती एवं सटीकता को महत्वपूर्ण रूप से बढ़ाने के लिए विजन ट्रांसफॉर्मर के भीतर मध्यवर्ती निरूपणों (intermediate representations) को एकत्रित करने की एक विधि है, जो पारंपरिक क्षैतिज एंसेम्बल दृष्टिकोणों के लिए एक कुशल विकल्प प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग है जिसे विज़न ट्रांसफार्मर (ViT) कहा जाता है। यह एक विशाल, बहु-मंजिला पुस्तकालय की तरह है जहाँ हर मंजिल एक तस्वीर को पढ़ती है और जो वह देखती है उसके बारे में एक छोटी सी रिपोर्ट लिखती है। आमतौर पर, जब हम इस रोबोट से बिल्ली या कार पहचानने के लिए कहते हैं, तो हम केवल सबसे ऊपरी मंजिल द्वारा लिखी गई रिपोर्ट को ही सुनते हैं। हम नीचे की सभी मंजिलों को एक "ब्लैक बॉक्स" की तरह मानते हैं और उनकी टिप्पणियों को अनदेखा कर देते हैं।
लेकिन क्या होगा अगर ऊपरी मंजिल गलत हो जाए? क्या होगा अगर निचली मंजिलों को सच में उत्तर पता था?
यही वह बड़ा सवाल है जो यह शोध पत्र पूछता है। शोधकर्ताओं ने पाया कि रोबोट की "मध्यवर्ती मंजिलें" (middle floors) अविश्वसनीय रूप से मददगार होती हैं। वास्तव में, उन्होंने पाया कि 18% से 76% बार जब ऊपरी मंजिल गलती करती है, तो एक निचली मंजिल ने उसे सही पहचान लिया होता है! वे इसे "रिकवरेबिलिटी" (recoverability) कहते हैं। यह एक टीम के जासूसों की तरह है जहाँ मुख्य जासूस (ऊपरी परत) कभी-कभी सुराग चूक जाता है, लेकिन एक जूनियर जासूस (मध्यवर्ती परत) ने उसे अपनी नोटबुक में लिख लिया होता है।
बड़ी गलतफहमी: यह "असहमति" के बारे में नहीं है
आप सोच सकते हैं, "ओह, तो क्या सभी परतें आपस में बहस कर रही हैं, और इसीलिए वे अच्छी हैं?" शोध पत्र कहता है कि नहीं, ऐसा नहीं है।
आमतौर पर, जब हम अलग-अलग मतों को मिलाते हैं (जैसे कि एक ग्रुप प्रोजेक्ट में), तो हम उम्मीद करते हैं कि सभी के पास एक अलग दृष्टिकोण हो। लेकिन यहाँ, परतें असहमत नहीं हो रही हैं। इसके बजाय, वे सभी एक ही "सत्य" को देख रही हैं, लेकिन थोड़े अलग स्तर के शोर (noise) के साथ। शोध पत्र दिखाता है कि परतें अतिरिक्त, स्थिर प्रोब (redundant, stable probes) के रूप में कार्य करती हैं। वे सभी आपको एक ही बात बताने की कोशिश कर रही हैं, लेकिन कुछ बस दूसरों की तुलना में थोड़ी अधिक स्पष्ट हैं। जादू उनके लड़ने में नहीं है; जादू इस बात में है कि वे सभी एक ही पहेली के टुकड़े पकड़े हुए हैं।
समाधान: VFusion (एक "वर्टिकल ब्लेंडर")
चूंकि ऊपरी मंजिल पूर्ण नहीं है, और निचली मंजिलों को अनदेखा किया जाता है, इसलिए लेखकों ने VFusion नामक एक नया टूल बनाया है।
VFusion को एक स्मार्ट ब्लेंडर के रूप में सोचें जो केवल ऊपरी मंजिल की रिपोर्ट नहीं लेता। इसके बजाय, यह हर मंजिल (या उनकी एक स्मार्ट चयन) के नोट्स लेता है, उन्हें आपस में मिलाता है, और "शोर" को बाहर निकालने के लिए एक विशेष फिल्टर का उपयोग करता है ताकि केवल स्पष्ट, साझा संकेत को रखा जा सके। यह एक सुपर-डेंस "ग्लोबल टोकन" बनाता है जो सभी परतों के सर्वश्रेष्ठ अंशों को जोड़ता है।
इसके परिणाम काफी अद्भुत हैं:
- VFusion औसतन किसी भी एकल परत (single layer) से लगभग 1.9% बेहतर प्रदर्शन करता है।
- यह सर्वश्रेष्ठ एकल परत और एक "सैद्धांतिक ओरेकल" (एक आदर्श स्कोर जहाँ आपको एक अंक मिलता है यदि कोई भी परत सही हो) के बीच के अंतर को 45% तक कम कर देता है।
- यह तब और भी बेहतर काम करता है जब चित्र कठिन हों, जैसे सूक्ष्म विवरण (उदाहरण के लिए, कारों या पक्षियों की विभिन्न नस्लों के बीच अंतर करना) या जब चित्र धुंधले या विकृत हों।
उन्होंने क्या खारिज किया
यह शोध पत्र बहुत स्पष्ट है कि क्या VFusion जितना अच्छा काम नहीं करता है:
- केवल "सर्वश्रेष्ठ" परत चुनना: आप केवल यह अनुमान नहीं लगा सकते कि कौन सी मंजिल सबसे स्मार्ट है और केवल उसी का उपयोग कर सकते हैं।
- साधारण औसत (Simple averaging): सभी परतों के अनुमानों का औसत लेना (जैसे कि एक साधारण वोट) VFusion के स्मार्ट मिश्रण जितना प्रभावी नहीं है।
- क्षैतिज एनसेम्बल (Horizontal Ensembles): शोध पत्र नोट करता है कि हालांकि आप 10 अलग-अलग रोबोटों को प्रशिक्षित कर सकते हैं और उन्हें वोट देने दे सकते हैं (एक "क्षैतिज" टीम), लेकिन यह बहुत महंगा और धीमा है। VFusion केवल एक ही रोबोट के अंदर झाँककर (एक "लंबवत/वर्टिकल" दृष्टिकोण) समान या बेहतर परिणाम प्राप्त करता है। यह मेडिकल इमेजिंग जैसे क्षेत्रों के लिए बहुत बड़ा है, जहाँ आपके पास केवल एक ही प्री-ट्रेंड मॉडल उपलब्ध हो सकता है।
वे कितने आश्वस्त हैं?
लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने 16 अलग-अलग डेटासेट्स (सरल अंकों से लेकर जटिल फूलों और कारों तक) और "आउट-ऑफ-डिस्ट्रीब्यूशन" शिफ्ट वाले 5 डेटासेट्स (जहाँ चित्र उस तरह के नहीं हैं जिस पर रोबोट को प्रशिक्षित किया गया था) पर इसका परीक्षण किया।
- उन्होंने मापा कि मध्यवर्ती परतें त्रुटियों को 18% से 76% तक रिकवर करती हैं।
- उन्होंने दिखाया कि VFusion विभिन्न मॉडल आकारों (Small, Base, Large) और प्रशिक्षण शैलियों (Supervised, Self-Supervised, CLIP) में लगातार बेहतर प्रदर्शन करता है।
- उन्होंने यह भी जांचा कि क्या यह "फाइन-ग्रैंड" कार्यों (जैसे 100 प्रकार के पक्षियों के बीच अंतर करना) पर काम करता है और पाया कि VFusion वहां चमकता है, जिससे कुछ कठिन डेटासेट्स पर सटीकता में 7.2% तक सुधार होता है।
निष्कर्ष (The Takeaway)
शोध पत्र सुझाव देता है कि हम अपने AI मॉडलों के भीतर सूचना के एक सोने के भंडार को अनदेखा कर रहे हैं। VFusion का उपयोग करके, हम एक एकल, फ्रीज्ड रोबोट मस्तिष्क को एक सुपर-एक्यूरेट क्लासिफायर में बदल सकते हैं, बिना रोबोटों की एक पूरी नई सेना को प्रशिक्षित किए। यह हमारे पास पहले से मौजूद परतों से हर आखिरी बूंद बुद्धिमत्ता निकालने का एक हल्का और कुशल तरीका है।
और सबसे अच्छी बात? यह केवल एक सिद्धांत नहीं है। कोड उपलब्ध है, और परिणाम विभिन्न प्रकार के चित्रों और विभिन्न मॉडल आकारों में सटीक साबित होते हैं। यह साबित होता है कि पूरी लाइब्रेरी शीर्ष मंजिल के लाइब्रेरियन से अधिक स्मार्ट है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।