← नवीनतम पेपर
🤖 machine learning

BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning

यह शोध पत्र BOFA का प्रस्ताव करता है, जो क्लास-इन्क्रीमेंटल लर्निंग के लिए एक पैरामीटर-एफिशिएंट फ्रेमवर्क है जो भूलने की प्रक्रिया को रोकने के लिए ऑर्थोगोनल लो-रैंक फ्यूजन के माध्यम से ब्रिज-लेयर तक अपडेट को सीमित करके CLIP मॉडल्स को अनुकूलित करता है और बिना किसी अतिरिक्त इन्फरेंस लागत के वर्गीकरण प्रदर्शन को बढ़ाने के लिए क्रॉस-मोडल हाइब्रिड प्रोटोटाइप्स का उपयोग करता है।

मूल लेखक: Lan Li, Tao Hu, Da-Wei Zhou, Jia-Qi Yang, Han-Jia Ye, De-Chuan Zhan

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lan Li, Tao Hu, Da-Wei Zhou, Jia-Qi Yang, Han-Jia Ye, De-Chuan Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास CLIP नाम का एक प्रतिभाशाली, सर्वज्ञानी लाइब्रेरियन (पुस्तकालयाध्यक्ष) है। इस लाइब्रेरियन ने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं, इसलिए वह "बिल्ली" की तस्वीर को "बिल्ली" शब्द के साथ लगभग तुरंत ही मिला सकता है। हालाँकि, CLIP के साथ एक समस्या है: वह थोड़ा कठोर है। यदि आप उसे किसी बिल्कुल नए प्रकार के जानवर (जैसे, एक "प्लैटिपस") के बारे में सीखना चाहते हैं जो उसके मूल प्रशिक्षण में नहीं था, तो वह अपने पुराने ज्ञान (जैसे कि वह कैसे "कुत्ते" या "बिल्ली" को पहचानता था) को भूल जाए बिना अपना ज्ञान अपडेट करने में संघर्ष करता है।

यह क्लास-इन्क्रीमेंटल लर्निंग (CIL) की चुनौती है: मॉडल को एक-एक करके नई चीजें सिखाना बिना पुरानी चीजों को भूले।

यह पेपर इस समस्या को हल करने के लिए एक नया तरीका पेश करता है जिसे BOFA (ब्रिज-लेयर ऑर्थोगोनल फ्यूजन फॉर अडैप्टेशन) कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "नवीनीकरण" की आपदा (The "Renovation" Disaster)

आमतौर पर, जब हम CLIP को नई चीजें सिखाना चाहते हैं, तो हम लाइब्रेरी में एक छोटा "विस्तार" (जैसे एक नया कमरा या एक नया सहायक) जोड़ने की कोशिश करते हैं। पेपर का तर्क है कि यह बहुत अव्यवस्थित है।

  • समस्या: यदि आप लाइब्रेरी में लगातार नए कमरे (अतिरिक्त मॉड्यूल) जोड़ते रहते हैं, तो इसे बनाए रखना महंगा हो जाता है, और नए कमरे अक्सर पुराने वाले को ओवरराइट (मिटा) देते हैं। लाइब्रेरियन भ्रमित हो जाता है, और अचानक वह यह भूल जाता है कि "कुत्ता" कैसा दिखता है क्योंकि वह "प्लैटिपस" पर ध्यान केंद्रित करने में बहुत व्यस्त है।

2. समाधान: इसके बजाय "ब्रिज" का नवीनीकरण करना

BOFA एक अलग दृष्टिकोण अपनाता है। नया कमरा बनाने के बजाय, यह पूरी तरह से लाइब्रेरी के अंदर के ब्रिज (पुल) के नवीनीकरण पर ध्यान केंद्रित करता है।

  • द ब्रिज (पुल): CLIP में, एक विशिष्ट लेयर (एक "ब्रिज") है जो लाइब्रेरी के चित्र वाले हिस्से को शब्द वाले हिस्से से जोड़ती है।
  • रणनीति: BOFA कहता है, "आइए हम बस इस ब्रिज को ही थोड़ा बदल दें।" इस एक मौजूदा हिस्से को एडजस्ट करके, हमें कोई नया कमरा बनाने या नए सहायक रखने की आवश्यकता नहीं है। यह लाइब्रेरी को सरल और कुशल बनाए रखता है।

3. गुप्त मंत्र: "सुरक्षित उप-स्थान" (The "Safe Subspace" - Orthogonal Low-Rank Fusion)

यहाँ पेचीदा हिस्सा आता है। यदि आप केवल "प्लैटिपस" के लिए ब्रिज को पेंट करना शुरू कर देते हैं, तो आप अनजाने में "कुत्ते" वाले हिस्से को भी पेंट कर सकते हैं। आप अतीत को मिटाए बिना ब्रिज को कैसे अपडेट करेंगे?

BOFA एक चतुर गणितीय ट्रिक का उपयोग करता है जिसे ऑर्थोगोनल लो-रैंक फ्यूजन कहा जाता है।

  • उपमा: कल्पना कीजिए कि ब्रिज एक विशाल डांस फ्लोर है। "पुराने ज्ञान" (कुत्ते, बिल्लियाँ) ने पहले से ही फ्लोर को विशिष्ट पैटर्न में नाचने वाले नर्तकों से भर दिया है।
  • "सेफ ज़ोन" (सुरक्षित क्षेत्र): BOFA एक विशेष, अदृश्य "सेफ ज़ोन" की गणना करता है जहाँ पुराने नर्तक नहीं नाच रहे हैं। यह कमरे के एक शांत कोने को खोजने जैसा है जो पूरी तरह से खाली है।
  • चाल: जब लाइब्रेरियन को "प्लैटिपस" के बारे में सीखने की आवश्यकता होती है, तो BOFA उस नए सीखने की प्रक्रिया को केवल उस शांत, खाली कोने में होने के लिए मजबूर करता है।
  • परिणाम: नया "प्लैटिपस" डांस पूरी तरह से सीखा जाता है, लेकिन क्योंकि यह "कुत्ते" के डांस की तुलना में एक अलग दिशा (ऑर्थोगोनल) में हो रहा है, इसलिए यह पुराने नर्तकों से टकराता नहीं है या उन्हें मिटाता नहीं है। पुराना ज्ञान सुरक्षित रहता है, और नया ज्ञान उसके ऊपर जोड़ा जाता है।

4. अंतिम स्पर्श: "हाइब्रिड" जासूस (The "Hybrid" Detective)

ब्रिज अपडेट होने के बाद, BOFA को यह निर्णय लेने की आवश्यकता होती है कि कोई छवि क्या है।

  • पुराना तरीका: आमतौर पर, लाइब्रेरियन केवल टेक्स्ट विवरण (जैसे, "बिल्ली की एक फोटो") को देखता है।
  • BOFA का तरीका: BOFA एक हाइब्रिड डिटेक्टिव (मिश्रित जासूस) बनाता है। यह जासूस शब्दों (टेक्स्ट) के बारे में लाइब्रेरियन के सामान्य ज्ञान को तस्वीरों (विजुअल्स) से सीखी गई ताज़ा विशिष्ट जानकारियों के साथ जोड़ता है।
  • यह क्यों मदद करता है: कभी-कभी टेक्स्ट विवरण अस्पष्ट होता है, और कभी-कभी तस्वीर पेचीदा होती है। दोनों को फ्यूज (मिलाने) करके, जासूस बहुत अधिक सटीक हो जाता है और गलती करने की संभावना कम हो जाती है।

परिणामों का सारांश

लेखकों ने कई अलग-अलग "लाइब्रेरीज" (CIFAR-100, ImageNet जैसे डेटासेट) पर BOFA का परीक्षण किया।

  • परिणाम: BOFA ने लगातार अन्य तरीकों से बेहतर प्रदर्शन किया। इसने नए क्लास को तेज़ी से सीखा, पुराने क्लास के बारे में कम भुला, और इसके लिए किसी अतिरिक्त मेमोरी या जटिल नए मॉड्यूल की आवश्यकता नहीं पड़ी।
  • मुख्य बात: मौजूदा ब्रिज पर ध्यान केंद्रित करके, पुराने अनुभवों को सुरक्षित रखने के लिए एक "सेफ ज़ोन" का उपयोग करके, और टेक्स्ट को तस्वीरों के साथ जोड़कर, BOFA AI को बिना किसी सामान्य "भूलने की बीमारी" के निरंतर सीखना सिखाता है।

संक्षेप में, BOFA एक मास्टर आर्किटेक्ट की तरह है जो जानता है कि मौजूदा मंजिलों की दीवारों को गिराए बिना, इमारत की नींव को मजबूत करके उसमें नई मंजिलें कैसे जोड़ी जाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →