← नवीनतम पेपर
🤖 AI

Attention Retention for Continual Learning with Vision Transformers

यह शोध पत्र विजन ट्रांसफॉर्मर्स में निरंतर सीखने (कंटीन्यूअल लर्निंग) के लिए एक नवीन अटेंशन-रिटेनिंग फ्रेमवर्क प्रस्तावित करता है जो अटेंशन ड्रिफ्ट की पहचान करके और पूर्व में सीखे गए दृश्य अवधारणाओं को संरक्षित करने के लिए इंस्टेंस-एडेप्टिव ग्रेडिएंट मास्किंग लागू करके कैटास्ट्रोफिक फॉरगेटिंग को कम करता है, जिससे विविध परिदृश्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yue Lu, Xiangyu Zhou, Shizhou Zhang, Yinghui Xing, Guoqiang Liang, Wencong Zhang

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yue Lu, Xiangyu Zhou, Shizhou Zhang, Yinghui Xing, Guoqiang Liang, Wencong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, उत्साही छात्र (एक AI) को विभिन्न जानवरों को पहचानना सिखा रहे हैं। पहले, आप उसे बिल्लियों की तस्वीरें दिखाते हैं। वह बिल्लियों को पहचानने के लिए विशेष रूप से उनके नुकीले कानों और मूंछों (whiskers) को देखना सीखता है। फिर, आप उसे कुत्तों की तस्वीरें दिखाते हैं। वह लटकते हुए कानों और गीली नाक को देखना सीखता है।

पारंपरिक AI के साथ समस्या है एक घटना जिसे "कैटस्ट्रोफिक फॉरगेटिंग" (Catastrophic Forgetting) कहा जाता है। जब छात्र कुत्तों के बारे में सीखता है, तो उसका दिमाग नई जानकारी को लेकर इतना उत्साहित हो जाता है कि वह पूरी तरह भूल जाता है कि बिल्ली कैसी दिखती थी। वह कुत्ते के लटकते कानों को देखकर यह सोचने लग सकता है कि "ओह, यह तो बिल्ली है!" या वह मूंछों को देखना पूरी तरह बंद कर सकता है क्योंकि नए सबक ने पुराने सबक को मिटा दिया है।

यह पेपर इस छात्र को सिखाने का एक नया तरीका पेश करता है, जिसे ARCL-ViT कहा जाता है, जो एक "मेमोरी गार्डियन" (स्मृति रक्षक) के रूप में कार्य करता है ताकि वह भूलने से बच सके।

मुख्य समस्या: "अटेंशन ड्रिफ्ट" (Attention Drift)

लेखकों ने पाया कि आधुनिक AI मॉडल (विशेष रूप से विज़न ट्रांसफॉर्मर्स, या ViTs) में, समस्या केवल यह नहीं है कि छात्र भूल जाता है; बल्कि यह है कि उसका ध्यान भटक जाता है (focus shifts)

AI के "अटेंशन" (ध्यान) को एक फ्लैशलाइट की तरह समझें।

  • जब बिल्ली के बारे में सीखते समय, फ्लैशलाइट बिल्ली की मूंछों पर चमकती है।
  • जब AI कुत्तों के बारे में सीखता है, तो फ्लैशलाइट भटकने लगती है। यह मूंछों से हट जाती है और कुत्ते की नाक पर चमकने लगती है।
  • यदि फ्लैशलाइट बहुत अधिक भटक जाती है, तो AI बाद में बिल्ली को पहचानने की क्षमता खो देता है क्योंकि वह अब सही जगह पर नहीं देख रहा होता।

समाधान: "छेड़ना मना है" वाला मास्क (The "Do Not Touch" Mask)

लेखकों ने फ्लैशलाइट को स्थिर रखने के लिए एक चतुर तरीका प्रस्तावित किया है। हर पुरानी तस्वीर को याद रखने की कोशिश करने के बजाय (जिसमें बहुत जगह लगती है), वे एक दो-चरणीय प्रक्रिया का उपयोग करते हैं:

चरण 1: "गोल्डन ज़ोन" का मानचित्रण (Mapping the "Golden Zones")

बिल्ली के बारे में सीखना समाप्त करने के बाद, सिस्टम इस बात का एक स्नैपशॉट लेता है कि फ्लैशलाइट ठीक कहाँ चमक रही थी। यह एक मैप (मास्क) बनाता है जो "गोल्डन ज़ोन" को हाइलाइट करता है—छवि के वे विशिष्ट भाग जो बिल्ली को पहचानने के लिए महत्वपूर्ण थे (जैसे उसकी मूंछें)।

  • उपमा: कल्पना कीजिए कि शिक्षक कागज पर बिल्ली की मूंछों के चारों ओर एक लाल घेरा खींचता है और कहता है, "यह सबसे महत्वपूर्ण हिस्सा है। यहाँ अपना ध्यान न बदलें।"

चरण 2: नए सीखने के लिए "स्टॉप-साइन" (The "Stop-Sign" for New Learning)

जब छात्र कुत्तों के बारे में सीखना शुरू करता है, तो सिस्टम उस लाल घेरे को देखता है। यदि नया सबक AI के मूंछों पर ध्यान केंद्रित करने के तरीके को बदलने की कोशिश करता है (क्योंकि गणित कहता है कि उसे ऐसा करना चाहिए), तो सिस्टम ब्रेक लगा देता है।

  • तंत्र (Mechanism): AI की भाषा में, इसे ग्रेडिएंट मास्किंग (Gradient Masking) कहा जाता है। जब AI अपने मस्तिष्क को अपडेट करने का तरीका कैलकुलेट करता है, तो सिस्टम मूंछों पर ध्यान केंद्रित करने वाले मस्तिष्क के हिस्सों पर एक "स्टॉप साइन" लगा देता है। यह AI को बताता है: "तुम कुत्ते की नाक के बारे में सीख सकते हो, लेकिन तुम्हें मूंछों को देखने के तरीके को बदलने से सख्ती से रोका जाता है।"

यह सुनिश्चित करने के लिए कि यह AI को धीमा न करे या उसके लर्निंग इंजन को भ्रमित न करे, सिस्टम सीखने की गति को भी समायोजित करता है, जिससे यह सुनिश्चित होता है कि AI बिना बिल्ली के तथ्यों को गलती से मिटाए, कुत्ते के नए तथ्यों को सुचारू रूप से सीख सके।

यह विशेष क्यों है?

अन्य अधिकांश तरीके इसे हल करने की कोशिश करते हैं:

  1. पुराने डेटा को दोहराना (Replaying old data): हर बार जब छात्र नया कुत्ता सीखता है, तो उसे पुरानी बिल्ली की तस्वीरें दिखाना। (यह कठिन है क्योंकि आपको वे सभी पुरानी तस्वीरें स्टोर करनी पड़ती हैं)।
  2. नए कमरे बनाना: हर नए जानवर के लिए मस्तिष्क के नए हिस्से जोड़ना। (इससे मस्तिष्क बहुत बड़ा और अव्यवस्थित हो जाता है)।

लेखकों का तरीका अलग है क्योंकि यह फोकस को लॉक कर देता है। इसे पुराने चित्रों को स्टोर करने की आवश्यकता नहीं है, और न ही इसे नए कमरे बनाने की आवश्यकता है। यह बस यह सुनिश्चित करता है कि फ्लैशलाइट महत्वपूर्ण विशेषताओं पर स्थिर रहे।

परिणाम

इस पद्धति का परीक्षण विभिन्न कठिन चुनौतियों पर किया गया, जैसे विभिन्न कलात्मक शैलियों या विभिन्न डोमेन में जानवरों को पहचानना।

  • परिणाम: इस पद्धति का उपयोग करने वाला AI पुराने कॉन्सेप्ट्स (बिल्ली) को बहुत बेहतर तरीके से याद रखता था, जबकि वह नए कॉन्सेप्ट्स (कुत्ता) को भी बहुत अच्छी तरह से सीख रहा था।
  • प्रमाण: उन्होंने "फ्लैशलाइट" (अटेंशन मैप्स) की तस्वीरें दिखाईं। मानक AI की फ्लैशलाइट इधर-उधर भटक गई थी, जबकि नए तरीके की फ्लैशलाइट मूल विशेषताओं पर पूरी तरह से केंद्रित रही, ठीक वैसे ही जैसे एक इंसान करता है।

संक्षेप में, यह पेपर AI को सिखाता है कि उन चीजों पर अपना ध्यान खोए बिना नई चीजें कैसे सीखी जाएं जिन्हें वह पहले से जानता है, जो यह दर्शाता है कि मानव ध्यान स्वाभाविक रूप से महत्वपूर्ण अवधारणाओं को कैसे स्थिर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →