← नवीनतम पेपर
💻 computer science

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Remember-R1 एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में जटिल तर्क प्रक्षेप पथों (reasoning trajectories) के दौरान निरंतर दृश्य साक्ष्य उपयोग को प्रोत्साहित करने के लिए प्रक्रिया-स्तरीय पर्यवेक्षण (process-level supervision) लागू करके दीर्घ-संदर्भ दृश्य विस्मृति (long-context visual forgetting) को कम करता है।

मूल लेखक: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक अकेली, जटिल तस्वीर को देखकर रहस्य सुलझाना सिखा रहे हैं। आप रोबोट से कहते हैं, "इस छवि को देखो और मुझे बताओ कि क्या हो रहा है।" शुरुआत में, रोबोट एक सतर्क जासूस की तरह होता है, जो फोटो के हर विवरण को ध्यान से देखता है। लेकिन जैसे ही रोबोट बात करना शुरू करता है, अपने लंबे, चरण-दर-चरण विचारों को लिखना शुरू करता है, कुछ अजीब होता है। वह जितना लंबा बोलता जाता है, ऐसा लगता है जैसे वह तस्वीर को पूरी तरह से भूलता जा रहा है। वह अपनी पिछली बातों पर निर्भर होने लगता है, इस आधार पर अनुमान लगाने लगता है कि कहानियाँ आमतौर पर कैसे चलती हैं, बजाय इसके कि वास्तव में वहां क्या मौजूद है। यह "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs) की एक नई पीढ़ी के लिए एक समस्या है—ऐसे AI सिस्टम जो देख और पढ़ सकते हैं। वे जटिल तर्क करने में बेहतर हो रहे हैं, लेकिन उनमें एक दोष है: जैसे-जैसे उनकी "चेन ऑफ थॉट" (विचारों की श्रृंखला) लंबी होती जाती है, वे "विजुअल फॉरगेटिंग" (दृश्य विस्मृति) का शिकार होते हैं। वे दृश्य साक्ष्य से भटक जाते हैं, जिससे गलत उत्तर मिलते हैं, भले ही तस्वीर में सच्चाई मौजूद हो। वैज्ञानिक इस बात पर ध्यान देते हैं क्योंकि यदि ये AI मॉडल सोचने के दौरान अपनी नज़र लक्ष्य पर नहीं रख पाते, तो वे गणित के आरेखों को हल करने या मेडिकल स्कैन को समझने जैसे गंभीर कार्यों के लिए भरोसेमंद नहीं हो सकते।

यहाँ Remember-R1 आता है, एक चतुर नया प्रशिक्षण तरीका जिसे रोबोट की आँखें तस्वीर पर चिपकाए रखने के लिए डिज़ाइन किया गया है, चाहे कहानी कितनी भी लंबी क्यों न हो। AI की तर्क प्रक्रिया को एक लंबी सड़क यात्रा के रूप में सोचें। अतीत में, शोधकर्ताओं ने ड्राइवर को बार-बार नक्शा दिखाने के लिए कार रोकने की कोशिश करके (छवि को फिर से पेश करके) विस्मृति की समस्या को ठीक करने का प्रयास किया था, जो धीमा और बोझिल था। अन्य लोगों ने तो ड्राइवर को उन चीजों की सूची बनाने के लिए कहा जो उन्हें लगता था कि उन्होंने देखी हैं और बाद में उस सूची की जांच करने को कहा, लेकिन यह वास्तविक सड़क के बजाय एक प्रॉक्सी नोट की जांच करने जैसा था। Remember-R1 एक अलग दृष्टिकोण अपनाता है। यात्रा को बदलने या स्टॉप जोड़ने के बजाय, यह एक सख्त लेकिन सहायक कोच की तरह काम करता है जो पीछे की सीट पर बैठकर ड्राइवर को गाड़ी चलाते समय पुरस्कारों के रूप में फुसफुसाता रहता है।

यह पेपर Remember-R1 नामक एक प्रणाली का प्रस्ताव करता है जो इन मॉडल्स को प्रशिक्षित करने के लिए "रीइन्फोर्समेंट लर्निंग" (सुदृढीकरण शिक्षण) तकनीक का उपयोग करता है। मुख्य विचार मॉडल की "विचार प्रक्रिया" को सीधे नियंत्रित करना है, न कि केवल अंतिम उत्तर को ग्रेड देना। शोधकर्ताओं ने मॉडल को चित्र में जमी हुई बातों से जोड़े रखने के लिए तीन विशिष्ट "रिवॉर्ड्स" (पुरस्कारों) को डिज़ाइन किया है:

  1. "कीवर्ड हंटर" रिवॉर्ड (Keyword Hunter Reward): मॉडल को उन विशिष्ट, एनोटेटेड विवरणों का स्पष्ट रूप से उल्लेख करने के लिए अंक मिलते हैं जो उसने छवि में पाए हैं (जैसे "नीला गोला" या "छोटा घन")। यह एक खेल की तरह है जहाँ ड्राइवर को बोनस मिलता है यदि वह गुजरने वाले हर विशिष्ट लैंडमार्क को पहचानता और नाम देता है, जिससे यह सुनिश्चित होता है कि वह केवल मनगढ़ंत बातें नहीं कर रहा है।
  2. "मेमोरी कीपर" रिवॉर्ड (Memory Keeper Reward): यह रिवॉर्ड मॉडल को दंडित करता है यदि वह बातचीत लंबी होने के साथ छवि पर कम ध्यान देने लगता है। लक्ष्य यह है कि पहले चरण से लेकर अंतिम चरण तक "विजुअल अटेंशन" (दृश्य ध्यान) को स्थिर रखा जाए, जिससे मॉडल को केवल अपने स्वयं के टेक्स्ट पर निर्भर होकर दिवास्वप्न देखने से रोका जा सके।
  3. "स्पॉटलाइट" रिवॉर्ड (Spotlight Reward): यह सुनिश्चित करता है कि मॉडल केवल यादृच्छिक रूप से छवि को नहीं देख रहा है; उसे वास्तव में प्रश्न का उत्तर देने वाले चित्र के विशिष्ट हिस्सों पर अपना ध्यान केंद्रित करना चाहिए। यदि प्रश्न लाल कार के बारे में है, तो मॉडल को लाल कार पर अपना "स्पॉटलाइट" बनाए रखने के लिए पुरस्कृत किया जाता है, न कि पृष्ठभूमि के पेड़ों पर।

लेखकों ने सात विभिन्न बेंचमार्क (जिसमें गणित, तर्क और सामान्य दृश्य समझ शामिल है) पर दो अलग-अलग आकार के AI मॉडल्स (3 बिलियन और 7 बिलियन पैरामीटर्स) पर Remember-R1 का परीक्षण किया। परिणाम बताते हैं कि यह तरीका काम करता है। Remember-R1 से प्रशिक्षित मॉडल अपने बिना प्रशिक्षित समकक्षों और अन्य मौजूदा तरीकों की तुलना में लगातार बेहतर प्रदर्शन करते हैं। उदाहरण के लिए, MathVista बेंचमार्क पर, 3B मॉडल का स्कोर 51.90 से सुधरकर 65.50 हो गया, और 7B मॉडल 62.30 से उछलकर 69.80 हो गया।

महत्वपूर्ण रूप से, पेपर दिखाता है कि यह सुधार केवल अंत में सही उत्तर प्राप्त करने के बारे में नहीं है; यह इस बारे में है कि मॉडल वहां कैसे पहुँचता है। मॉडल्स के "अटेंशन" का विश्लेषण करके, शोधकर्ताओं ने पाया कि Remember-R1 मॉडल के चित्र को भूलने की दर को धीमा कर देता है। जबकि मानक मॉडल अपने तर्क के बीच में ही चित्र में रुचि खो देते हैं, Remember-R1 मॉडल दृश्य साक्ष्य पर अपनी दृष्टि बहुत लंबे समय तक बनाए रखते हैं। पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि प्रक्रिया के दौरान मॉडल को छवि दोबारा दिखाना ही सबसे अच्छा समाधान है, यह नोट करते हुए कि यह बहुत महंगा है और तर्क के प्रवाह को तोड़ देता है। इसके बजाय, वे तर्क देते हैं कि इन विशिष्ट पुरस्कारों के माध्यम से मॉडल को अपना स्वयं का विजुअल फोकस बनाए रखने के लिए प्रशिक्षित करना अधिक प्रभावी मार्ग है।

संक्षेप में, Remember-R1 सुझाव देता है कि AI मॉडल्स को उनके पूरे विचार प्रक्रिया के दौरान अच्छे "विजुअल डिटेक्टिव" (दृश्य जासूस) बनने के लिए पुरस्कृत करके—कीवर्ड्स को पहचानना, अपनी याददाश्त ताज़ा रखना और सही स्थानों पर ध्यान केंद्रित करना—हम उन्हें देखते हुए चीज़ों को भूलने से रोक सकते हैं। यह न केवल उन्हें गणित या तर्क में स्मार्ट बनाता है; यह उन्हें दुनिया का अधिक विश्वसनीय पर्यवेक्षक बनाता है, यह सुनिश्चित करता है कि उनकी लंबी, जटिल कहानियाँ हमेशा उस तस्वीर की सच्चाई में निहित हों जिसे वे देख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →