Conflict-Resolving and Sharpness-Aware Minimization for Generalized Knowledge Editing with Multiple Updates
यह शोध पत्र CoRSA का प्रस्ताव करता है, जो एक पैरामीटर-कुशल प्रशिक्षण ढांचा है जो ज्ञान के संघर्षों को हल करता है और लॉस कर्वेचर (loss curvature) को न्यूनतम करता है ताकि कई ज्ञान संस्करोधों (knowledge edits) से गुजर रहे बड़े भाषा मॉडलों में सामान्यीकरण, स्थिरता और अपडेट प्रभावकारिता में महत्वपूर्ण सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (लार्ज लैंग्वेज मॉडल) है जो बहुत सारे तथ्यों को जानता है। लेकिन कभी-कभी, दुनिया बदल जाती है। शायद किसी कंपनी का नया CEO आता है, या किसी स्पोर्ट्स टीम में खिलाड़ी बदल जाता है। आपको लाइब्रेरियन की याददाश्त को कुशलतापूर्वक और सटीक रूप से अपडेट करने की आवश्यकता है बिना उन्हें नौकरी से निकाले और नया काम पर रखे (क्योंकि यह बहुत महंगा और धीमा होगा)।
यह पेपर एक नया तरीका पेश करता है जिसे CORSA कहा जाता है, जो इस लाइब्रेरियन की याददाश्त को कुशलतापूर्वक और सटीक रूप से अपडेट करने में मदद करता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:
समस्या: "जिद्दी" लाइब्रेरियन
जब आप लाइब्रेरियन को कोई नया तथ्य सिखाने की कोशिश करते हैं, तो वर्तमान तरीकों के साथ अक्सर तीन चीजें गलत हो जाती हैं:
- "पैराफ्रेस" (Paraphrase) की समस्या: यदि आप लाइब्रेरियन को बताते हैं, "CEO एंडी जेसी है," तो वे केवल उसी सटीक वाक्य को याद रख सकते हैं। यदि आप पूछते हैं, "अमेज़न को कौन चलाता है?" तो वे अभी भी पुराने CEO, जेफ बेजोस के बारे में कह सकते हैं। उन्होंने वास्तव में अवधारणा (concept) को नहीं सीखा है, बल्कि केवल विशिष्ट शब्दों को सीखा है।
- "बैकस्लाइड" (Backslide) की समस्या: यदि आप लाइब्रेरियन को एक बार अपडेट करते हैं, और फिर बाद में उन्हें फिर से अपडेट करते हैं, तो पहला अपडेट मिट सकता है या पुराना, गलत जानकारी फिर से वापस आ सकती है। यह व्हाइटबोर्ड पर मार्कर से लिखने जैसा है जो सूखता नहीं है; पुरानी स्याही फिर से उभर आती है।
- "संघर्ष" (Conflict) की समस्या: लाइब्रेरियन के पास पुराने तथ्यों की मजबूत यादें होती हैं। जब आप उन्हें पुराने तथ्यों को ओवरराइट करने की कोशिश करते हैं, तो पुरानी याद लड़ती है, जिससे भ्रम या "हलुसिनेशन" (hallucinations) होता है जहाँ लाइब्रेरियन पुरानी और नई जानकारी का मिश्रण देता है।
समाधान: CORSA
लेखकों ने CORSA (Conflict-Resolving and Sharpness-Aware Minimization) बनाया है। इसे लाइब्रेरियन के लिए एक विशेष प्रशिक्षण पद्धति के रूप में समझें जो ऊपर दी गई तीन समस्याओं को दो मुख्य तरकीबों का उपयोग करके ठीक करती है:
1. "फ्लैट वैली" (Flat Valley) की तरकीब (Sharpness-Aware Minimization)
कल्प Imagine करें कि लाइब्रेरियन का ज्ञान पहाड़ियों और घाटियों वाला एक परिदृश्य (landscape) है।
- पुराना तरीका: जब वे एक नया तथ्य सीखते हैं, तो वे मानचित्र पर एक छोटी, तीखी "चोटी" (spike) में फंस सकते हैं। यह एक आदर्श स्थान दिखता है, लेकिन यदि आप उन्हें थोड़ा सा भी हिलाते हैं (जैसे सवाल पूछने का तरीका बदलते हैं), तो वे उस चोटी से नीचे गिर जाते हैं और सब कुछ भूल जाते हैं।
- CORSA की तरकीब: CORSA लाइब्रेरियन को एक तीखी चोटी के बजाय एक चौड़ी, समतल घाटी (flat valley) खोजने के लिए मजबूर करता है। एक समतल घाटी में, भले ही आप लाइब्रेरियन को थोड़ा हिला दें (सवाल अलग तरह से पूछें), वे उसी स्थान पर बने रहते हैं। यह नए ज्ञान को स्थिर (stable) बनाता है और इसे विभिन्न तरीकों से पूछे जाने वाले सवालों के लिए सामान्य बनाने (generalize) में मदद करता है।
2. "भूत से लड़ने" की तरकीब (Conflict-Resolving)
कल्पना करें कि पुराना तथ्य लाइब्रेरियन को डराने वाला एक भूत है।
- पुराना तरीका: मानक प्रशिक्षण नए तथ्य को सिखाने की कोशिश करता है, लेकिन यह अनजाने में उस भूत को और अधिक शोर करने वाला बना देता है। लाइब्रेरियन नया तथ्य सीखता है लेकिन पृष्ठभूमि में पुराना तथ्य अभी भी फुसफुसाता रहता है।
- CORSA की तरकीब: CORSA एक दोहरी रणनीति का उपयोग करता है। यह नए तथ्य को सिखाता है साथ ही साथ लाइब्रेरियन को यह भी बताता है, "उस पुराने भूत को अनदेखा करो!" यह स्पष्ट रूप से पुराने उत्तर को दूर धकेलता है और नए उत्तर को करीब खींचता है। यह दोनों के बीच एक स्पष्ट अंतर पैदा करता है, जिससे यह सुनिश्चित होता है कि पुराना तथ्य बाद में चुपके से वापस न आ सके।
यह कई अपडेट्स को कैसे संभालता है
पेपर में परीक्षण किया गया है कि क्या होता है जब आप लाइब्रेरियन की याददाश्त को कई बार अपडेट करते हैं (जैसे कि एक CEO को ट्रैक करना जो हर साल अपनी नौकरी बदलता है)।
- अन्य तरीके: वे एक स्पंज की तरह व्यवहार करते हैं जो संतृप्त (saturated) हो जाता है। कुछ अपडेट के बाद, स्पंज अब नया पानी नहीं रोक सकता या वह पुराने पानी को बाहर निकाल देता है (भूलना)।
- CORSA: यह एक मॉड्यूलर नोटबुक की तरह काम करता है। क्योंकि इसने उन "फ्लैट वैली" को खोज लिया है और "भूतों" को दूर धकेल दिया है, इसलिए यह पुराने पन्नों को फाड़े बिना नए पन्ने जोड़ना जारी रख सकता है। यह पुराने CEO को भूले बिना नए CEO को याद रखता है, और यह भ्रमित नहीं होता है जब CEO फिर से बदल जाता है।
परिणाम
लेखकों ने वास्तविक दुनिया के तथ्यों (जैसे अमेज़न का CEO कौन है) और यहाँ तक कि कोड (एक कंप्यूटर प्रोग्राम कैसे काम करता है उसे अपडेट करना) पर इसका परीक्षण किया।
- बेहतर मेमोरी: CORSA अलग-अलग तरीकों से पूछे जाने पर नए तथ्यों को याद रखने में बहुत बेहतर था (generalization)।
- कम भूलना: जब उन्होंने मॉडल को बार-बार अपडेट किया, तो CORSA ने अन्य तरीकों की तुलना में असंबंधित जानकारी को बहुत कम भुलाया।
- कोडिंग कौशल: यह कोड बग्स को ठीक करने में भी सफल रहा, एक ऐसा कार्य जहाँ पिछले तरीके विफल रहे क्योंकि कोड "तथ्य बदलने" (fact swapping) के लिए बहुत जटिल होता है।
संक्षेप में
CORSA AI के मस्तिष्क को अपडेट करने का एक स्मार्ट तरीका है। केवल पुराने डेटा के ऊपर "लिखने" के बजाय, यह AI के मन में नए डेटा को स्टोर करने के लिए एक स्थिर, समतल स्थान ढूंढता है और सक्रिय रूप से पुराने, विरोधाभासी विचारों को दबा देता है। यह AI को अधिक विश्वसनीय, कम भूलने वाला और समय के साथ नई जानकारी को संभालने में बेहतर बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।