Safin-1: Safety from Within through Memory-Native State Evolution
यह शोधपत्र सफिन-1 (Safin-1) को प्रस्तुत करता है, जो एक फाउंडेशन मॉडल परिवार है, जो मेमोरी-एंकर रूटिंग अक्रॉस कॉन्टेक्स्ट हिस्ट्री (MARCH) आर्किटेक्चर का उपयोग करता है ताकि सुरक्षा को बाहरी बाधाओं पर निर्भर रहने के बजाय मेमोरी-नेटिव स्टेट इवोल्यूशन के माध्यम से एक अंतर्निहित, अनुकूल रूप से बनाए रख सकने वाली क्षमता के रूप में स्थापित किया जा सके।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, मेमोरी (स्मृति) और सुरक्षा के बीच एक निरंतर तनाव बना रहता है। लार्ज लैंग्वेज मॉडल्स को सहायक बनने के लिए डिज़ाइन किया गया है, लेकिन जैसे-जैसे वे लंबी और जटिल बातचीत में शामिल होते हैं, उन्हें ट्रैक पर रहने के लिए यह याद रखना पड़ता है कि पहले क्या कहा गया था। पारंपरिक रूप से, ये मॉडल्स हर बोले गए शब्द की एक चलती हुई सूची रखकर अपनी मेमोरी को संभालते हैं, जो बातचीत बढ़ने के साथ भारी और धीमी हो जाती है। साथ ही, इन मॉडल्स को हानिकारक अनुरोधों से सुरक्षित रखने के लिए आमतौर पर बाहरी नियम जोड़ने या पूरे सिस्टम को फिर से प्रशिक्षित करने की आवश्यकता होती है, जिससे मॉडल कम लचीला हो सकता है या वह हानिरहित प्रश्नों को भी अस्वीकार कर सकता है। शोधकर्ताओं के लिए चुनौती एक ऐसा सिस्टम बनाने की है जो स्वाभाविक रूप से दीर्घकालिक संदर्भ (लॉन्ग-टर्म कॉन्टेक्स्ट) को थाम सके और साथ ही जिसमें सुरक्षा उसके मूल ढांचे के भीतर अंतर्निहित हो, न कि केवल बाद में जोड़ी गई कोई चीज़।
शंघाई एआई लैबोरेट्री के शोधकर्ताओं की एक टीम ने 'Safin-1' नामक मॉडल्स के एक परिवार के साथ इस समस्या को हल करने का एक नया तरीका प्रस्तावित किया है। सुरक्षा को बाहरी नियमों या कोड की एक अलग परत के रूप में मानने के बजाय, उन्होंने मॉडल को इस तरह डिज़ाइन किया है कि वह सुरक्षा को एक आंतरिक अवस्था (इंटरनल स्टेट) के रूप में साथ रखे, ठीक वैसे ही जैसे एक व्यक्ति अपने व्यक्तिगत मूल्यों को साथ रखता है जो विभिन्न स्थितियों में उसके व्यवहार का मार्गदर्शन करते हैं। उनकी मुख्य नवीनता एक ऐसी प्रक्रिया है जो मॉडल को नियमित अंतराल पर अपनी स्वयं की आंतरिक विचार प्रक्रिया के स्नैपशॉट्स (snapshots) को सहेजने की अनुमति देती है। जैसे ही मॉडल एक लंबा दस्तावेज़ पढ़ता है या किसी जटिल निर्देश का पालन करता है, वह अपनी वर्तमान समझ का एक संक्षिप्त सारांश सहेजने के लिए रुक-रुक कर रुकता है। बाद में, जब मॉडल को अतीत से कुछ याद करने की आवश्यकता होती है, तो वह पूरी बातचीत के इतिहास को एक साथ प्रोसेस करने के बजाय, सबसे प्रासंगिक जानकारी खोजने के लिए इन सहेजे गए स्नैपशॉट्स में खोज कर सकता है। यह दृष्टिकोण, जिसे शोधकर्ता 'मेमोरी-नेटिव स्टेट इवोल्यूशन' कहते हैं, मॉडल की मेमोरी को अतीत के एक निष्क्रिय रिकॉर्ड से बदलकर एक सक्रिय उपकरण में बदल देता है जिसे आवश्यकतानुसार परामर्श और अपडेट किया जा सकता है।
शोधकर्ताओं ने इस विचार का परीक्षण पहले छोटे मॉडल्स पर किया ताकि यह सुनिश्चित किया जा सके कि आर्किटेक्चर सही ढंग से काम कर रहा है। उन्होंने पाया कि इस विशिष्ट अतीत की अवस्थाओं (past states) को पुनः प्राप्त करने की क्षमता जोड़कर, मॉडल्स लंबे संदर्भों को समझने और टेक्स्ट के गहरे हिस्से में छिपी जानकारी खोजने में काफी बेहतर हो गए। उन परीक्षणों में जहाँ मॉडल्स को हजारों शब्दों के ढेर में से एक विशिष्ट सुई ढूँढनी थी, नए डिज़ाइन ने पिछले तरीकों से बेहतर प्रदर्शन किया, विशेष रूप से तब जब टेक्स्ट उस लंबाई से अधिक था जो मॉडल ने अपने प्रशिक्षण के दौरान देखी थी। यह सुझाव देता है कि अतीत की अवस्थाओं को चुनिally (चयनात्मक रूप से) याद करने की क्षमता मॉडल को सूचना की विशाल मात्रा में खोए बिना, लंबे समय तक अपना ध्यान और तर्क शक्ति बनाए रखने में मदद करती है।
इन शुरुआती सफलताओं पर आगे बढ़ते हुए, टीम ने इस तकनीक को चार बिलियन से लेकर पैंतीस बिलियन पैरामीटर्स वाले बहुत बड़े मॉडल्स तक बढ़ाया। उन्होंने इन बड़े मॉडल्स पर उसी मेमोरी-रूटिंग सिस्टम को लागू किया और फिर एक विशिष्ट अनुप्रयोग का परीक्षण किया: सुरक्षा। उन्होंने एक विशेष, निरंतर "सेफ्टी स्टेट" (सुरक्षा अवस्था) बनाई जिसे मॉडल के साथ जोड़ा जा सकता था। इस अवस्था को हानिकारक अनुरोधों को पहचानने और मॉडल को सुरक्षित प्रतिक्रियाओं की ओर निर्देशित करने के लिए प्रशिक्षित किया गया था, लेकिन इसे हटाने योग्य (detachable) बनाया गया था। शोधकर्ताओं ने पाया कि जब यह सुरक्षा अवस्था सक्रिय थी, तो मॉडल चालाकी भरी कोशिशों (trickery attempts) से हानिकारक सामग्री उत्पन्न करने से बचने में बहुत बेहतर हो गया। परीक्षणों के एक सेट में, इस नए दृष्टिकोण ने मानक मॉडल की तुलना में इन चालाकी भरी कोशिशों की सफलता दर को लगभग आधा कर दिया। महत्वपूर्ण रूप से, सुरक्षा में इस सुधार के कारण मॉडल की सहायक होने की क्षमता में कमी नहीं आई। अन्य तरीकों के विपरीत, जो अत्यधिक सावधानी के कारण वैध प्रश्नों को भी अस्वीकार कर देते हैं, इस नए दृष्टिकोण ने खतरनाक अनुरोधों को ब्लॉक करते हुए भी हानिरहित अनुरोधों को बहुत कम अस्वीकार किया।
यह अध्ययन इस बात पर प्रकाश डालता है कि हम सुरक्षित आर्टिफिशियल इंटेलिजेंस बनाने के बारे में कैसे सोच सकते हैं। केवल बाहरी फिल्टरों या मॉडल के पूरे मस्तिष्क को लगातार पुन: प्रशिक्षित करने पर निर्भर रहने के बजाय, यह कार्य सुझाव देता है कि सुरक्षा मॉडल की आंतरिक मशीनरी का एक अभिन्न हिस्सा हो सकती है। मॉडल को एक विशेष अवस्था ले जाने की अनुमति देकर जिसे स्थिति के आधार पर चालू या बंद किया जा सके, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो अनुकूलनीय और मजबूत दोनों है। परिणाम संकेत देते हैं कि यह विधि एक आशाजनक मार्ग प्रदान करती है, जहाँ सुरक्षा केवल बाहर से थोपा गया प्रतिबंध नहीं है, बल्कि एक क्षमता है जो मॉडल की अपनी मेमोरी और तर्क प्रक्रियाओं के भीतर स्वाभाविक रूप से विकसित होती है। हालाँकि शोधकर्ता नोट करते हैं कि यह एक प्रारंभिक अन्वेषण है और इस विजन को पूरी तरह से साकार करने के लिए और अधिक काम की आवश्यकता है, फिर भी ये निष्कर्ष एक ठोस प्रमाण प्रदान करते हैं कि सुरक्षा को मशीन के सोचने और याद रखने के तरीके के ताने-बाने में बुना जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।