← नवीनतम पेपर
💻 computer science

Amulet: a Python Library for Assessing Interactions Among ML Defenses and Risks

यह शोध पत्र एमुलेट (Amulet) का परिचय देता है, जो कि कई सुरक्षा, गोपनीयता और निष्पक्षता जोखिमों के बीच इच्छित और अनचाहे अंतर्संबंधों का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला व्यापक और विस्तार योग्य पायथन लाइब्रेरी है।

मूल लेखक: Asim Waheed, Vasisht Duddu, Sebastian Szyller

प्रकाशित 2026-09-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Asim Waheed, Vasisht Duddu, Sebastian Szyller

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, कंप्यूटर प्रोग्राम तेजी से उच्च-दांव वाले निर्णय ले रहे हैं, जैसे कि ऋण को मंजूरी देना या बीमारियों का निदान करना। इन प्रणालियों पर भरोसा करने के लिए, उन्हें हैकर्स से सुरक्षित, व्यक्तिगत गोपनीयता के प्रति सम्मानजनक और सभी लोगों के प्रति निष्पक्ष होना चाहिए, चाहे उनकी पृष्ठभूमि कुछ भी हो। पिछले एक दशक में, शोधकर्ताओं ने इनमें से प्रत्येक खतरे से निपटने के लिए विशिष्ट उपकरण विकसित किए हैं। उन्होंने ऐसी विधियाँ बनाईं जो हैकर्स को किसी सिस्टम को स्टॉप साइन (stop sign) को स्पीड लिमिट साइन के रूप में देखने के लिए धोखा देने से रोक सकें, ऐसी तकनीकें विकसित कीं जो बाहरी लोगों को यह अनुमान लगाने से रोक सकें कि क्या किसी विशिष्ट व्यक्ति के डेटा का उपयोग मॉडल को प्रशिक्षित करने के लिए किया गया था, और ऐसे एल्गोरिदम बनाए जो यह सुनिश्चित करें कि सिस्टम कुछ समूहों के खिलाफ भेदभाव न करे। हालाँकि, एक महत्वपूर्ण प्रश्न अनुत्तरित रह गया था: क्या होता है जब आप इन सभी सुरक्षा उपायों का एक साथ उपयोग करने की कोशिश करते हैं? जिस तरह कई दवाएं लेने से कभी-कभी अप्रत्याशित दुष्प्रभाव हो सकते हैं, उसी तरह एआई (AI) के लिए विभिन्न सुरक्षा उपायों को मिलाने से अनजाने में अन्य खतरों के खिलाफ इसकी रक्षा कमजोर हो सकती है या नई कमजोरियां पैदा हो सकती हैं।

शोधकर्ताओं की एक टीम ने इन छिपे हुए अंतर्संबंधों की जांच करने के लिए 'एम्यूलेट' (Amulet) नामक एक नया डिजिटल प्रयोगशाला बनाया है। यह सॉफ्टवेयर लाइब्रेरी वैज्ञानिकों को यह परीक्षण करने की अनुमति देती है कि विभिन्न सुरक्षा उपाय आपस में मिलने पर कैसा व्यवहार करते हैं, जिससे यह पता चलता है कि क्या एक समस्या के समाधान से अनजाने में दूसरी समस्या और खराब हो सकती है। इस टूल के अस्तित्व में आने से पहले, शोधकर्ताओं को इन संयोजनों का अध्ययन करने के लिए अलग-अलग, असंगत सॉफ्टवेयर पैकेज को जोड़ना पड़ता था, और अक्सर वे केवल एक प्रकार के जोखिम पर ध्यान केंद्रित करते थे। एम्यूलेट इन प्रयासों को एकीकृत करता है, जो सुरक्षा, गोपनीयता और निष्पक्षता को एक साथ परीक्षण करने का एक एकल, सुसंगत तरीका प्रदान करता है। शोधकर्ताओं ने इस नए सिस्टम का उपयोग करके सैकड़ों प्रयोग चलाए, जो छोटे इमेज-रिकग्निशन नेटवर्क से लेकर विशाल भाषा मॉडल (language models) तक फैले हुए थे जो मानव जैसा टेक्स्ट लिख सकते हैं। उनका कार्य इन सुरक्षा उपायों के बीच होने वाली अंतःक्रियाओं का पहला व्यवस्थित मानचित्र प्रदान करता है, जो यह दर्शाता है कि परिणाम शायद ही कभी सरल होते हैं और यह काफी हद तक उपयोग किए जाने वाले विशिष्ट डेटा और मॉडल पर निर्भर करता है।

एम्यूलेट का उपयोग करने से प्राप्त मुख्य खोज यह है कि सुरक्षा उपायों के बीच का संबंध अत्यधिक अप्रत्याशनीय है। शोधकर्ताओं ने पाया कि एक प्रकार के हमले से बचाने के लिए डिज़ाइन किया गया बचाव कभी-कभी मॉडल को पूरी तरह से अलग प्रकार के खतरे के प्रति संवेदनशील बना सकता है। उदाहरण के लिए, उन्होंने 'एडवर्सरियल ट्रेनिंग' (adversarial training) नामक एक तकनीक का परीक्षण किया, जिसका उद्देश्य मॉडल को उन हैकर्स के विरुद्ध मजबूत बनाना है जो थोड़ी बदली हुई छवियों के साथ इसे धोखा देने की कोशिश करते हैं। जबकि इसने उन विशिष्ट इमेज ट्रिक्स के खिलाफ मॉडल को सफलतापूर्वक मजबूत किया, शोधकर्ताओं ने देखा कि इसने मॉडल की गोपनीयता या निष्पक्षता में लगातार सुधार नहीं किया। कुछ मामलों में, इन बदलावों ने मॉडल को बाहरी व्यक्ति द्वारा इसके आंतरिक तर्क (internal logic) को चुराने के प्रति थोड़ा अधिक संवेदनशील बना दिया, जबकि अन्य मामलों में, इसका प्रभाव नगण्य था। परिणाम बताते हैं कि ऐसा कोई सार्वभौमिक नियम नहीं है कि एक क्षेत्र में मजबूत बचाव स्वतः ही पूरे सिस्टम को मजबूत बनाता है; इसके बजाय, प्रभाव सूक्ष्म होते हैं और डेटासेट तथा विशिष्ट मॉडल के आधार पर बहुत भिन्न होते हैं।

टीम ने यह भी पता लगाया कि गोपनीयता उपकरण सुरक्षा जोखिमों के साथ कैसे परस्पर क्रिया करते हैं। उन्होंने 'डिफरेंशियल प्राइवेसी' (differential privacy) नामक एक विधि लागू की, जो व्यक्तिगत डेटा बिंदुओं की सुरक्षा के लिए प्रशिक्षण प्रक्रिया में गणितीय शोर (mathematical noise) की एक परत जोड़ती है। वे यह देखना चाहते थे कि क्या यह गोपनीयता कवच सिस्टम में दुर्भावनापूर्ण डेटा डालने वाले हैकर्स को "बैकडोर" (backdoor) बनाने से रोकने में मदद करेगा—एक छिपा हुआ ट्रिगर जो मॉडल को एक निश्चित तरीके से व्यवहार करने के लिए मजबूर करता है। प्रयोगों ने एक सूक्ष्म वास्तविकता को प्रकट किया: गोपनीयता उपकरण ने बैकडोर को दबाने में मदद की, लेकिन केवल तभी जब दुर्भावनापूर्ण डेटा की मात्रा बहुत कम थी। जब हैकर्स ने जहरीले रिकॉर्ड (poisoned records) की बड़ी मात्रा डाली, तो गोपनीयता सुरक्षा प्रभावी रूप से गायब हो गई, और बैकडोर पूरी तरह से कार्यात्मक रहा। यह निष्कर्ष एक महत्वपूर्ण सीमा को उजागर करता है: एक बचाव जो नियंत्रित, कम जोखिम वाले परिदृश्य में अच्छा काम करता है, वह खतरे का स्तर बढ़ने पर पूरी तरह से विफल हो सकता है, एक ऐसा विवरण जिसे व्यापक स्थितियों के माध्यम से इन अंतःक्रियाओं का परीक्षण करने में सक्षम टूल के बिना पकड़ पाना आसान है।

शायद इस कार्य का सबसे महत्वपूर्ण योगदान यह प्रदर्शन है कि इन अंतःक्रियाओं का अध्ययन उस पैमाने पर किया जा सकता है जो पहले असंभव था। शोधकर्ताओं ने सफलतापूर्वक एक बड़े भाषा मॉडल (large language model) तक अपने परीक्षणों का विस्तार किया, जिसमें अरबों पैरामीटर हैं, जो आधुनिक चैटबॉट्स और लेखन सहायकों को शक्ति प्रदान करते हैं। उन्होंने दिखाया कि वही सॉफ्टवेयर लाइब्रेरी कैसे एक टेक्स्ट-आधारित बैकडोर हमले और गोपनीयता बचाव के बीच की अंतःक्रिया का मूल्यांकन कर सकती है। परिणामों ने छोटे मॉडलों में देखे गए पैटर्न को दोहराया लेकिन अधिक जटिलता के साथ, यह पुष्टि करते हुए कि अनपेक्षित अंतःक्रिया के सिद्धांत आज के सबसे उन्नत एआई सिस्टम पर भी लागू होते हैं। यह सिद्ध करके कि इन उपकरणों को नए प्रकार के डेटा और विशाल मॉडलों के अनुकूल बनाया जा सकता है, शोधकर्ताओं ने भविष्य के सुरक्षा परीक्षण के लिए एक आधार स्थापित किया है।

अध्ययन इस निष्कर्ष पर पहुँचता है कि आर्टिफिशियल इंटेलिजेंस की सुरक्षा को समझने के लिए अलग-अलग हिस्सों के बजाय पूरे सिस्टम को देखने की आवश्यकता है। शोधकर्ता इस बात पर जोर देते हैं कि हालांकि उन्होंने कई विशिष्ट अंतःक्रियाओं की पहचान की है, फिर भी यह क्षेत्र अभी सीख रहा है। उन्होंने पाया कि इन अनपेक्षित प्रभावों की शक्ति और दिशा विशिष्ट डेटासेट, मॉडल के आकार और प्रशिक्षण के दौरान उपयोग किए गए सेटिंग्स के आधार पर बदलती रहती है। इसका अर्थ यह है कि एक बचाव जो एक अनुप्रयोग के लिए पूरी तरह से काम करता है, वह दूसरे के लिए अप्रभावी या हानिकारक भी हो सकता है। एम्यूलेट लाइब्रेरी को एक जीवंत संसाधन के रूप में डिज़ाइन किया गया है, जो वैश्विक समुदाय को नए परीक्षण और बचाव जोड़ने की अनुमति देता है जैसे-जैसे वे खोजे जाते हैं। इन जटिल संबंधों को मापने का एक एकीकृत तरीका प्रदान करके, यह टूल यह सुनिश्चित करने में मदद करता है कि जैसे-जैसे हम अधिक शक्तिशाली और विश्वसनीय एआई का निर्माण करते हैं, हम यह स्पष्ट समझ रखते हैं कि हमारे सुरक्षा उपाय वास्तव में एक साथ कैसे काम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →