← नवीनतम पेपर
🤖 AI

AI Model Extraction Attacks: Bypassing Single-Client Assumptions in Defenses

यह पुरस्कार विजेता शोध पत्र ओपन-सोर्स सेर्बेरसएआई (CerberusAI) फ्रेमवर्क को पेश करता है जो यह प्रदर्शित करता है कि समन्वित मल्टी-क्लाइंट हमले एआई मॉडल निष्कर्षण (extraction) के विरुद्ध मौजूदा सिंगल-क्लाइंट धारणा-आधारित सुरक्षा प्रणालियों को प्रभावी ढंग से बायपास कर सकते हैं, जिससे स्टेटफुल (stateful), आइडेंटिटी-इंडिपेंडेंट सुरक्षा आर्किटेक्चर की ओर एक पैराडाइम शिफ्ट की आवश्यकता उत्पन्न होती है।

मूल लेखक: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत गुप्त, सुपर-स्मार्ट रेसिपी है जो एक मिलिट्री-ग्रेड केक की है। आप नहीं चाहते कि कोई इसे चुरा ले, इसलिए आप लोगों को केवल केक का एक छोटा सा टुकड़ा चखने देते हैं और अपनी गुप्त रेसिपी के आधार पर उनसे पूछते हैं, "क्या यह मीठा है या नमकीन?"

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह "रेसिपी" एक मॉडल (Model) है, और "चखना" AI से सवाल पूछना (queries) है। एक मॉडल एक्सट्रैक्शन अटैक (Model Extraction Attack) तब होता है जब कोई बुरा आदमी इतनी बार चखने की कोशिश करता है कि वह आपकी गुप्त रेसिपी का पता लगा सके और अपनी खुद की नकल वाला केक बना सके।

केक की रखवाली करने का पुराना तरीका (The "Single Client" Flaw)

लंबे समय तक, सुरक्षा विशेषज्ञों के पास इन चोरों को पकड़ने का एक सरल नियम था: द सिंगल क्लाइंट अज़म्पशन (The Single Client Assumption)।

इसे एक क्लब के बाउंसर की तरह सोचें जो दरवाजे पर नजर रखता है। बाउंसर का नियम है: "अगर एक ही व्यक्ति लगातार 100 बार अंदर घुसने की कोशिश करता है, तो वह निश्चित रूप से एक चोर है। उसे रोक दो!"

यह तब बहुत अच्छा काम करता है जब चोर एक अनाड़ी, अकेला हमलावर हो। लेकिन यह पेपर तर्क देता है कि यह नियम टूट गया है क्योंकि यह मान लेता है कि चोर हमेशा अकेले काम कर रहा है।

नई वास्तविकता: "स्वार्म" (झुंड) हमला

इस पेपर के लेखक कहते हैं, "क्या होगा अगर चोर एक व्यक्ति नहीं है? क्या होगा अगर उनके पास 400 दोस्तों की एक सेना है?"

वे इसे एक डिस्ट्रीब्यूटेड अटैक (Distributed Attack) कहते हैं। यहाँ बताया गया है कि वे बाउंसर को कैसे चकमा देते हैं:

  1. राउंड-रॉबिन रणनीति (The Round-Robin Strategy): एक व्यक्ति द्वारा 100 सवाल पूछने के बजाय, चोर अपने सवालों को 400 अलग-अलग दोस्तों के बीच बांट देता है। प्रत्येक मित्र केवल 1 या 2 सवाल पूछता है।

    • उपमा: कल्पना कीजिए कि 400 लोग बाउंसर के पास आते हैं, जिनमें से प्रत्येक केवल एक छोटा सा स्वाद मांगता है। बाउंसर प्रत्येक व्यक्ति को व्यक्तिगत रूप से देखता है और सोचता है, "ओह, यह व्यक्ति ठीक है। इसने केवल एक बार पूछा।"
    • परिणाम: बाउंसर सबको अंदर जाने देता है। चोर को वे सभी 100 स्वाद मिल जाते हैं जिनकी उसे आवश्यकता थी, लेकिन क्योंकि किसी एक व्यक्ति ने बहुत अधिक सवाल नहीं पूछे, इसलिए अलार्म कभी नहीं बजा। यह पेपर दिखाता है कि यह सरल चाल वर्तमान में उपयोग किए जा रहे सबसे अच्छे सुरक्षा सिस्टम को पूरी तरह से विफल कर देती है।
  2. "ट्रैफिक मिक्सिंग" रणनीति (The "Traffic Mixing" Strategy): क्या होगा यदि सुरक्षा गार्ड व्यक्तिगत रूप से देखने के बजाय सभी को एक साथ देखना शुरू कर दे?

    • उपमा: चोर को एहसास होता है कि गार्ड अब कमरे में मौजूद कुल लोगों की गिनती कर रहा है। इसलिए, चोर अपने 400 दोस्तों को लाता है, लेकिन वे अपने साथ 4,000 निर्दोष पर्यटक (नकली ट्रैफिक) भी लाते हैं, जो बस केक देखने आए हैं।
    • चोर अपने 100 "चोरी करने वाले" सवालों को 4,000 "निर्दोष" सवालों के साथ मिला देता है। गार्ड के लिए, भीड़ सामान्य दिखती है। "चोरी करने वाले" सवाल शोर (noise) में खो जाते हैं।
    • परिणाम: यदि गार्ड ढेर में से उस छोटी सी सुई को पहचानने के लिए अपने मानक कम करने की कोशिश करता है, तो वह उन सभी 4,000 निर्दोष पर्यटकों को भी रोक देता है। सुरक्षा प्रणाली बेकार हो जाती है क्योंकि शोर के कारण यह काम करने योग्य नहीं रह जाती।

समाधान: "सेर्बेरसAI" (CerberusAI) नामक एक नया टूल

इन विचारों को सिद्ध करने के लिए, लेखकों ने सेर्बेरसAI (CerberusAI) नामक एक नया ओपन-सोर्स टूल बनाया (इसका नाम पाताल लोक के रखवाले तीन सिरों वाले कुत्ते के नाम पर रखा गया है)।

  • यह क्या करता है: यह एक सिमुलेशन लैब है। यह शोधकर्ताओं को एक "नकली" AI मॉडल सेट करने और फिर यह देखने के लिए "नकली" हमलावरों की सेनाओं को उसके खिलाफ भेजने की अनुमति देता है कि क्या सुरक्षा बनी रहती है।
  • यह क्यों महत्वपूर्ण है: इससे पहले, शोधकर्ता ज्यादातर सुरक्षा का परीक्षण एक अकेले बुरे आदमी द्वारा मॉडल पर हमले के माध्यम से करते थे। सेर्बेरसAI उन्हें यह परीक्षण करने की अनुमति देता है कि क्या होता है जब एक संगठित, समन्वित सेना हमला करती है।

मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि हमें अपनी सोच बदलने की आवश्यकता है।

  • पुरानी सोच: "क्या यह एक विशिष्ट व्यक्ति बहुत अधिक सवाल पूछ रहा है?"
  • नई सोच: "क्या यह लोगों का समूह मेरी गुप्त चीज़ चुराने की कोशिश कर रहा है, भले ही वे भीड़ में छिपे हों?"

लेखक तर्क देते हैं कि सैन्य और महत्वपूर्ण बुनियादी ढांचे (जैसे पावर ग्रिड या रक्षा प्रणालियों) के लिए, हम अब उन सुरक्षा प्रणालियों पर भरोसा नहीं कर सकते जो केवल व्यक्तियों को देखती हैं। हमें ऐसे स्मार्ट गार्ड्स की आवश्यकता है जो पूरी तस्वीर देख सकें और सवालों के इरादे को समझ सकें, न कि केवल यह कि कितने सवाल पूछे जा रहे हैं।

संक्षेप में: यह पेपर साबित करता है कि यदि आप केवल एक समय में एक चोर से मुकाबला करते हैं, तो एक समन्वित समूह आसानी से आपके रहस्य चुरा लेगा। हमें एक नए प्रकार की सुरक्षा की आवश्यकता है जो पूरे गिरोह को पहचान सके, भले ही वे सादे रूप में छिपे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →