← नवीनतम पेपर
🤖 machine learning

Low Rank Adaptation for Adversarial Perturbation

यह शोध पत्र प्रदर्शित करता है कि एडवर्सरियल परटर्बेशन्स (adversarial perturbations) में एक अंतर्निहित लो-रैंक संरचना होती है और इस गुण का लाभ उठाकर एक अधिक कुशल और प्रभावी ब्लैक-बॉक्स अटैक पद्धति विकसित करने के लिए परटर्बेशन की खोज को एक लो-डायमेंशनल सबस्पेस तक सीमित करता है।

मूल लेखक: Han Liu, Shanghao Shi, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Liu, Shanghao Shi, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "गुप्त शॉर्टकट" की खोज

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान सुरक्षा गार्ड (एक AI मॉडल) को एक इमारत में घुसने के लिए एक चोर (एक दुर्भावनापूर्ण इनपुट) को धोखा देने की कोशिश कर रहे हैं। AI की दुनिया में, इसे एडवर्सरियल अटैक (adversarial attack) कहा जाता है।

आमतौर पर, गार्ड को धोखा देने के लिए, आपको हजारों अलग-अलग भेष (perturbations) आज़माने पड़ते हैं जब तक कि आपको कोई ऐसा न मिल जाए जो काम कर जाए। यह धीमा, महंगा है, और अक्सर आपको पकड़ा जाता है क्योंकि आप गार्ड से बहुत अधिक सवाल पूछ रहे होते हैं।

लेखकों ने एक आश्चर्यजनक रहस्य खोजा है: आपको हर संभव भेष आज़माने की ज़रूरत नहीं है।

उन्होंने पाया कि इन AI मॉडलों को मूर्ख बनाने के लिए आवश्यक "ट्रिक्स" वास्तव में बहुत सरल हैं। वे संभावनाओं की विशाल, जटिल दुनिया के भीतर एक बहुत छोटे, कम-आयामी (low-dimensional) "शॉर्टकट" में मौजूद हैं। यह ऐसा है जैसे यह महसूस करना कि एक विशाल, हाई-टेक तिजोरी को खोलने के लिए, आपको अरबों अंकों वाले लॉक के हर कॉम्बिनेशन को आज़माने की ज़रूरत नहीं है; आपको केवल तीन विशिष्ट टंबलर्स (tumblers) को हिलाने की आवश्यकता है।

प्रेरणा: LoRA ("स्टिकी नोट" विधि)

यह पेपर लार्ज लैंग्वेज मॉडल्स (LLMs) की एक अवधारणा LoRA (लो-रैंक अडैप्टेशन) से शुरू होता है।

  • पुराना तरीका: किसी विशाल AI को नया कौशल सिखाने के लिए, पहले आपको उसका पूरा मस्तिष्क (सभी वेट्स/weights) फिर से लिखना पड़ता था। यह एक नया तथ्य जोड़ने के लिए पूरी विश्वकोश (encyclopedia) को फिर से लिखने जैसा है। इसमें बहुत समय लगता है और यह बहुत महंगा है।
  • LoRA का तरीका: शोधकर्ताओं ने महसूस किया कि किसी चीज़ को नया सिखाने के लिए आपको मौजूदा पन्नों पर केवल कुछ "स्टिकी नोट्स" (low-rank matrices) चिपकाने की आवश्यकता होती है। यह सस्ता, तेज़ और कुशल है।

लेखकों ने पूछा: "यदि AI सीखने में ये 'स्टिकी नोट' वाले शॉर्टकट हैं, तो क्या AI को तोड़ने के लिए इस्तेमाल किए जाने वाले ट्रिक्स (adversarial perturbations) में भी शॉर्टकट होते हैं?"

खोज: "लो-रैंक" संरचना

पेपर यह सिद्ध करता है कि हाँ, वे होते हैं।

जब एक हमलावर AI को धोखा देने की कोशिश करता है, तो वे इमेज या टेक्स्ट में जो बदलाव करते हैं वे यादृच्छिक (random) अराजकता नहीं होते। वे अत्यधिक संगठित होते हैं और "मैथ स्पेस" के एक बहुत छोटे क्षेत्र में केंद्रित होते हैं।

  • उपमा (Analogy): कल्पना कीजिए कि एक विशाल महासागर है (AI का इनपुट स्पेस)। अधिकांश लोग सोचते हैं कि हमलावर को लहर बनाने के लिए पूरे महासागर को हिलाना होगा। लेखकों ने पाया कि AI को गिराने के लिए पर्याप्त बड़ी लहर बनाने के लिए आपको केवल एक छोटा, विशिष्ट गड्ढा (puddle) हिलाने की आवश्यकता है।

उन्होंने गणितीय रूप से इसे सिद्ध किया और कई अलग-अलग AI मॉडलों (जैसे पक्षियों, कारों या सामान्य वस्तुओं को पहचानने वाले मॉडल) के डेटा के माध्यम से इसे दिखाया।

समाधान: "शैडो मैप" अटैक

चूंकि हमलावरों को आमतौर पर AI के आंतरिक मस्तिष्क का पता नहीं होता है (इसे ब्लैक-बॉक्स सेटिंग कहा जाता है), वे आसानी से इस "गड्ढे" को नहीं ढूंढ सकते जिसे हिलाना है। उन्हें आमतौर पर अंधेरे में अनुमान लगाना पड़ता है, जिसमें लाखों प्रयास लगते हैं।

लेखकों ने इस शॉर्टकट को बिना मस्तिष्क देखे खोजने के लिए एक नया तरीका बनाया:

  1. शैडो मॉडल (The Shadow Model): हमलावर एक अलग, सार्वजनिक रूप से उपलब्ध AI मॉडल (एक "रेफरेंस मॉडल") और कुछ रैंडम तस्वीरें (एक "ऑक्सिलरी डेटासेट") का उपयोग करता है जो लक्ष्य (target) के समान भी नहीं हैं।
  2. अनुवादक (The Translator): वे इस शैडो मॉडल का उपयोग यह पता लगाने के लिए करते हैं कि इनपुट के कौन से हिस्से निर्णय लेने के लिए सबसे महत्वपूर्ण हैं। वे शोर (noise) को फ़िल्टर करने के लिए "एक्सप्लेनेबल AI" टूल्स (जैसे एक टॉर्च जो दिखाती है कि कौन से पिक्सेल सबसे अधिक मायने रखते हैं) का उपयोग करते हैं।
  3. संपीड़न (The Compression): वे इन महत्वपूर्ण ट्रिक्स के "आकार" को सीखने के लिए एक विशेष टूल (एक ऑटोएनकोडर) को प्रशिक्षित करते हैं। यह एक लो-रैंक सबस्पेस (Low-Rank Subspace) बनाता है—जो शॉर्टकट का एक संपीड़ित मानचित्र (compressed map) है।
  4. हमला (The Attack): पूरे महासागर में अंदाज़ा लगाने के बजाय, हमलावर अब केवल इस छोटे, संपीड़ित मानचित्र के भीतर पानी को हिलाता है।

परिणाम: तेज़, सस्ता, शक्तिशाली

जब उन्होंने मानक हमलों के खिलाफ इस नई विधि का परीक्षण किया:

  • गति (Speed): यह नाटकीय रूप से तेज़ था। कुछ मामलों में, AI को धोखा देने के लिए इसे 90% कम सवालों (queries) की आवश्यकता पड़ी।
  • छिपना (Stealth): ट्रिक्स अधिक सूक्ष्म थे, जिसका अर्थ है कि AI को कम स्पष्ट विरूपण (distortion) के साथ मूर्ख बनाया गया।
  • बहुमुखी प्रतिभा (Versatility): यह तब भी काम कर गया जब "शैडो मॉडल" और "रैंडम तस्वीरें" लक्ष्य AI से पूरी तरह से अलग थीं (उदाहरण के लिए, पक्षियों की पहचान करने वाले AI को धोखा देने के लिए चेहरों की तस्वीरों का उपयोग करना)।

यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर मुख्य रूप से दो चीजों पर ध्यान केंद्रित करता है:

  1. बेहतर हमले: यह शोधकर्ताओं के लिए यह परीक्षण करना बहुत आसान और सस्ता बनाता है कि AI सिस्टम कितने असुरक्षित हैं। यदि आप कम संसाधनों के साथ तेज़ी से एक सिस्टम को तोड़ सकते हैं, तो आप खामियों को तेज़ी से ढूंढ सकते हैं।
  2. बेहतर बचाव: क्योंकि ये हमले इतने कुशल हैं, यह सुझाव देता है कि वर्तमान बचाव उतने मजबूत नहीं हो सकते जितना कि हम सोचते हैं। इसके अलावा, यह समझना कि हमले एक "छोटे स्थान" में रहते हैं, उस छोटे स्थान को विशेष रूप से ब्लॉक करने के लिए बचाव बनाने में मदद कर सकता है, जिससे मेमोरी और कंप्यूटिंग पावर की बचत होती है।

संक्षेप में: इस पेपर ने खोजा कि AI को तोड़ना हमारी सोच से कहीं अधिक आसान है क्योंकि सिस्टम में "दरारें" छोटी और व्यवस्थित हैं। उन दरारों का मानचित्र पाकर, हमलावर बहुत तेज़ी से और कम प्रयास के साथ अंदर घुस सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →