DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
यह शोध पत्र DarkLLM को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो विविध विजन और मल्टीमॉडल फाउंडेशन मॉडल्स में हमलों को एकीकृत और स्केल करने के लिए, प्राकृतिक भाषा के निर्देशों को बहुमुखी, उच्च-प्रभावकारिता वाले एडवरसैरियल परटर्बेशन्स (adversarial perturbations) में अनुवादित करने हेतु 1B-पैरामीटर वाले लार्ज लैंग्वेज मॉडल का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो दुनिया को "देख" सकता है। यह वस्तुओं की पहचान कर सकता है, दृश्यों का वर्णन कर सकता है, और यहाँ तक कि किसी फोटो में चीजों के चारों ओर रूपरेखा (outlines) भी खींच सकता है। आधुनिक AI मॉडल (जैसे CLIP, SAM, या ChatGPT) यही करते हैं।
वर्षों से, सुरक्षा शोधकर्ताओं ने इन रोबोटों को धोखा देने की कोशिश की है—तस्वीरों में अदृश्य "शोर" (noise) के छोटे-छोटे कण जोड़कर—जैसे कि कैमरे के लेंस पर जमी धूल, जो इतनी सूक्ष्म होती है कि इंसान उन्हें देख नहीं सकते, लेकिन वे रोबोट को पूरी तरह भ्रमित कर देती हैं।
पुराने तरीकों की समस्या
पहले, ऐसे "धूल के कणों" को बनाना ऐसा था जैसे हर एक ताले के लिए एक अलग मास्टर चाबी की आवश्यकता हो। यदि आप कारों को पहचानने वाले रोबोट को बेवकूफ बनाना चाहते थे, तो आपको एक विशिष्ट चाबी चाहिए थी। यदि आप चाहते थे कि कोई रोबोट रूपरेखा खींचे, तो आपको एक बिल्कुल अलग चाबी चाहिए थी। यदि आप चाहते थे कि कोई रोबोट अंग्रेजी बोले, तो आपको एक और अलग चाबी चाहिए थी। यह धीमा, कठोर था और नए प्रकार के रोबोटों के अनुकूल आसानी से नहीं बदल सकता था।
नया समाधान: DarkLLM
यह पेपर DarkLLM को पेश करता है, जो इन AI मॉडलों पर हमला करने का एक नया तरीका है। जटिल गणितीय सूत्रों का उपयोग करके "धूल के कणों" की गणना करने के बजाय, शोधकर्ताओं ने एक लार्ज लैंग्वेज मॉडल (एक AI जो मानवीय भाषा समझता है) को "मास्टर कीमेकर" (मास्टर चाबी बनाने वाला) बनने के लिए प्रशिक्षित किया।
यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) का उपयोग करते हैं:
1. "जादुई अनुवादक" (The LLM Controller)
एक अत्यधिक कुशल अनुवादक की कल्पना करें जो "मानव" और "रोबोट तोड़फोड़" (Robot Sabotage) दोनों बोल सकता है।
- पुराना तरीका: आपको हर उस विशिष्ट रोबोट के लिए एक जटिल गणितीय समीकरण लिखना पड़ता था जिसे आप बेवकूफ बनाना चाहते थे।
- DarkLLM का तरीका: आप बस साधारण अंग्रेजी में अनुवादक से बात करते हैं।
- आप कहते हैं: "इस रोबोट को ऐसा सोचने पर मजबूर करो कि बिल्ली की तस्वीर वास्तव में एक कुत्ता है।"
- या: "इस रोबोट को इस तस्वीर में कुछ भी देखने से रोक दो।"
- या: "इस रोबोट को बिल्ली की रूपरेखा खींचने में विफल होने दें, और साथ ही इसे यह सोचने पर मजबूर करें कि बिल्ली एक कुत्ता है।"
अनुवादक (LLM) आपके इरादे को समझता है और तुरंत आपके शब्दों को हमले के एक गुप्त "ब्लूप्रिंट" में बदल देता है।
2. "अदृश्य चित्रकार" (The Perturbation Generator)
एक बार जब अनुवादक ब्लूप्रिंट बना लेता है, तो सिस्टम का दूसरा हिस्सा एक अदृश्य चित्रकार की तरह कार्य करता है। यह उस ब्लूप्रिंट को लेता है और चित्र पर सूक्ष्म, अदृश्य "धूल के कण" पेंट करता है।
- क्योंकि अनुवादक आपके विशिष्ट निर्देश (जैसे, "इसे सेगमेंट करने में विफल करें") को समझ गया है, इसलिए चित्रकार जानता है कि उस विशिष्ट परिणाम को प्राप्त करने के लिए किस प्रकार की धूल लगानी है।
3. "यूनिवर्सल रिमोट"
DarkLLM का सबसे शक्तिशाली हिस्सा यह है कि यह एक यूनिवर्सल रिमोट कंट्रोल की तरह काम करता है।
- एक निर्देश, कई लक्ष्य: आप एक ही निर्देश का उपयोग छवियों को पहचानने वाले रोबट, रूपरेखा खींचने वाले रोबोट, या आपसे बात करने वाले रोबोट को धोखा देने के लिए कर सकते हैं।
- क्रॉस-मॉडल जादू: पेपर दिखाता है कि DarkLLM द्वारा बनाया गया एक एकल "धूल का कण" एक ही समय में कारों को पहचानने वाले रोबोट, रूपरेखा खींचने वाले रोबोट और चैट करने वाले रोबोट, सबको धोखा दे सकता है। इसने एक ऐसा "कमजोर बिंदु" खोज निकाला है जो उन सभी में मौजूद है।
उन्होंने क्या सिद्ध किया?
शोधकर्ताओं ने इस सिस्टम का परीक्षण 13 अलग-अलग डेटासेट्स और 15 अलग-अलग AI मॉडलों (प्रसिद्ध CLIP, SAM और व्यावसायिक चैटबॉट्स जैसे GPT-4o और Gemini सहित) पर किया।
- यह काम करता है: उन्होंने दिखाया कि केवल एक वाक्य टाइप करके जैसे कि "रोबोट को इस छवि को पहचानने में विफल करें," सिस्टम सफलतापूर्वक एक ऐसी छवि बना सका जिसने रोबोट को भ्रमित कर दिया।
- यह लचीला है: वे विशिष्ट ट्रिक्स (जैसे "दिखावा करो कि यह एक कुत्ता है") या सामान्य ट्रिक्स (जैसे "रोबोट को तोड़ दो") के लिए पूछ सकते थे, और सिस्टम ने दोनों को संभाला।
- यह डरावना है (सुरक्षा के लिहाज से अच्छा): यह तथ्य कि एक सरल भाषा निर्देश इतने कई प्रकार के उन्नत AI को तोड़ सकता है, यह सुझाव देता है कि ये शक्तिशाली मॉडल एक सामान्य भेद्यता (vulnerability) साझा करते हैं।
मुख्य निष्कर्ष (The Bottom Line)
DarkLLM एक ऐसा उपकरण है जो प्राकृतिक भाषा को AI के विरुद्ध एक हथियार में बदल देता है। AI को हैक करने के लिए गणित में पीएचडी करने के बजाय, आपको बस यह जानने की आवश्यकता है कि कैसे सवाल पूछा जाए। यह पेपर प्रदर्शित करता है कि यदि आप अंग्रेजी में यह वर्णन कर सकते हैं कि आप किसी AI के साथ क्या करना चाहते हैं, तो आप संभवतः उसे बिल्कुल वही करने के लिए मजबूर कर सकते हैं, भले ही वह वह AI न हो जिस पर आपने टूल को प्रशिक्षित किया था।
लेखक इस बात पर जोर देते हैं कि यह एक सुरक्षा उपकरण (safety tool) है। जिस तरह आपको एक बेहतर ताला बनाने के लिए उसे तोड़ने का तरीका जानना आवश्यक है, यह शोध डेवलपरों को यह समझने में मदद करता है कि इन शक्तिशाली AI सिस्टम को कितनी आसानी से धोखा दिया जा सकता है, ताकि वे बेहतर सुरक्षा बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।