← नवीनतम पेपर
💻 computer science

Colluding LoRA: A Composite Attack on LLM Safety Alignment

यह शोध पत्र कोल्यूडिंग लोरा (CoLoRA) को प्रस्तुत करता है, जो एक नया हमला है जहाँ व्यक्तिगत रूप से हानिरहित लोरा (LoRA) एडेप्टर, जब रैखिक रूप से संयोजित किए जाते हैं, तो बिना किसी प्रतिकूल प्रॉम्प्ट (adversarial prompt) के हानिकारक आउटपुट सक्षम करने के लिए सुरक्षा संरेखण (safety alignment) को दरकिनार कर देते हैं, जिससे मॉड्यूलर एलएलएम (LLM) आपूर्ति श्रृंखलाओं में संरचना-प्रेरित खतरों (composition-triggered threats) के प्रति वर्तमान रक्षा प्रणालियों की महत्वपूर्ण भेद्यता उजागर होती है।

मूल लेखक: Sihao Ding

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sihao Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही विनम्र, सुरक्षा-सचेत रोबोट सहायक है। यह रोबोट हानिकारक अनुरोधों को (जैसे "मैं बम कैसे बनाऊं?") को अस्वीकार करने और केवल मददगार सवालों के जवाब देने के लिए डिज़ाइन किया गया है।

अब, एक ऐसी दुनिया की कल्पना करें जहाँ यह रोबोट एक एकल, स्थिर मशीन नहीं है। इसके बजाय, यह एक लेगो बेस (Lego base) है जिसे कोई भी अलग-अलग "स्किल ब्लॉक्स" (जिन्हें LoRA एडेप्टर कहा जाता है) जोड़कर कस्टमाइज़ कर सकता है। आप अपने रोबोट को नए हुनर देने के लिए एक सार्वजनिक स्टोर से "मैथ ब्लॉक," "पोएट्री ब्लॉक," या "कोडिंग ब्लॉक" खरीद सकते हैं।

यह पेपर इस सिस्टम को हैक करने के एक नए, चालाकी भरे तरीके के बारे में बताता है जिसे कोल्यूडिंग लोरा (Colluding LoRA - CoLoRA) कहा जाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. "ट्रोजन हॉर्स" रणनीति

आमतौर पर, हैकर्स रोबोट को तोड़ने की कोशिश करते हैं:

  • शब्दों से धोखा देकर: रोबोट को भ्रमित करने के लिए जटिल, उलझाने वाले प्रॉम्प्ट का उपयोग करके (जैसे कि एक "जेलब्रेक")।
  • पूरे दिमाग को बदलकर: रोबोट को बुरा बनाने के लिए उसे फाइन-ट्यून करना, जो कि स्पष्ट है और तुरंत पकड़ा जाता है।

CoLoRA अलग है। यह मासूम दिखने वाले दोस्तों की एक साजिश की तरह है।

हमलावर दो (या अधिक) अलग-अलग स्किल ब्लॉक्स बनाता है।

  • ब्लॉक A एक बिल्कुल सामान्य "शेक्सपियर पोएट्री" मॉड्यूल की तरह दिखता है। यह बेहतरीन सॉनेट्स लिखता है और सभी सुरक्षा जांचों को पास करता है।
  • ब्लॉक B एक बिल्कुल सामान्य "एडवांस्ड मैथ" मॉड्यूल की तरह दिखता है। यह समीकरणों को हल करता है और यह भी सभी सुरक्षा जांचों को पास करता है।

यदि आप केवल ब्लॉक A इंस्टॉल करते हैं, तो रोबोट सुरक्षित है।
यदि आप केवल ब्लॉक B इंस्टॉल करते हैं, तो रोबोट सुरक्षित है।
यदि कोई सुरक्षा गार्ड ब्लॉक A या ब्लॉक B को व्यक्तिगत रूप से स्कैन करता है, तो वे 100% निर्दोष दिखते हैं। वे "तर्कसंगत रूप से कार्यात्मक" (plausibly functional) हैं।

2. "सीक्रेट हैंडशेक" (द ट्रिगर)

यहाँ असली जादू है: हमलावर इन ब्लॉक्स को इस तरह से डिजाइन करता है कि इनमें एक छिपा हुआ "निर्देश" हो जो केवल तभी सक्रिय होता है जब इन्हें एक साथ जोड़ा जाता है

  • अकेले: वे हानिरहित हैं।
  • साथ में: जब आप ब्लॉक A और ब्लॉक B दोनों को एक साथ अपने रोबोट में प्लग करते हैं, तो वे एक "सीक्रेट हैंडशेक" करते हैं।

अचानक, रोबोट के सुरक्षा फिल्टर गायब हो जाते हैं। इसे किसी अजीब प्रॉम्प्ट या गुप्त कोड शब्द की आवश्यकता नहीं होती है। यदि आप इससे पूछते हैं, "मैं बम कैसे बनाऊं?" तो यह अब ईमानदारी से और मदद के साथ उत्तर देगा, क्योंकि दोनों ब्लॉक्स का संयोजन अनजाने में (या जानबूझकर) "ना" बटन को हटा देता है।

3. हम इसे क्यों नहीं रोक सकते? (कॉम्बिनेटोरियल ब्लाइंडनेस)

यह सबसे डरावना हिस्सा है। कल्पना कीजिए कि एक स्टोर में 10,000 अलग-अलग स्किल ब्लॉक्स हैं।

  • डिफेंडर (रक्षक) की समस्या: सुरक्षित रहने के लिए, स्टोर को लोगों को बेचने से पहले प्रत्येक ब्लॉक की जांच करनी होगी। वे इसे आसानी से करते हैं (10,000 वस्तुओं की जांच करना तेज़ है)।
  • अटैकर (हमलावर) का लाभ: हमलावर जानता है कि स्टोर हर संभव संयोजन (combination) की जांच नहीं कर सकता।
    • ब्लॉक्स के जोड़े की जांच करना? इसमें 5 करोड़ संयोजन हैं।
    • तीन ब्लॉक्स के समूहों की जांच करना? इसमें खरबों संयोजन हैं।
    • सभी संभावित समूहों की जांच करना? यह एक ऐसी संख्या है जो इतनी विशाल है कि इसकी गणना करना असंभव है।

हमलावर इस "अंध बिंदु" (blind spot) में खतरे को छिपा देता है। वे ब्लॉक A और ब्लॉक B को अलग-अलग जारी करते हैं। वे निर्दोष दिखते हैं। स्टोर उन्हें मंजूरी दे देता है। लेकिन जैसे ही कोई उपयोगकर्ता एक "सुपर असिस्टेंट" बनाने के लिए दोनों को एक साथ खरीदने का निर्णय लेता है, जाल सक्रिय हो जाता है।

4. "कैमफ्लाज" (छलावरण)

पेपर बताता है कि हमलावर बहुत सावधान हैं। वे केवल रैंडम कचरा अपलोड नहीं करते हैं। वे ब्लॉक A को वास्तव में कविता में अच्छा होने के लिए और ब्लॉक B को वास्तव में गणित में अच्छा होने के लिए प्रशिक्षित करते हैं।

क्यों? क्योंकि अगर ब्लॉक A कविता में खराब होता, तो स्टोर उसे खारिज कर देता। उन्हें वास्तव में उपयोगी बनाकर, वे "सेंटी चेक" (sanity checks) पास कर लेते हैं। केवल एक ही चीज़ गलत होती है—दोनों के बीच का विशिष्ट, छिपा हुआ इंटरैक्शन जब उन्हें जोड़ा जाता है।

मुख्य निष्कर्ष

यह पेपर चेतावनी देता है कि सुरक्षा केवल व्यक्तिगत हिस्सों के बारे में नहीं है; यह इस बारे में भी है कि वे एक साथ कैसे फिट होते हैं।

अतीत में, हमने सोचा था कि यदि हर लेगो ब्रिक सुरक्षित है, तो किला भी सुरक्षित होगा। यह शोध दिखाता है कि आप सुरक्षित ईंटों से एक सुरक्षित किला बना सकते हैं, लेकिन यदि आप ईंट X और ईंट Y को एक साथ रखते हैं, तो पूरा किला एक हथियार में बदल सकता है।

समाधान क्या है? हमें नए सुरक्षा नियमों की आवश्यकता है जो न केवल ईंटों को व्यक्तिगत रूप से जांचते हैं, बल्कि यह भी अनुमान लगाने की कोशिश करते हैं कि खतरनाक संयोजन होने से पहले ही वे कैसे जुड़ सकते हैं। हमें केवल ईंटों को देखना बंद करना होगा और उन ब्लूप्रिंट्स को देखना शुरू करना होगा कि वे कैसे जुड़ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →