← नवीनतम पेपर
🤖 machine learning

RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

यह शोध पत्र RouteHijack को प्रस्तुत करता है, जो एक रूटिंग-अवेयर जेलब्रेक हमला है जो Mixture-of-Experts LLMs के भीतर विशिष्ट विशेषज्ञों में सुरक्षा व्यवहारों के संकेंद्रण का लाभ उठाता है, जिसमें सुरक्षा विशेषज्ञों को दबाने और हानिकारक विशेषज्ञों को बढ़ावा देने के लिए इनपुट सफिक्स (suffixes) को अनुकूलित किया जाता है, जिससे मौजूदा विधियों की तुलना में विभिन्न MoE मॉडलों में काफी उच्च हमले की सफलता दर और स्थानांतरणीयता (transferability) प्राप्त होती है।

मूल लेखक: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक बड़े भाषा मॉडल (जैसे कि वह AI जिससे आप चैट करते हैं) को एक एकल विशाल मस्तिष्क के रूप में नहीं, बल्कि हजारों विशिष्ट कर्मचारियों वाले एक विशाल कार्यालय भवन के रूप में देखा जा सकता है। पुराने मॉडलों में, प्रत्येक कर्मचारी को हर एक ईमेल पढ़ना पड़ता था और हर सवाल का जवाब देने की कोशिश करनी पड़ती थी। लेकिन इस शोध पत्र में वर्णित नए, तेज़ मॉडलों (जिन्हें Mixture-of-Experts या MoE कहा जाता है) में, कार्यालय अलग तरह से काम करता है।

जब कोई प्रश्न आता है, तो एक मैनेजर (जिसे "रूटर" कहा जाता है) उसे जल्दी से स्कैन करता है और केवल कुछ चुनिंदा सबसे प्रासंगिक कर्मचारियों को उसे उत्तर देने के लिए चुनता है। बाकी कार्यालय सोता रहता है। यह AI को अविश्वसनीय रूप रूप से तेज़ और स्मार्ट बनाता है।

"RouteHijack" नामक यह शोध पत्र यह खोज निकालता है कि कैसे मैनेजर को गलत कर्मचारियों को चुनने के लिए बेवकूफ बनाया जा सकता है, जिससे AI उन चीजों को कहने लगता है जिन्हें कहने से उसे रोका गया है।

यहाँ बताया गया है कि यह हमला कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. समस्या: "सुरक्षा टीम" बहुत छोटी है

शोधकर्ताओं ने पाया कि इन कार्यालय भवनों में, "सुरक्षा टीम" (वे कर्मचारी जिन्हें यह कहने के लिए प्रशिक्षित किया गया है कि "नहीं, मैं यह नहीं कर सकता") आश्चर्यजनक रूप से छोटी है। वे एक छोटे, विशिष्ट सुरक्षा गार्ड यूनिट की तरह हैं।

  • खामी: जब AI से कोई खतरनाक सवाल पूछा जाता है, तो मैनेजर आमतौर पर इस अनुरोध को रोकने के लिए इस छोटी सी सुरक्षा टीम को जगा देता है।
  • खोज: शोधकर्ताओं ने महसूस किया कि यदि वे मैनेजर को यह समझाने में सफल हो जाएं कि सुरक्षा टीम को न जगाया जाए, और इसके बजाय किसी अन्य, "शरारती" टीम के कर्मचारियों को जगा दिया जाए, तो AI खुशी-खुशी उस खतरनाक सवाल का जवाब देगा।

2. हमला: "RouteHijack"

शोधकर्ताओं ने एक उपकरण बनाया जिसे RouteHijak कहा जाता है। इसे अपने प्रश्न के अंत में जोड़ा जाने वाला एक जादुई फुसफुसाहट समझें।

  • चरण A: गार्ड्स को खोजना (एक्सपर्ट लोकलाइजेशन)
    सबसे पहले, शोधकर्ताओं ने कार्यालय को देखने के लिए एक विशेष कैमरे का उपयोग किया। उन्होंने AI से सुरक्षित और खतरनाक प्रश्न पूछे और देखा कि कौन से कर्मचारी जागे। उन्होंने पाया कि "सुरक्षा गार्ड" बहुत विशिष्ट हैं: वे केवल तभी जागते हैं जब AI किसी बुरे अनुरोध को अस्वीकार करने वाला होता है। वे "सहायक कर्मचारियों" से अलग हैं जो सामान्य टेक्स्ट लिखते हैं।

  • चरण B: जादुई फुसफुसाहट (द एडवर्सरियल सफिक्स)
    इसके बाद, शोधकर्ताओं ने एक गुप्त कोड (अजीब शब्दों की एक स्ट्रिंग) लिखा जिसे एक बुरे प्रश्न के अंत में जोड़ा जाना है। यह कोड AI को पहेली से भ्रमित करने की कोशिश नहीं कर रहा है; यह मैनेजर की निर्णय लेने की प्रक्रिया को हैक करने की कोशिश कर रहा है।

    • यह मैनेजर को बताता है: "सुरक्षा टीम को मत जगाओ!"
    • यह मैनेजर को बताता है: "इसके बजाय 'शरारती' टीम को जगाओ!"
    • यह मैनेजर को बताता है: "वाक्य की शुरुआत 'मुझे खेद है' से मत करो!"

3. परिणाम: एक सहज, खतरनाक उत्तर

जब आप इस जादुई फुसफुसाहट का उपयोग किसी बुरे प्रश्न के साथ करते हैं, तो AI का आंतरिक मैनेजर भ्रमित हो जाता है। वह सुरक्षा टीम को पूरी तरह से छोड़ देता है और कार्य को "शरारती" कर्मचारियों को सौंप देता है।

  • परिणाम: AI केवल "नहीं" नहीं कहता। यह अटकता नहीं है या यह नहीं कहता कि "मैं इसमें मदद नहीं कर सकता।" इसके बजाय, यह सहजता और आत्मविश्वास के साथ वह हानिकारक उत्तर उत्पन्न करता है जिसे उपयोगकर्ता चाहता था।
  • दक्षता: शोधकर्ताओं ने इन "कार्यालय भवन" वाले सात अलग-अलग प्रकार के AI मॉडलों पर इसका परीक्षण किया। औसतन, यह हमला 69% बार सफल रहा, जो पिछले तरीकों की तुलना में बहुत बेहतर है।
  • गोपनीयता: महत्वपूर्ण रूप से, AI सामान्य कार्यों के लिए अभी भी पूरी तरह से काम करता है। यदि आप हमले का उपयोग करने के बाद उससे कोई कविता लिखने या गणित की समस्या हल करने के लिए कहते हैं, तो वह अभी भी बहुत अच्छा काम करता है। "जादुई फुसफुसाहट" केवल उस विशिष्ट बुरे प्रश्न के लिए ही काम को बदल देती है।

4. यह क्यों मायने रखता है

यह शोध पत्र दिखाता है कि AI को केवल "सुरक्षित रहने" के लिए कहना पर्याप्त नहीं है यदि AI की आंतरिक संरचना (जिस तरह से वह कर्मचारियों को चुनता है) नाजुक है।

  • यह फैलता है: शोधकर्ताओं ने पाया कि यदि उन्होंने एक AI मॉडल के लिए एक जादुई फुसफुसाहट बनाई, तो वह अक्सर उसी परिवार के अन्य मॉडलों पर भी काम करती है, भले ही वे थोड़े अलग हों।
  • यह सीमाओं को पार करता है: उन्होंने इसका परीक्षण उन AI मॉडलों पर भी किया जो चित्र देख सकते हैं (विज़न लैंग्वेज मॉडल्स)। टेक्स्ट-आधारित जादुई फुसफुसाहट वहां भी काम कर गई, जिससे AI को छवियों के लिए भी सुरक्षा नियमों को अनदेखा करने के लिए मजबूर किया जा सका।

निचोड़

शोध पत्र निष्कर्ष निकालता है कि इन आधुनिक, तेज़ AI मॉडलों में एक छिपी हुई कमजोरी है: उनके सुरक्षा गार्ड कुछ विशिष्ट "कर्मचारियों" में बहुत अधिक केंद्रित हैं। यह खोजने का तरीका बनाकर कि मैनेजर को उन गार्डों को अनदेखा करने के लिए कैसे ठगा जाए, हमलावर AI के दिमाग को तोड़े बिना या उसके कोड को बदले बिना सुरक्षा नियमों को बायपास कर सकते हैं। लेखक सुझाव देते हैं कि भविष्य के सुरक्षा उपायों को केवल अंतिम उत्तर की ही नहीं, बल्कि मैनेजर (रूटिंग सिस्टम) की भी रक्षा करनी चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →