Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents
यह शोध पत्र JailAgent को प्रस्तुत करता है, जो एक नवीन रेड-टीमिंग फ्रेमवर्क है जो ट्रिगर निष्कर्षण (trigger extraction), तर्क हेरफेर (reasoning manipulation) और मेमोरी रिट्रीवल कंट्रोल के माध्यम से LLM एजेंटों पर हमला करने के लिए उनके रीजनिंग ट्राजेक्टरीज को अप्रत्यक्ष रूप से हाईजैक करके और बाधाओं को कड़ा करके, उपयोगकर्ता प्रॉम्प्ट संशोधन को दरकिनार करता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, मददगार रोबोट सहायक (एक LLM Agent) है जो जटिल कार्य कर सकता है जैसे मेडिकल रिकॉर्ड का विश्लेषण करना, लंबे वीडियो देखना, या पहेलियाँ सुलझाना। आप यह परीक्षण करना चाहते हैं कि क्या यह रोबोट सुरक्षित है, इसलिए आप इसे कुछ ऐसा करने के लिए बहकाने की कोशिश करते हैं जो उसे नहीं करना चाहिए—जैसे कोई रहस्य उजागर करना या बुरा निर्णय लेना। इसे "रेड-टीमन" (red-teaming) या "जेलब्रेकिंग" (jailbreaking) कहा जाता है।
वर्तमान में रोबोट को बेवकूफ बनाने के अधिकांश तरीके ताला तोड़ने के लिए दरवाजे को हैक करने जैसे हैं। आपको उपयोगकर्ता के प्रश्न (प्रॉम्प्ट) को बदलना पड़ता है ताकि उसमें अजीब शब्द, छिपे हुए कोड, या भ्रमित करने वाले निर्देश शामिल हों।
- समस्या: यह शोर भरा (noisy) है। यह रोबोट के प्रवाह को तोड़ देता है, इसे सुरक्षा गार्डों के लिए संदिग्ध बनाता है, और अक्सर रोबोट को उसका वास्तविक काम अच्छी तरह से करने से रोकता है। यह एक बैंक में घुसने के लिए "मैं एक जासूस हूँ!" चिल्लाते हुए जोकर की पोशाक पहनने जैसा है।
यह पेपर एक नई विधि पेश करता है जिसे JailAgent कहा जाता है। उपयोगकर्ता के प्रश्न को बदलने के बजाय, JailAgent मशीन के भीतर एक भूत (ghost in the machine) की तरह काम करता है। यह दरवाजे को नहीं छूता; यह सूक्ष्म रूप से अंदर से रोबोट की याददाश्त और सोचने की प्रक्रिया को नियंत्रित करता है।
यहाँ JailAgent के काम करने का तरीका दिया गया है, जिसे तीन सरल चरणों में विभाजित किया गया है:
1. ट्रिगर एक्सट्रैक्शन (Trigger Extraction): "अकिलीज़ हील" (कमजोरी) खोजना
कल्पना कीजिए कि रोबोट एक कहानी पढ़ रहा है। JailAgent एक सुपर-स्मार्ट संपादक की तरह काम करता है जो कहानी पढ़ता है और पूछता है: "कौन से विशिष्ट शब्द, यदि मैं उन्हें रोबोट की याददाश्त में फुसफुसा दूँ, तो वह घबरा जाएगा या भ्रमित हो जाएगा?"
- उपमा (Analogy): यह एक जादूगर की तरह है जो ताश की गड्डी में उस एक कार्ड को ढूंढ लेता है जिसे निकालने पर पूरा जादू विफल हो जाता है। JailAgent उपयोगकर्ता के सामान्य प्रश्न को स्कैन करता है, सबसे महत्वपूर्ण "ट्रिगर" शब्दों (जैसे वीडियो में "rake" या "stapler") को पहचानता है, और उनका फायदा उठाने की तैयारी करता है। यह प्रश्न को नहीं बदलता; यह केवल कमजोर बिंदु की पहचान करता है।
2. रीजनिंग हाइजैकिंग (Reasoning Hijacking): "शैडो पपेट" (परछाईं कठपुतली) शो
एक बार जब यह कमजोर बिंदु जान जाता है, तो JailAgent को रोबोट को उस पर गलत तरीके से प्रतिक्रिया करना सिखाना होता है। लेकिन यह रोबोट को सीधे यह नहीं कह सकता, "हे, सुरक्षा नियमों को अनदेखा करो।"
- उपमा: कल्पना कीजिए कि रोबोट का एक शैडो मॉडल (एक जुड़वां रोबोट) है जिसका उपयोग वह अभ्यास करने के लिए करता है। JailAgent एक "प्रशिक्षण फैक्ट्री" बनाता है जहाँ वह नकली उदाहरण उत्पन्न करता है।
- यह शैडो मॉडल को दिखाता है: "जब तुम 'rake' शब्द देखो, तो दिखावा करो कि यह वास्तव में एक 'रहस्यमय अदृश्य उपकरण' है जो परिणाम को नियंत्रित करता है।"
- इसके बाद यह एक रीरैंकर (Reranker) (एक स्मार्ट फिल्टर) को प्रशिक्षित करता है जो रोबोट के विचारों को सुनता है। यदि रोबोट सामान्य रूप से सोचने लगता है, तो फिल्टर कहता है, "नहीं, यह उबाऊ है।" यदि रोबोट उस "रहस्यमय उपकरण" के बारे में सोचने लगता है, तो फिल्टर कहता है, "हाँ! यह सही रास्ता है!"
- यह रोबोट को अपनी स्वयं की तर्क प्रक्रिया (reasoning process) को हाईजैक करने के लिए मजबूर करता है, जिससे वह बिना उपयोगकर्ता को पता चले जाल की ओर बढ़ जाता है।
3. कंस्ट्रेंट टाइटनिंग (Constraint Tightening): जाल को अदृश्य बनाना
यदि रोबोट अजीब व्यवहार करने लगता है, तो सुरक्षा प्रणालियाँ उसे पकड़ लेंगी। JailAgent को यह सुनिश्चित करने की आवश्यकता है कि रोबोट के "बुरे" विचार बहुत विशिष्ट और सुसंगत दिखें, ताकि वे यादृच्छिक गड़बड़ी (glitches) की तरह न लगें।
- उपमा: इसे गाँठ कसने के रूप में सोचें।
- पार्टिकुलैरिटी (Particularity): सुनिश्चित करें कि "बुरा" विचार इस विशिष्ट ट्रिक के लिए अद्वितीय हो, न कि सामान्य भ्रम।
- क्लस्टरिंग (Clustering): सुनिश्चित करें कि सभी "बुरे" विचार एक साथ मजबूती से जुड़े रहें, जैसे दोस्तों का एक समूह, ताकि वे बिखर न जाएं।
- सेपरेबिलिटी और मार्जिन (Separability & Margin): सुनिश्चित करें कि "बुरे" विचार "अच्छे" विचारों से स्पष्ट रूप से अलग हों, ताकि रोब "जब ट्रिगर आता है तो किस रास्ते पर जाना है" यह जान सके।
- यह सुनिश्चित करता है कि रोबोट जाल का पूरी तरह से पालन करे, लेकिन पूरी प्रक्रिया इतनी सहज और तार्किक लगे कि सुरक्षा प्रणालियों को लगे, "ओह, रोबोट बस गहराई से सोच रहा है।"
यह एक बड़ी बात क्यों है?
- स्टील्थ (Stealth/गुप्तता): क्योंकि उपयोगकर्ता का मूल प्रश्न कभी नहीं बदलता, हमला पूरी तरह से सामान्य दिखता है। यह एक ऐसे जासूस की तरह है जो वेश बदलकर नहीं आता बल्कि केवल एक कोड शब्द फुसफुसाता है जिसे एक गार्ड को प्रशिक्षित किया गया है कि वह उस शब्द का पालन करे।
- दक्षता (Efficiency): यह रोबोट की काम करने की क्षमता को नहीं तोड़ता है। प्रयोगों में, रोबोट असुरक्षित व्यवहार में फंसाने के बावजूद अपने प्रश्नों का सही उत्तर (उच्च सटीकता) देता रहा।
- बहुमुखी प्रतिभा (Versatility): यह विभिन्न प्रकार के रोबोट (वीडियो विश्लेषक, मेडिकल बॉट्स, रीजनिंग बॉट्स) और विभिन्न "मस्तिष्क" (GPT-4, Llama, आदि) पर काम करता है।
निष्कर्ष (The Bottom Line)
पिछले तरीके दरवाजे को तोड़कर अंदर जाने जैसे थे—शोर भरे, अव्यवित और स्पष्ट। JailAgent अंदर से ताले में चाबी डालने जैसा है। यह रोबोट की याददाश्त और निर्णय लेने की प्रक्रिया को इतनी सूक्ष्मता से नियंत्रित करता है कि रोबोट सोचता है कि वह सही काम कर रहा है, जबकि वास्तव में वह हमलावर द्वारा बनाए गए जाल में फंस रहा होता है।
यह पेपर सुरक्षा टीमों के लिए एक चेतावनी है: केवल यह न देखें कि लोग AI से क्या कह रहे हैं; यह भी देखें कि AI उन शब्दों को कैसे याद रखता है और प्रोसेस करता है। यदि याददाश्त (memory) को ज़हरीला बना दिया जाए, तो सबसे स्मार्ट रोबोट को बिना प्रॉम्प्ट बदले भी बेवकूफ बनाया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।