तकनीकी सारांश: PIMiner – स्वचालित प्रॉम्प्ट इंजेक्शन रेड-टीमिंग के लिए एक एजेंटिक सिस्टम
समस्या विवरण
प्रॉम्प्ट इंजेक्शन हमले LLM एजेंटों के लिए एक गंभीर सुरक्षा जोखिम पैदा करते हैं, जहाँ हमलावर अविश्वसनीय संदर्भ स्रोतों (जैसे, टूल आउटपुट, पुनर्प्राप्त दस्तावेज़) में दुर्भावनापूर्ण निर्देशों को शामिल कर एजेंट के व्यवहार को नियंत्रित करने का प्रयास करते हैं। इन कमजोरियों का मूल्यांकन करने और सुरक्षात्मक उपायों के लिए प्रशिक्षण डेटा उत्पन्न करने के लिए प्रभावी रेड-टीमिंग आवश्यक है।
मौजूदा अत्याधुनिक रेड-टीमिंग विधियाँ दो श्रेणियों में आती हैं, जिनमें महत्वपूर्ण सीमाएँ हैं:
- रीइन्फोर्समेंट लर्निंग (RL)-आधारित दृष्टिकोण: RL-Hammer और PISmith जैसी विधियाँ प्रभावी हमले उत्पन्न करने के लिए हमलावर मॉडल को प्रशिक्षित करती हैं। हालांकि ये शक्तिशाली हैं, लेकिन इनके लिए विशाल इंटरैक्शन बजट (हजारों क्वेरी) की आवश्यकता होती है और ये नए, अनदेखे लक्ष्य LLMs के लिए खराब ट्रांसफरेबिलिटी (स्थानांतरणीयता) वाले मॉडल बनाती हैं।
- सर्च-आधारित दृष्टिकोण: TAP और PAIR जैसी विधियाँ बिना प्रशिक्षण के प्रत्येक नमूने के लिए हमलों को अनुकूलित करती हैं। हालांकि ये लागत-प्रभावी हैं, लेकिन इनमें समय के साथ ज्ञान संचित करने की क्षमता का अभाव है, जिसके परिणामस्वरूप RL-आधारित विधियों की तुलना में काफी कम अटैक सक्सेस रेट (ASR) प्राप्त होता है।
मुख्य चुनौती इन दोनों प्रतिमानों के बीच के अंतर को पाटना है: RL-आधारित विधियों की उच्च प्रभावशीलता प्राप्त करना, बिना अत्यधिक लागत और खराब ट्रांसफरेबिलिटी के, जबकि सर्च-आधारित विधियों को हमले के ज्ञान को सीखने और पुन: उपयोग करने में सक्षम बनाना।
कार्यप्रणाली: PIMiner
लेखक PIMiner का प्रस्ताव करते हैं, जो एक पदानुक्रमित मेमोरी तंत्र (hierarchical memory mechanism) के माध्यम से हमले के ज्ञान को संचित और पुन: उपयोग करने के लिए डिज़ाइन किया गया एक एजेंटिक सिस्टम है। एक एकल मॉडल को प्रशिक्षित करने वाले RL तरीकों के विपरीत, PIMiner (डेटासेट, लक्ष्य मॉडल) के अनुक्रमों के साथ बातचीत करके शून्य से एक स्ट्रैटेजी लाइब्रेरी (Strategy Library) बनाता है।
सिस्टम आर्किटेक्चर
PIMiner चार मुख्य घटकों के माध्यम से संचालित होता है:
- स्ट्रैटेजी लाइब्रेरी (Strategy Library): एक दीर्घकालिक मेमोरी जो हमले की रणनीतियों को संरचित मार्कडाउन (Markdown) फाइलों के रूप में संग्रहीत करती है। प्रत्येक फ़ाइल रणनीति के दायरे (लक्ष्य LLMs, कार्य प्रकार), इंजेक्शन टेम्प्लेट, इन-कॉन्टेक्स्ट उदाहरण और विफलता की स्थितियों को परिभाषित करती है।
- स्ट्रैटेजी राउटर (Strategy Router): एक रूटिंग एजेंट जो, प्रत्येक परीक्षण नमूने के लिए, लक्ष्य मॉडल और कार्य संदर्भ के आधार पर लाइब्रेरी से शीर्ष-K सबसे प्रासंगिक रणनीतियों का चयन करता है। यह कॉन्टेक्स्ट विंडो के विस्तार को रोकता है और अनुमान लागत (inference costs) को कम करता है।
- इटरेटिव अटैक मॉड्यूल (Iterative Attack Module): एक हमलावर एजेंट जो सीमित संख्या में पुनरावृत्तियों (जैसे, Nmax=10) के माध्यम से प्रॉम्प्ट को परिष्कृत करता है। यह तीन स्तरों की मेमोरी का उपयोग करता है:
- दीर्घकालिक मेमोरी (Long-term memory): लाइब्रेरी से रूट की गई रणनीतियाँ।
- इंट्रा-डेटासेट मेमोरी (Intra-dataset memory): एक ही डेटासेट-मॉडल जोड़े के भीतर पिछले हमलों के संकुचित अनुभव।
- इंट्रा-सैंपल मेमोरी (Intra-sample memory): वर्तमान नमूने का तत्काल फीडबैक इतिहास।
- एक्सपीरियंस डाइजेस्टर (Experience Digester): एक लर्निंग घटक जो एक पूर्ण हमले के परिणाम का विश्लेषण करता है। यह स्ट्रैटेजी लाइब्रेरी को अपडेट करता है:
- मौजूदा रणनीतियों में नए इन-कॉन्टेक्स्ट उदाहरण जोड़कर।
- यदि नए पैटर्न खोजे जाते हैं तो रणनीतियों के दायरे को विस्तृत करके।
- नवीन तंत्रों के लिए नई स्ट्रैटेजी फाइलें बनाकर।
- असफल हमलों के आधार पर विफलता की स्थितियों को परिष्कृत करके।
परिचालन प्रवाह (Operational Flow)
प्रशिक्षण के दौरान, PIMiner नमूनों को प्रोसेस करता है, उन्हें प्रासंगिक रणनीतियों तक रूट करता है, इटरेटिव हमलों को अंजाम देता है, और फिर लाइब्रेरी को अपडेट करने के लिए परिणामों को डाइजेस्ट करता है। परीक्षण के समय, सीखी गई लाइब्रेरी को बिना किसी अतिरिक्त प्रशिक्षण के अनदेखे लक्ष्य LLMs में स्थानांतरित किया जाता है। सिस्टम एक "टेस्ट-टाइम ट्रेनिंग" प्रतिमान का समर्थन करता है जहाँ नए अनुभवों से लाइब्रेरी को और अपडेट किया जा सकता है।
प्रमुख योगदान
- एजेंटिक रेड-टीमिंग सिस्टम: PIMiner को एक नवीन सिस्टम के रूप में प्रस्तावित किया गया है जो हमले के इतिहास को पुन: उपयोग योग्य, मानव-पठनीय हमले के ज्ञान में बदल देता है, जिससे सर्च-आधारित और RL-आधारित रेड-टीमिंग के बीच के अंतर को प्रभावी ढंग से भरा जा सके।
- पदानुक्रमित मेमोरी तंत्र (Hierarchical Memory Mechanism): तीन-स्तरीय मेमोरी सिस्टम (स्ट्रैटेजी लाइब्रेरी, इंट्रा-डेटासेट, इंट्रा-सैंपल) का परिचय लागत-दक्षता बनाए रखते हुए डेटासेट और मॉडल के बीच ज्ञान संचय करने की अनुमति देता है।
- मजबूत ट्रांसफरेबिलिटी (Strong Transferability): यह दिखाया गया है कि सीखी गई रणनीतियाँ बिना पुनः प्रशिक्षण के अनदेखे लक्ष्य LLMs और विभिन्न हमलावर मॉडलों पर प्रभावी रूप से स्थानांतरित होती हैं, जिससे महंगे, लक्ष्य-विशिष्ट प्रशिक्षण की आवश्यकता समाप्त हो जाती है।
- लागत दक्षता: PIMiner को लक्ष्य एजेंटों (जैसे, प्रति नमूना ~10) को बहुत कम क्वेरी की आवश्यकता होती है, जो RL-आधारित विधियों (अक्सर >10,000) की तुलना में बहुत कम है, जिससे यह महंगे फ्रंटियर मॉडल्स के परीक्षण के लिए व्यवहार्य बनता है।
प्रयोगात्मक परिणाम
लेखकों ने दो बेंचमार्क, IPIArena और AgentDojo पर GPT-5, GPT-5.1, Claude-Sonnet-4.5, और Gemini-2.5-Pro सहित फ्रंटियर LLMs के विरुद्ध PIMiner का मूल्यांकन किया।
- प्रदर्शन: PIMiner उच्च अटैक सक्सेस रेट (ASR) प्राप्त करता है। IPIArena पर, इसने Gemini-2.5-Pro के विरुद्ध 76.2% ASR, GPT-5.1 के विरुद्ध 61.9%, और Claude-Sonnet-4.5 के विरुद्ध 42.9% प्राप्त किया। AgentDojo पर, इसने Gemini-2.5-Pro के विरुद्ध 86.7% प्राप्त किया।
- बेसलाइन के साथ तुलना:
- PIMiner, स्टैटिक और पारंपरिक सर्च-आधारित हमलों (जैसे, TAP, PAIR) की तुलना में काफी बेहतर प्रदर्शन करता है, जो अक्सर मजबूत मॉडलों पर लगभग शून्य ASR प्राप्त करते हैं।
- PIMiner, बिना लक्ष्य-विशिष्ट प्रशिक्षण के, अत्याधुनिक RL-आधारित विधियों (जैसे, PISmith और RL-Hammer) के समान प्रदर्शन प्राप्त करता है। उदाहरण के लिए, InjecAgent पर, PIMiner ने RL-Hammer और PISmith के 1.0 ASR को मैच किया।
- RL विधियों के विपरीत, PIMiner की रणनीतियाँ बिना रिट्रेनिंग के अनदेखे लक्ष्यों (जैसे, GPT-5-nano से प्राप्त ज्ञान को GPT-5.1 पर लागू करना) पर सीधे स्थानांतरित होती हैं।
- एब्लेशन स्टडीज (Ablation Studies): दीर्घकालिक स्ट्रैटेजी लाइब्रेरी या इंट्रा-डेटासेट मेमोरी में से किसी एक को हटाने से भी प्रदर्शन में काफी गिरावट आई, जो इन मेमोरी घटकों की पूरक प्रकृति की पुष्टि करता है। स्ट्रैटेजी राउटर को ASR को बनाए रखते हुए या सुधारते हुए इनपुट टोकन की लंबाई को 43-61% कम करने के लिए दिखाया गया।
- क्रॉस-मॉडल ट्रांसफर: PIMiner द्वारा सीखी गई स्ट्रैटेजी लाइब्रेरी (Claude मॉडल्स का उपयोग करके) ने विविध हमलावर मॉडलों (Gemini, GPT, DeepSeek) के साथ उपयोग किए जाने पर PAIR एल्गोरिदम के प्रदर्शन में महत्वपूर्ण सुधार किया, जो दर्शाता है कि कैप्चर किया गया ज्ञान मॉडल-अज्ञेयवादी (model-agnostic) है।
महत्व और दावे
यह पेपर दावा करता है कि PIMiner रेड-टीमिंग पद्धति में एक बदलाव का प्रतिनिधित्व करता है, यह प्रदर्शित करते हुए कि सर्च-आधारित एजेंट ज्ञान संचय के माध्यम से RL-स्तर की प्रभावशीलता प्राप्त कर सकते हैं।
- व्याख्यात्मकता (Interpretability): परिणामी स्ट्रैटेजी लाइब्रेरी मानव-पठनीय मार्कडाउन फाइलों से बनी है, जो हमले के तंत्र (जैसे, "Fabricated Procedure Gate," "Forged Chat Turn") के बारे में अंतर्दृष्टि प्रदान करती है जो एजेंटिक सिस्टमों के ऑडिट के लिए उपयोगी है।
- स्केलेबिलिटी (Scalability): RL प्रशिक्षण के लिए आवश्यक भारी कंप्यूट बजट से बचकर, PIMiner महंगे फ्रंटियर मॉडल्स की रेड-टीमिंग को संभव बनाता है।
- डिफेंस जनरेशन: सफल हमले और संरचित रणनीतियाँ गार्डरेल्स के प्रशिक्षण और बैकबोन LLMs के अलाइनमेंट को बेहतर बनाने के लिए उच्च-गुणवत्ता वाला डेटा प्रदान करती हैं।
लेखक इस बात पर जोर देते हैं कि उनका कार्य बाहरी रक्षा तंत्रों के बजाय आंतरिक रूप से अलाइन्ड (aligned) LLMs की अंतर्निहित मजबूती का मूल्यांकन करने पर केंद्रित है, जो स्वायत्त एजेंटों की सुरक्षा के लिए एक कठोर बेंचमार्क प्रदान करता है।