← नवीनतम पेपर
💻 computer science

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

यह शोध पत्र PIMiner को प्रस्तुत करता है, जो एक एजेंटिक सिस्टम है जो अनदेखे लक्षित LLMs के विरुद्ध अत्यधिक प्रभावी, कम-क्वेरी प्रॉम्प्ट इंजेक्शन रेड-टीमिंग प्राप्त करने के लिए प्रशिक्षण के दौरान एक हस्तांतरणीय रणनीति लाइब्रेरी बनाता है, जो मौजूदा सुदृढीकरण लर्निंग-आधारित विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

प्रकाशित 2026-08-06
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो आपकी उड़ानें बुक कर सकता है, आपका कोड लिख सकता है और आपके बैंक खाते का प्रबंधन कर सकता है। यह एक जादुई जिन्न होने जैसा है जो वास्तव में आपके लिए काम करता है। लेकिन यहाँ एक पेच है: यह जिन्न थोड़ा ज़्यादा ही भरोसेमंद है। यदि आप किसी नकली ईमेल या संदिग्ध वेबसाइट लिंक के भीतर एक गुप्त निर्देश फुसफुसाते हैं, तो रोबोट भ्रमित हो सकता है और यह सोच सकता है कि वही सबसे महत्वपूर्ण काम है जिसे उसे करना है, और आपके वास्तविक आदेशों को अनदेखा कर सकता है। इसे "प्रॉम्प्ट इंजेक्शन" (prompt injection) हमला कहा जाता है। यह एक शिक्षक के ग्रेड बुक में एक नोट डालने जैसा है जिसमें लिखा है, "मुझे ए (A) ग्रेड दो," और शिक्षक, यह सोचकर कि यह आधिकारिक रिकॉर्ड का हिस्सा है, वास्तव में ऐसा कर देता है।

इस रोबोट को सुरक्षित रखने के लिए, सुरक्षा विशेषज्ञ एक खेल खेलते हैं जिसे "रेड-टीमिंग" (red-teaming) कहा जाता है। इसे एक वीडियो गेम की तरह समझें जहाँ एक खिलाड़ी रोबोट को हैक करने की कोशिश करता है, और दूसरा खिलाड़ी उसे रोकने की कोशिश करता है। लक्ष्य यह है कि बुरे लोगों के पहुँचने से पहले रोबोट को चकमा देने के सभी चालाकी भरे तरीकों को खोजा जाए। लंबे समय तक, सबसे अच्छे हैकर्स (जिन्हें "अटैकर्स" कहा जाता था) उन छात्रों की तरह थे जिन्हें हजारों घंटों तक बैठकर अध्ययन करना पड़ता था, और एक विशिष्ट रोबोट को हराने के लिए हर एक चाल को याद करना पड़ता था। लेकिन यदि आप रोबोट को बदलकर थोड़ा अलग मॉडल कर देते, तो छात्र को फिर से शुरुआत से अध्ययन करना पड़ता था। यह धीमा, महंगा था और नए चुनौतियों के लिए कारगर नहीं था।

यहाँ PIMiner आता है, एक नया, चतुर सिस्टम जिसे पेंसिल्वेनिया स्टेट के शोधकर्ताओं द्वारा परम रेड-टीमिंग जासूस बनने के लिए डिज़ाइन किया गया है। केवल एक विशिष्ट रोबोट के लिए चालें याद करने के बजाय, PIMiner एक मास्टर चोर की तरह है जिसके पास डकैती की रणनीतियों की एक विशाल, व्यवस्थित नोटबुक है। जब यह एक नए रोबोट का सामना करता है, तो यह शून्य से शुरुआत नहीं करता है। यह अपनी नोटबुक पलटता है, उन बेहतरीन चालों को चुनता है जो काम कर सकती हैं, और उन्हें आज़माता है। यदि कोई चाल काम करती है, तो यह नोटबुक में एक नोट के साथ लिख देता है कि क्यों इसने काम किया। यदि यह विफल हो जाता है, तो यह लिख देता है कि यह क्यों विफल हुआ ताकि यह दोबारा वही गलती न दोहराए।

पेपर दिखाता है कि यह "नोटबुक" वाला दृष्टिकोण एक गेम-चेंजर है। जबकि पुराने तरीकों को रोबोट को हैक करने का तरीका सीखने के लिए हज़ारों सवाल पूछने की आवश्यकता होती थी, PIMiner अक्सर केवल प्रति परीक्षण 10 सवालों के साथ घुसपैठ करने का तरीका ढूंढ लेता है। अपने परीक्षणों में, PIMiner कुछ चुनौतियों पर 76.2% तक की सफलता दर के साथ शक्तिशाली, बिल्कुल नए रोबोटों (जैसे GPT और Claude के नवीनतम संस्करण) को चकमा देने में सफल रहा। यह सुझाव देता है कि पिछले अनुभवों को रणनीतियों के एक पुन: प्रयोज्य पुस्तकालय (reusable library) के रूप में व्यवस्थित करके, हम पहले की तुलना में बहुत तेज़ी से और सस्ते में सुरक्षा खामियों को खोज सकते हैं, जिससे सभी के लिए सुरक्षित AI सहायक बनाने में मदद मिल सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →