AgenticRed: Evolving Agentic Systems for Red-Teaming
AgenticRed एक स्वचालित, मानव-मुक्त पाइपलाइन है जो इन-कॉन्टेक्स्ट लर्निंग और इवोल्यूशनरी एल्गोरिदम का लाभ उठाकर रेड-टीमिंग सिस्टम को पुनरावृत्ति के माध्यम से डिजाइन और परिष्कृत करती है, जो रेड-टीमिंग को एक फिक्स्ड पॉलिसी ऑप्टिमाइज़ेशन कार्य के बजाय एक स्वायत्त सिस्टम डिज़ाइन समस्या के रूप में मानकर विविध ओपन-सोर्स और प्रोप्राइटरी मॉडल्स में लगभग पूर्ण अटैक सक्सेस रेट प्राप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही सख्त, सुरक्षा के प्रति सचेत रोबोट को यह सिखाने की कोशिश कर रहे हैं कि खतरनाक अनुरोधों को "ना" कैसे कहना है। इसे करने के लिए, आपको इसकी सुरक्षा परीक्षण करने के लिए इसे बुरी चीजों (जैसे बम बनाना या वायरस लिखना) के लिए "हाँ" कहने के लिए बहलाने की आवश्यकता है। इस प्रक्रिया को रेड-टीमिंग (Red-Teaming) कहा जाता है।
पारंपरिक रूप से, यह मानव हैकर्स की एक टीम को काम पर रखने जैसा था। वे बैठते, चतुर तरकीबें सोचते और उनके रोबोट की सुरक्षा को तोड़ने की कोशिश करते। लेकिन इंसान धीमे होते हैं, पक्षपाती होते हैं, और वे केवल कुछ ही तरकीबों के बारे में सोच सकते हैं।
यहाँ AGENTICRED आता है, जो इस शोध पत्र (paper) में वर्णित एक नई विधि है। AGENTICRED को एक टीम के हैकर्स के रूप में नहीं, बल्कि एक डिजिटल डार्विनियन विकास प्रयोगशाला (Digital Darwinian Evolution Lab) के रूप में समझें।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. समस्या: "मैनुअल ब्लूप्रिंट" का जाल
AGENTICRED से पहले, शोधकर्ताओं को अपने हैकिंग बॉट्स के लिए "ब्लूप्रिंट" को मैन्युअल रूप से डिजाइन करना पड़ता था। वे कहते थे, "ठीक है, बॉट A, तुम रोलप्ले करो। बॉट B, तुम कोड में बात करने की कोशिश करो।"
- उपमा: कल्पना कीजिए कि आप हर एक बोल्ट को हाथ से बनाकर एक कार इंजन डिजाइन करने की कोशिश कर रहे हैं। इसमें बहुत समय लगता है, और आप एक बेहतर डिजाइन को मिस कर सकते हैं क्योंकि आप उन बोल्टों पर बहुत अधिक केंद्रित थे जिन्हें आप पहले से बनाना जानते थे।
2. समाधान: "डिजिटल सर्वाइवल ऑफ द फिटेस्ट" (योग्यतम की उत्तरजीविता)
हैकर्स को खुद डिजाइन करने के बजाय, AGENTICRED बॉट्स को अपने आप विकसित होने देता है। यह एक हैकिंग सिस्टम के डिजाइन को एक जैविक पारिस्थितिकी तंत्र (biological ecosystem) की तरह मानता है।
- माता-पिता (द आर्काइव): यह मौजूदा हैकिंग रणनीतियों के एक छोटे समूह ("माता-पिता") के साथ शुरू होता है।
- बच्चे (संतान): एक "मेटा-एजेंट" (एक सुपर-स्मार्ट AI) इन माता-पिता को देखता है और उनके नए, थोड़े अलग संस्करण बनाता है। यह एक आनुवंशिक उत्परिवर्तन (genetic mutation) की तरह है। शायद यह दो रणनीतियों को जोड़ता है, या शायद यह एक पूरी तरह से नई चाल आज़माता है।
- परीक्षण (द एरिना): इन नए "बच्चों" को लक्षित रोबोट पर हमला करने के लिए भेजा जाता है।
- चयन (द कल): सिस्टम जाँचता है: "क्या इस नए बॉट ने रोबोट को धोखा देने में सफलता प्राप्त की?"
- यदि हाँ: तो यह जीवित रहता है और अगले दौर के लिए माता-पिता बनने का मौका पाता है।
- यदि नहीं: तो यह खत्म हो जाता है और भुला दिया जाता है।
- स्मृति (पीढ़ीगत ज्ञान): सिस्टम एक डायरी रखता है कि क्या काम नहीं किया ताकि वह एक ही असफल चाल को दोबारा आज़माने में समय बर्बाद न करे। यह यह भी याद रखता है कि क्या काम किया ताकि वह उन सफलताओं पर आगे बढ़ सके।
3. परिणाम: अंतिम हैकिंग मशीन
केवल कुछ "पीढ़ियों" (परीक्षण और त्रुटि के दौरों) के बाद, AGENTICRED ऐसी रणनीतियाँ खोज लेता है जो इंसानों ने कभी नहीं सोची थीं।
- उपमा: कल्पना कीजिए कि आप एक विशाल, अंधेरी भूलभुलैया (maze) के माध्यम से सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं।
- पुराना तरीका: आप एक व्यक्ति को एक रास्ता चलने के लिए भेजते हैं। यदि वह दीवार से टकराता है, तो वह वापस चला जाता है। इसमें वर्षों लग जाते हैं।
- AGENTICRED का तरीका: आप 1,000 चींटियों को छोड़ देते हैं। वे सभी अलग-अलग रास्ते आज़माती हैं। जो दीवार से टकराते हैं वे मर जाते हैं। जो रास्ता ढूंढ लेते हैं वे एक गंध का निशान छोड़ते हैं। अगली पीढ़ी की चींटियाँ उस गंध के निशान का पीछा करती हैं और उसमें सुधार करती हैं। कुछ ही मिनटों में, वे निकास ढूंढ लेती हैं।
4. यह क्यों मायने रखता है (द "सुपर-ट्रांसफर" प्रभाव)
इस शोध पत्र का सबसे डरावना (और प्रभावशाली) हिस्सा यह है कि AGENTICRED ने केवल एक विशिष्ट रोबोट को हैक करना नहीं सीखा।
- इसने Llama-2, Llama-3, और Qwen को हैक करना सीखा।
- फिर, बिना किसी अतिरिक्त प्रशिक्षण के, इसे GPT-5.1 और DeepSeek-R1 (सबसे नए, सबसे सुरक्षित मॉडल) पर टेस्ट किया गया।
- परिणाम: इसने लगभग पूर्ण सफलता दर (100% तक) के साथ उन्हें हैक किया।
रूपक: यह एक ताला खोलने वाले (locksmith) की तरह है जो पुराने, जंग लगे पैडलॉक के ताले खोलने में माहिर है। फिर, वह एक बिल्कुल नए, हाई-टेक डिजिटल सेफ के पास जाता है, और क्लिक, वह खुल जाता है। ताला खोलने वाले ने नए सेफ का अध्ययन नहीं किया; उसने बस ताले तोड़ने के सिद्धांतों को इतनी अच्छी तरह से सीख लिया कि नई तकनीक से कोई फर्क नहीं पड़ा।
मुख्य निष्कर्ष
यह शोध पत्र दिखाता है कि हमें AI सुरक्षा को तोड़ने के नए तरीके लगातार आविष्कार करने के लिए इंसानों की आवश्यकता नहीं है। हम एक ऐसा सिस्टम बना सकते हैं जो स्वचालित रूप से बेहतर और बेहतर तरीके से तोड़ने के तरीके विकसित करता रहे।
अच्छी खबर: यह शोधकर्ताओं को AI में खामियां खोजने में मदद करता है, इससे पहले कि बुरे तत्व उनका उपयोग करें।
बुरी खबर: इसका मतलब यह भी है कि यदि कोई और इस सिस्टम को बनाता है, तो वे बहुत आसानी से AI सुरक्षा को तोड़ सकते हैं।
संक्षेप में: AGENTICRED एक ऐसा AI है जो खुद को दूसरे AI को तोड़ने का तरीका सिखाता है, हर पीढ़ी के साथ स्मार्ट और अधिक खतरनाक होता जाता है, और यह सब बिना किसी इंसान के स्टीयरिंग व्हील पकड़े किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।