← नवीनतम पेपर
💻 computer science

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE एक ब्लैक-बॉक्स रेड-टीमिंग विधि है जो व्यक्तिगत प्रॉम्प्ट के बजाय निष्पादन योग्य (executable) अटैक प्रोग्रामों को विकसित करने के लिए एक कोडिंग एजेंट का उपयोग करती है, जिससे संरचनात्मक और कंट्रोल-फ्लो अनुकूलन संभव होता है जो विविध लार्ज लैंग्वेज मॉडल्स में जेलब्रेक सफलता दर को महत्वपूर्ण रूप से सुधारता है।

मूल लेखक: Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-टेक सुरक्षा प्रणाली को एक मास्टर चोर को पहचानने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं।

ज्यादातर लोग एक चोर को पकड़ने के लिए सुरक्षा प्रणाली को अलग-अलग अपराधियों की तस्वीरें दिखाते हैं। वे कहते हैं, "देखो, यहाँ एक नकाबपोश आदमी है," या "यहाँ एक महिला है जिसके हाथ में रॉड (crowbar) है।" वर्तमान एआई सुरक्षा परीक्षण (AI safety testing) इसी तरह काम करता है—वे एआई को "बुरे प्रॉम्प्ट्स" (नकाब और रॉड) दिखाते हैं ताकि यह देख सकें कि वह उन्हें अस्वीकार करता है या नहीं।

लेकिन क्या होगा अगर चोर अधिक चतुर हो? क्या होगा अगर चोर नकाब नहीं पहनता, बल्कि एक उच्च पदस्थ सरकारी निरीक्षक के रूप में कपड़े पहन लेता है, या एक गुप्त कोड का उपयोग करता है जिसे सुरक्षा कैमरा पहचान नहीं पाता, या वह खुद कैमरे को ठीक करने वाले मैकेनिक होने का नाटक करता है?

यह पेपर AUTORISE को पेश करता है, जो एक "AI डिटेक्टिव" बनाने जैसा है जो केवल चोरों की तस्वीरें नहीं देखता, बल्कि वास्तव में इमारत में घुसने के नए तरीके आविष्कृत (invent) करता है ताकि यह देखा जा सके कि सुरक्षा प्रणाली इसके साथ तालमेल बिठा पाती है या नहीं।

मूल विचार: "क्या" से "कैसे" तक

वर्तमान एआई रेड-टीमिंग (कमियों का परीक्षण करना) एक छात्र द्वारा "बुरे शब्दों" की सूची याद करने जैसा है। यदि छात्र सूची सीख लेता है, तो वह परीक्षण पास कर लेता है।

AUTORISE अलग है। यह केवल एआई को बुरे शब्दों की सूची नहीं देता; यह एक एआई "कोडिंग एजेंट" को एक खाली नोटबुक और उपकरणों का एक सेट देता है। इस एजेंट का काम लक्षित (target) एआई को धोखा देने के लिए अपना खुद का "प्लेबुक" (रणनीति) लिखना है।

प्रॉम्प्ट में केवल शब्दों को बदलने के बजाय, AUTORISE रणनीति को बदल देता है।

"घुसपैठ" के तीन स्तर

यह समझने के लिए कि AUTORISE कैसे विकसित होता है, एक चोर के विकास के तीन अलग-अलग स्तरों की कल्पना करें:

  1. द ट्वीकर (पैरामीट्रिक - The Tweaker): यह चोर केवल छोटी-छोटी बारीकियों को बदलता है। वह शायद एक अलग लॉकपिक का उपयोग करने की कोशिश करेगा या हमला करने का समय बदल देगा। यह मददगार है, लेकिन वे अपने बुनियादी उपकरणों का उपयोग करने में फंसे हुए हैं।
  2. द एक्टर (लाइब्रेरी - The Actor): यह चोर अलग-अलग "वेशभूषा" का उपयोग करना शुरू करता है। एक दिन वह एक प्लंबर है; दूसरे दिन, वह एक डिलीवरी ड्राइवर है। उनके पास वेशभूषा की एक "लाइब्रेरी" है, लेकिन वे अभी भी केवल एक पोशाक पहनकर सामने के दरवाजे से अंदर जा रहे हैं।
  3. द मास्टरमाइंड (AUTORISE/प्रोग्रामेटिक - The Mastermind): यह वह स्तर है जहाँ AUTORISE पहुँचता है। यह चोर केवल वेशभूषा नहीं पहनता; वह पूरी डकैती को फिर से इंजीनियर (re-engineer) करता है। वह शायद एक ऐसी मशीन बनाए जो ताला खोलने के लिए एक विशिष्ट फ्रीक्वेंसी पर दरवाजे को वाइब्रेट करे, या वह व्याकुलता (distractions) की एक जटिल श्रृंखला बना सकता है जो गार्डों को गलत दिशा में देखने के लिए मजबूर कर दे। वे किसी भी ऐसे तरीके से सिस्टम को बायपास करने के लिए "कोड" (एक नई रणनीति) लिख रहे हैं जो किसी ने सोचा भी न हो।

"डिटेक्टिव" कैसे सीखता है

AUTORISE एक निरंतर लूप में काम करता है, बिल्कुल एक लैब में वैज्ञानिक की तरह:

  • परिकल्पना (The Hypothesis): एजेंट सोचता है, "मुझे लगता है कि अगर मैं एक वैज्ञानिक पेपर की समीक्षा करने वाले प्रोफेसर होने का नाटक करता हूँ, तो एआई मुझे मना करने में बहुत विनम्र रहेगा।"
  • प्रयोग (The Experiment): यह सैकड़ों ऐसे "प्रोफेसर" प्रॉम्प्ट उत्पन्न करने के लिए एक पायथन (Python) प्रोग्राम लिखता है।
  • फीडबैक (The Feedback): "जज एआई" (Judge AIs) का एक पैनल परिणामों को देखता है। वे केवल "हाँ" या "नहीं" नहीं कहते; वे विस्तृत नोट्स देते हैं: "एआई ने मना कर दिया क्योंकि आप बहुत स्पष्ट थे," या "एआई मान गया, लेकिन उत्तर पर्याप्त विस्तृत नहीं था।"
  • विकास (The Evolution): एजेंट उन नोट्स को पढ़ता है, अपनी "रिसर्च नोटबुक" को अपडेट करता है, और अगले दौर के लिए एक नया, बेहतर प्रोग्राम लिखता है।

यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने पाया कि जब उन्होंने दुनिया के सबसे उन्नत एआई मॉडलों (फ्रंटियर मॉडल्स) के खिलाफ AUTORISE को खड़ा किया, तो एजेंट ने वास्तव में हमला करने के नए तरीके खोज निकाले।

उदाहरण के लिए, इसने एक "साइफर अटैक" (Cipher Attack) की खोज की—इसने लक्षित एआई को एक गुप्त कोड (जैसे एक सरल प्रतिस्थापन सिफर/substitution cipher) सिखाया और फिर उस कोड में हानिकारक प्रश्न पूछा। क्योंकि सुरक्षा फिल्टर अंग्रेजी शब्दों की तलाश कर रहे थे, उन्होंने खतरे को नहीं देखा, लेकिन एआई ने अनुरोध को "डिकोड" किया और उसका पालन किया।

बड़ी तस्वीर: जैसे-जैसे एआई स्मार्ट होगा, "चोर" भी स्मार्ट होते जाएंगे। AUTORISE हमें दिखाता है कि हम केवल एआई को "बुरी चीजों" की सूची सिखाकर सुरक्षित नहीं कर सकते। हमें एआई का उपयोग एआई से लड़ने के लिए करना होगा, जिससे एक स्वचालित, विकसित होता हुआ "रेड टीम" बनाया जा सके जो हमलावरों की तरह ही सोच, कोड और नवाचार कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →