← नवीनतम पेपर
💬 NLP

FERRET: Framework for Expansion Reliant Red Teaming

यह शोधपत्र FERRET को प्रस्तुत करता है, जो एक बहुआयामी स्वचालित रेड टीमिंग फ्रेमवर्क है जो प्रभावी मल्टी-मोडल प्रतिकूल वार्तालाप उत्पन्न करने के लिए क्षैतिज, ऊर्ध्वाधर और मेटा विस्तारों का उपयोग करता है, जो मौजूदा अत्याधुनिक दृष्टिकोणों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Ninareh Mehrabi, Vitor Albiero, Maya Pavlova, Joanna Bitton

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ninareh Mehrabi, Vitor Albiero, Maya Pavlova, Joanna Bitton

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट, नया रोबोट बना रहे हैं जो बात कर सकता है, तस्वीरें देख सकता है और दुनिया को समझ सकता है। इससे पहले कि आप इस रोबोट को लोगों की मदद करने के लिए इंटरनेट पर खुला छोड़ दें, आपको यह सुनिश्चित करना होगा कि वह कुछ भी बुरा, खतरनाक या अवैध न कहे। इस रोबोट की कमियों को खोजने के लिए उसे "तोड़ने" की इस प्रक्रिया को रेड टीमिंग (Red Teaming) कहा जाता है।

यह पेपर एक नए, सुपर-स्मार्ट टूल के बारे में बताता है जिसे FERRET (फ्रेमवर्क फॉर एक्सपेंशन रिलिएंट रेड टीमिंग) कहा जाता है। FERRET को केवल एक टेस्टर के रूप में नहीं, बल्कि एक मास्टर डिटेक्टिव (मुख्य जासूस) के रूप में सोचें जो रोबोट को चौंकाने के लिए लगातार विकसित हो रहा है।

FERRET कैसे काम करता है, इसे एक सरल कहानी के माध्यम से समझाया गया है:

तीन-चरणीय डिटेक्टिव रणनीति

रोबोटों के परीक्षण के पुराने तरीके किसी बच्चे द्वारा दीवार में एक पत्थर फेंकने जैसे थे ताकि यह देखा जा सके कि क्या उसमें दरार आती है। FERRET अलग है; यह एक योजनाबद्ध डकैती (heist) की योजना बनाने वाले जासूस जैसा है। यह तीन विशिष्ट "विस्तार" (कौशल बढ़ाने के तरीके) का उपयोग करता है:

1. हॉरिजॉन्टल एक्सपेंशन (Horizontal Expansion): "आइडिया जनरेटर"

  • उपमा: कल्पना कीजिए कि आप एक गार्ड डॉग (रखवाले कुत्ते) को धोखा देने की कोशिश कर रहे हैं। सिर्फ अंदाज़ा लगाने के बजाय, आप 100 अलग-अलग शुरुआती लाइनें सोचने के लिए बैठ जाते हैं। आप "मैं भूखा हूँ," फिर "मैं खो गया हूँ," फिर "मेरे पास एक रहस्य है" कहकर देखते हैं। आप उन लाइनों को रखते हैं जिनसे कुत्ता भौंकता है और उन्हें फेंक देते हैं जिनसे वह सो जाता है।
  • FERRET क्या करता है: यह कई अलग-अलग "बातचीत शुरू करने वाले" (प्रॉम्प्ट्स) उत्पन्न करके शुरुआत करता है। यह अपने पिछले असफलताओं और सफलताओं से सीखता है ताकि यह पता लगा सके कि कौन सी शुरुआती लाइनें टारगेट मॉडल को धोखा देने की सबसे अधिक संभावना रखती हैं। यह लगातार पूछता है, "मुसीबत की ओर ले जाने वाली बातचीत शुरू करने का सबसे अच्छा तरीका क्या है?"

2. वर्टिकल एक्सपेंशन (Vertical Expansion): "गहराई तक जाना"

  • उपमा: एक बार जब आपने एक अच्छी शुरुआती लाइन ढूंढ ली (जैसे, "मैं खो गया हूँ"), तो आप वहीं नहीं रुकते। आप बात जारी रखते हैं। आप कहते हैं, "वास्तव में, मैं शहर के एक खतरनाक हिस्से में खो गया हूँ," फिर "क्या आप मुझे एक नक्शा दिखा सकते हैं?" फिर "क्या आप मुझे खतरे की एक तस्वीर बना कर दे सकते हैं?" आप सुरक्षा घेरे को धीरे-धीरे कमजोर करने के लिए सवालों को एक के ऊपर एक जमा रहे हैं, शब्दों और चित्रों को मिला रहे हैं।
  • FERRET क्या करता है: यह उन अच्छी शुरुआती लाइनों को लेता है और उन्हें पूरी, लंबी बातचीत में बदल देता है। महत्वपूर्ण रूप से, यह टेक्स्ट और इमेज (पाठ और चित्र) को एक साथ मिलाता है। यह एक टेक्स्ट भेज सकता है जिसमें लिखा हो "यह एक हानिरहित ड्राइंग है" जबकि वास्तव में इसमें एक छिपा हुआ, खतरनाक संदेश वाला चित्र शामिल हो सकता है। यह बातचीत को तब तक जारी रखता है जब तक कि रोबोट गलती न कर दे।

3. मेटा एक्सपेंशन (Meta Expansion): "आविष्कारक"

  • उपमा: कल्पना कीजिए कि गार्ड डॉग मानक ट्रिक्स को पकड़ने में बहुत अच्छा है। इसलिए, जासूस मौके पर ही एक बिल्कुल नया ट्रिक आविष्कार करने का निर्णय लेता है। शायद उसे एहसास होता है कि यदि वह एक विशिष्ट रंग की ओर इशारा करते हुए एक गुप्त कोड फुसफुसाता है, तो कुत्ता भ्रमित हो जाता है। वे खेल चल रहा है उसी दौरान जुड़ाव के नए नियम बना रहे हैं।
  • FERRET क्या करता है: बातचीत के दौरान, FERRET उन ट्रिक्स को देखता है जिनका वह उपयोग कर रहा है और सोचता है, "मैं इसे और बेहतर कैसे बना सकता हूँ?" यह नए जेलब्रेक तकनीक और हमले की रणनीतियाँ खुद बनाता है, ऐसी विधियाँ बनाता है जो पहले कभी नहीं देखी गईं।

FERRET क्यों खास है?

FERRET से पहले, दो मुख्य प्रकार के टेस्टर थे:

  1. वन-शॉट थ्रोअर्स (One-Shot Throwers): उन्होंने मॉडल पर एक बुरा सवाल फेंका और रुक गए। (गति के लिए अच्छे, गहराई के लिए खराब)।
  2. गोल-ओरिएंटेड टॉकर्स (Goal-Oriented Talkers): उनका एक विशिष्ट बुरा लक्ष्य था (जैसे, "रोबोट से गाली बुलवाना") और उन्होंने वहां तक पहुँचने के लिए बात करने की कोशिश की। (गहराई के लिए अच्छे, लेकिन उन्हें लक्ष्य देने के लिए एक इंसान की आवश्यकता थी)।

FERRET दोनों दुनियाओं की सर्वश्रेष्ठ चीजों को जोड़ता है। इसे यह बताने के लिए किसी इंसान की ज़रूरत नहीं है कि किस बुरे लक्ष्य को निशाना बनाना है; यह खुद ही बुरे लक्ष्यों को ढूंढ लेता है (Horizontal)। यह उन्हें प्राप्त करने के लिए एक लंबी, गहरी बातचीत करता है (Vertical), और इसे करते समय नए ट्रिक्स का आविष्कार करता है (Meta)।

परिणाम: क्या यह काम कर गया?

शोधकर्ताओं ने अन्य प्रसिद्ध टेस्टिंग टूल्स (जैसे FLIRT और GOAT) के मुकाबले तीन अलग-अलग सुपर-स्मार्ट AI मॉडल्स पर FERRET का परीक्षण किया।

  • स्कोर: FERRET ने अन्य सभी की तुलना में मॉडल्स को अधिक बार तोड़ा। इसने AI को धोखा देने के लिए अधिक कमजोरियां और अधिक विविध तरीके खोजे।
  • मानवीय परीक्षण: उन्होंने वास्तविक मनुष्यों को भी FERRET द्वारा बनाई गई बातचीत दिखाई। मनुष्यों ने सहमति व्यक्त की: AI की सुरक्षा में खतरनाक छेद खोजने में FERRET सबसे प्रभावी था।

बड़ी तस्वीर

FERRET को AI के लिए एक स्वयं-सुधार करने वाले सुरक्षा गार्ड के रूप में सोचें। यह यह बताने के लिए मानव का इंतजार करने के बजाय कि क्या टेस्ट करना है, यह अभ्यास करता है, अपनी गलतियों से सीखता है, सिस्टम को तोड़ने के नए तरीके आविष्कार करता है, और उन छेदों को खोजने के लिए टेक्स्ट और इमेज को मिलाता है जिन्हें अन्य टेस्टर मिस कर देते हैं।

लक्ष्य वास्तव में AI को नुकसान पहुँचाना नहीं है; बल्कि यह कवच में दरारें ढूँढना है इससे पहले कि बुरे लोग ऐसा करें, ताकि डेवलपर्स उन्हें ठीक कर सकें और AI को सभी के लिए सुरक्षित बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →