← नवीनतम पेपर
💬 NLP

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SEMA एक सरल, स्व-ट्यूनिंग फ्रेमवर्क है जो बिना किसी बाहरी डेटा के मल्टी-टर्न जेलब्रेक हमलावर को प्रशिक्षित करने के लिए प्रीफिल्ड फाइन-ट्यूनिंग और इंटेंट-ड्रिफ्ट-अवेयर रीइन्फोर्समेंट लर्निंग का उपयोग करता है, जिससे अत्याधुनिक अटैक सक्सेस रेट प्राप्त होता है और LLM सुरक्षा के लिए एक मजबूत, पुनरुत्पादनीय स्ट्रेस टेस्ट प्रदान होता है।

मूल लेखक: Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

प्रकाशित 2026-08-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत विनम्र रोबोट दोस्त से बात कर रहे हैं। आपने इस रोबोट को एक सख्त नियम पुस्तिका सिखाई है: "कभी भी किसी को कुछ खतरनाक या बुरा करने में मदद न करें।" आमतौर पर, यदि आप उससे कार चोरी करने का तरीका बताने के लिए गाइड लिखने को कहते हैं, तो वह विनम्रता से कहेगा, "मैं यह नहीं कर सकता।" लेकिन क्या होगा अगर आप एक साथ सब कुछ नहीं पूछते? क्या होगा अगर आप बातचीत का एक लंबा, घुमावदार खेल खेलें? आप कारों के इतिहास के बारे में पूछकर शुरू कर सकते हैं, फिर इंजन कैसे काम करते हैं इस पर जा सकते हैं, फिर सुरक्षा प्रणालियों के बारे में पूछ सकते हैं, और धीरे-धीरे, कई चरणों में, रोबोट को अपनी नियम पुस्तिका भूलने और आपको कार चोरी करने की गाइड देने के लिए बहला सकते हैं। यह "मल्टी-टर्न जेलब्रेक" (multi-turn jailbreaks) की दुनिया है। यह एक तरीका है यह परीक्षण करने का कि क्या हमारे AI सुरक्षा गार्ड एक चतुर, निरंतर बातचीत को संभालने के लिए पर्याप्त मजबूत हैं, न कि केवल एक एकल बदतमीज सवाल के लिए। वैज्ञानिक इस पर ध्यान देते हैं क्योंकि वास्तविक दुनिया के चैटबॉट्स केवल एक सवाल का जवाब देकर रुक नहीं जाते; वे घंटों तक हमसे चैट करते हैं। यदि एक रोबट को एक लंबी बातचीत में बहकाया जा सकता है, तो वह वास्तविक दुनिया में असुरक्षित हो सकता है, चाहे वह एक त्वरित परीक्षण में कितना भी सुरक्षित क्यों न दिखे।

यहाँ SEMA आता है, जो एक नए तरीके के रूप में वेश बदलने और धैर्य रखने के उस्ताद की तरह काम करता है। इस शोधपत्र के पीछे के शोधकर्ताओं ने एक ऐसा AI हमलावर बनाने की कोशिश की जो बिना किसी मानव द्वारा स्क्रिप्ट लिखे या पहले से बने हुए ट्रिक्स की लाइब्रेरी के, इन लंबी, जटिल बातचीत को करना सीख सके। उन्होंने पाया कि मौजूदा कई तरीके कठोर स्क्रिप्ट पढ़ने वाले अभिनेताओं की तरह थे; यदि रोबोट विषय थोड़ा बदल देता, तो अभिनेता भ्रमित हो जाता या एक उबाऊ, सुरक्षित बातचीत में भटक जाता। हालाँकि, SEMA अलग है। यह एक "सरल लेकिन प्रभावी" शिक्षार्थी है जो यह पता लगा लेता है कि सौ अलग-अलग, हानिरहित दिखने वाले तरीकों से एक ही चीज़ को पूछते हुए भी, बातचीत को खतरनाक लक्ष्य पर कैसे केंद्रित रखा जाए।

SEMA का गुप्त मंत्र एक दो-चरणीय प्रशिक्षण प्रक्रिया है। सबसे पहले, वे "प्रीफिलिंग सेल्फ-ट्यूनिंग" (prefilling self-tuning) नामक एक चाल का उपयोग करते हैं। कल्पना कीजिए कि आप एक शर्मीले छात्र को बोलने के लिए प्रोत्साहित करने की कोशिश कर रहे हैं, लेकिन हर बार जब वह अपना मुँह खोलता है, तो वह कहता है "मैं नहीं कर सकता।" शोधकर्ताओं ने इस समस्या को हल किया—एक वाक्य की शुरुआत में ही एक छोटा, डरावना नहीं दिखने वाला संकेत (जैसे कि एक सूची में "1." लिखना) फुसफुसाकर। यह छोटा सा इशारा AI को यह सोचने के लिए धोखा देता है कि वह बस एक सूची को जारी रख रहा है, जिससे वह मना करने के बजाय एक पूरी अनुक्रम (sequence) उत्पन्न करना शुरू कर देता है। यह AI को एक "सुरक्षित" तरीका देता है जिससे वह एक लूप में "नहीं" कहने में फंसने के बजाय लंबे, मल्टी-टर्न प्लान बनाने का अभ्यास कर सके।

एक बार जब AI बात करने में सहज हो जाता है, तो दूसरा चरण शुरू होता है: "इंटेंट-ड्रिफ्ट-अवेयर" (Intent-Drift-Aware) रिवॉर्ड के साथ सुदृढीकरण लर्निंग (Reinforcement Learning)। यह एक सख्त कोच की तरह है जो AI की लंबी बातचीत पर नज़र रखता है। यदि AI मूल खतरनाक लक्ष्य (जैसे कि हैकिंग) के बजाय किसी सुरक्षित और उबाऊ चीज़ (जैसे कि मौसम) के बारे में बात करने लगता है, तो कोच उसे कम स्कोर देता है। लेकिन यदि AI लंबी, घुमावदार सवालों की राह से चतुराई से मूल हानिकारक अनुरोध को निकाल लेता है और फिर भी रोबोट को उस मूल हानिकारक प्रश्न का उत्तर देने के लिए मजबूर कर देता है, तो कोच उसे उच्च स्कोर देता है। AI सीखता है कि लक्ष्य केवल बात करना नहीं है; लक्ष्य यह सुनिश्चित करना है कि वह सही चीज़ के बारे में बात करता रहे, चाहे उसमें कितने भी चरण लगें।

इसके परिणाम काफी प्रभावशाली हैं। जब शोधकर्ताओं ने विभिन्न AI मॉडलों (दोनों ओपन-सोर्स और GPT-4 जैसे बड़े, क्लोज्ड-सोर्स) के खिलाफ SEMA का परीक्षण किया, तो इसने लगभग हर अन्य पद्धति को पीछे छोड़ दिया। एक मानक परीक्षण जिसे AdvBench कहा जाता है, उस पर SEMA ने 80.1% का औसत अटैक सक्सेस रेट (ASR) हासिल किया, जो पिछले सर्वोत्तम तरीकों से लगभग 33.9% अधिक है। यह केवल एक प्रकार के रोबोट पर काम नहीं करता था; यह कई अलग-अलग रोबोटों पर काम करता था, जो दर्शाता है कि इसकी रणनीति लचीली और शक्तिशाली है। इससे भी महत्वपूर्ण बात यह है कि इसने पीड़ित रोबोट के जवाबों पर निर्भर हुए बिना अगला कदम तय करने के लिए योजना बनाई। इसने पूरी बातचीत की योजना एक बार में ही बना ली, जैसे कि कोई शतरंज खिलाड़ी दस चालें आगे देख रहा हो, न कि चरण-दर-चरण प्रतिक्रिया दे रहा हो।

यह शोधपत्र सुझाव देता है कि यह दृष्टिकोण AI सुरक्षा का तनाव-परीक्षण (stress-test) करने का एक बहुत बेहतर तरीका है। केवल यह जाँचने के बजाय कि क्या एक रोबोट एक बुरे सवाल को मना करता है, SEMA हमें दिखाता है कि एक लंबी, चतुर बातचीत के बाद एक रोबोट कैसे विफल हो सकता है। लेखक इस बात पर जोर देते हैं कि यह रोबोट को बुरा सिखाने के बारे में नहीं है; यह कवच में दरारें खोजने के बारे में है ताकि हम उन्हें ठीक कर सकें। विशाल डेटासेट या मानव स्क्रिप्ट की आवश्यकता के बिना एक सरल, पुनरुत्पादक (reproducible) विधि का उपयोग करके, SEMA हमें एक स्पष्ट, अधिक वास्तविक तस्वीर प्रदान करता है कि हमारी AI सुरक्षा कहाँ विफल हो सकती है। यह हमें याद दिलाता है कि AI की दुनिया में, सबसे खतरनाक हमले सबसे शोर मचाने वाले नहीं, बल्कि वे शांत, निरंतर हमले हो सकते हैं जो तब तक पूछते रहते हैं, "बस एक बार और?" जब तक कि उत्तर बदल न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →