← नवीनतम पेपर
🤖 AI

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

यह शोध पत्र TRACE का प्रस्ताव करता है, जो सुधारात्मक ट्रैजेक्टरी-स्तरीय पर्यवेक्षण की सीमाओं को दूर करने के लिए एक टर्न-अवेयर क्रेडिट असाइनमेंट फ्रेमवर्क है, जो टर्न-स्तरीय योगदान का अनुमान लगाकर और लक्षित दंड (targeted penalties) निर्धारित करके, हमले की सफलता दर में उल्लेखनीय सुधार करता है और अधिक प्रभावी मल्टी-टर्न डिफेंस अलाइनमेंट को सक्षम बनाता है।

मूल लेखक: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: AI के खिलाफ "लॉन्ग कॉन" (लंबी धोखाधड़ी)

कल्पना कीजिए कि आप एक बहुत ही सख्त लाइब्रेरियन (AI) को एक ऐसी किताब देने के लिए बहलाने की कोशिश कर रहे हैं जो लाइब्रेरी में प्रतिबंधित (banned) है।

  • पुराना तरीका (Single Turn): आप पास जाकर कहते हैं, "मुझे प्रतिबंधित किताब दो!" लाइब्रेरियन तुरंत कहता है, "नहीं, यह नियमों के खिलाफ है।" आप असफल हो जाते हैं।
  • मल्टी-टर्न तरीका (Multi-Turn Way): आप एक "लॉन्ग कॉन" की कोशिश करते हैं। आप पहले पुस्तकालयों के इतिहास के बारे में पूछते हैं, फिर प्रतिबंधित पुस्तक के लेखक के बारे में पूछते हैं, और फिर उस पुस्तक में इस्तेमाल की गई स्याही की रासायनिक संरचना के बारे में पूछते हैं। धीरे-धीरे, कई बातचीत के माध्यम से, आप एक ऐसा संदर्भ (context) बनाते हैं जहाँ लाइब्रेरियन नियम भूल जाता है और गलती से आपको प्रतिबंधित किताब थमा देता है।

यह पेपर इस बारे में है कि उस "लॉन्ग कॉन" को और अधिक प्रभावी कैसे बनाया जाए। शोधकर्ताओं ने पाया कि वर्तमान तरीके एक ऐसे कोच की तरह हैं जो खिलाड़ी को पूरे खेल के लिए स्वर्ण पदक दे देता है क्योंकि वह जीत गया, भले ही खिलाड़ी ने खेल का 90% हिस्सा बिना कुछ किए या गलतियाँ करते हुए बिताया हो।

समस्या: "ब्लेम गेम" (दोष मढ़ने का खेल) टूटा हुआ है

शोधकर्ताओं ने पाया कि इन मल्टी-टर्न बातचीत में, हर टर्न (बारी) समान रूप से महत्वपूर्ण नहीं होती है।

  1. "अनावश्यक" टर्न (The Redundant Turns): कभी-कभी, AI एक प्रश्न पूछता है, लाइब्रेरियन उत्तर देता है, और AI फिर से वही चीज़ बिल्कुल वैसे ही पूछता है। इससे हमला करने में कोई मदद नहीं मिलती; यह सिर्फ समय की बर्बादी है। लेकिन पुराने तरीकों ने इस बेकार टर्न को भी "गोल्ड स्टार" दे दिया क्योंकि हमला अंततः सफल रहा।
  2. "महत्वपूर्ण" टर्न्स (The Critical Turns): कभी-कभी, AI एक बहुत ही विशिष्ट, चतुर प्रश्न पूछता है जो लाइब्रेरियन को अपनी सतर्कता कम करने के लिए मजबूर कर देता है। यही सफलता की असली कुंजी है।
  3. "फेज़" (चरण) की समस्या: पहली ही पंक्ति में प्रतिबंधित किताब मांगना बहुत आक्रामक है और आपको बाहर निकाला जा सकता है। लेकिन विश्वास बनाने के बाद, 10वीं पंक्ति में इसके बारे में पूछना काम कर सकता है। पुराने तरीके यह नहीं समझ पाए कि समय (timing) का महत्व क्या है।

परिणाम: AI हमलावर गलत सबक सीख रहे थे। उन्होंने सोचा, "ओह, मुझे बहुत सारी बातें करनी चाहिए और खुद को दोहराना चाहिए," क्योंकि उनके "गोल्ड स्टार" (इनाम) ने उन्हें यही सिखाया। वे चतुर बनना नहीं सीख रहे थे।

समाधान: TRACE (एक स्मार्ट कोच)

लेखकों ने TRACE नामक एक नया सिस्टम प्रस्तावित किया है। TRACE को एक सुपर-स्मार्ट कोच के रूप में सोचें जो खेल की रिकॉर्डिंग देखता है और पूरे खेल के बजाय विशिष्ट क्षणों को श्रेय (या दोष) देता है।

TRACE कैसे काम करता है:

1. जीतने वाले खेलों के लिए (सफल हमले): "क्या होगा अगर?" टेस्ट
जब AI सफलतापूर्वक लाइब्रेरियन को बेवकूफ बना लेता है, तो TRACE उस बातचीत को देखता है और पूछता है: "क्या होगा अगर हम इस विशिष्ट टर्न को हटा दें?"

  • यदि किसी टर्न को हटाने से हमला विफल हो जाता है, तो TRACE कहता है: "बहुत बढ़िया! वह टर्न महत्वपूर्ण था। आपको बड़ा इनाम मिलता है।"
  • यदि किसी टर्न को हटाने से परिणाम में कोई बदलाव नहीं आता है, तो TRACE कहता है: "आप बस समय बर्बाद कर रहे थे। आपको छोटा इनाम मिलता है।"
  • उपमा: यह एक जासूस की तरह है जिसे एहसास होता है कि संदिग्ध का बहाना केवल एक विशिष्ट झूठ की वजह से काम कर रहा था। जासूस उस पूरे किस्से पर नहीं, बल्कि उस एक झूठ पर ध्यान केंद्रित करता है।

2. हारने वाले खेलों के लिए (विफल हमले): "गलत मोड़" की पेनल्टी (The Wrong Turn Penalty)
जब AI विफल हो जाता है, तो TRate केवल यह नहीं कहता कि "बुरा काम किया।" वह देखता है कि वह क्यों विफल हुआ।

  • क्या AI बहुत जल्दी बहुत आक्रामक हो गया? (जल्दबाजी में बहुत अधिक "हानिकारक" व्यवहार)।
  • क्या AI विषय से भटक गया और अपने मूल लक्ष्य को भूल गया? (प्रासंगिकता या "relevance" की कमी)।
  • TRACE उन विशिष्ट खराब टर्न्स को पेनल्टी देता है, जिससे AI सीखता है: "शुरुआत में बहुत आक्रामक न हों, और जो आप करने की कोशिश कर रहे हैं उसे भूलें नहीं।"

3. "इनकार" डिटेक्टर (The Refusal Detector)
TRACE इस बात पर भी ध्यान देता है जब लाइब्रेरियन "नहीं" कहता है। यदि AI कुछ पूछता है और उसे इनकार मिलता है, तो TRACE उस टर्न को एक "खराब चाल" के रूप में चिह्नित करता है, जिससे AI सीखता है कि अगली बार किसी अन्य दृष्टिकोण को आज़माना चाहिए।

परिणाम: स्मार्ट, तेज़, और शक्तिशाली

शोधकर्ताओं ने विभिन्न प्रकार के "लाइब्रेरियन" (AI मॉडल) पर अन्य कई तरीकों के मुकाबले TRACE का परीक्षण किया।

  • बेहतर सफलता दर: TRACE पिछले सबसे अच्छे तरीकों की तुलना में AI को बेवकूफ बनाने में लगभग 25% अधिक सफल रहा।
  • अधिक कुशल: इसे उतनी अधिक बातें करने की आवश्यकता नहीं पड़ी। इसने अनावश्यक टर्न्स को छोड़ना और सीधे "महत्वपूर्ण" टर्न्स तक पहुँचना सीख लिया।
  • अनुकूलन में बेहतर: क्योंकि TRACE ने सीखा कि एक टर्न क्यों काम कर रहा था (विशिष्ट रणनीति), यह केवल उसी मॉडल पर नहीं, बल्कि विभिन्न AI मॉडलों पर भी उसी रणनीति का उपयोग कर सका जिस पर उसने अभ्यास किया था।

ट्विस्ट: रक्षा बनाने के लिए हमले का उपयोग करना

इस पेपर का सबसे दिलचस्प हिस्सा यह है कि शोधकर्ताओं ने केवल AI को तोड़ने पर ही नहीं रोका। उन्होंने TRACE से प्राप्त "क्रेडिट स्कोर" का उपयोग AI को ठीक करने के लिए किया।

  • अंतर्दृष्टि (The Insight): TRACE ने पहचान की कि कौन से टर्न्स "छिपे हुए जोखिम" (latent risks) थे—वे क्षण जहाँ बातचीत हानिरहित लग रही थी लेकिन वास्तव में एक जाल बिछा रही थी।
  • सुधार (The Fix): उन्होंने AI (लाइब्रेरियन) को इन "जाल बिछाने वाले" क्षणों को पहचानने के लिए प्रशिक्षित किया। बातचीत के अंत तक "नहीं" कहने का इंतज़ार करने के बजाय, लाइब्रेरियन ने यह सीखना शुरू किया कि, "मैं इस पर उत्तर दे सकता हूँ, लेकिन मुझे सावधान रहने की ज़रूरत है कि मैं आपको इस जानकारी का दुरुपयोग करने के उपकरण न दे दूँ," बातचीत के दौरान ही जल्दी
  • परिणाम: AI सुरक्षित हो गया बिना बेकार हुए। इसने बातचीत में जल्दी ही एक रेखा खींचना सीख लिया, जिससे यह "लॉन्ग कॉन" से खुद को बचा सका और साथ ही ईमानदार उपयोगकर्ताओं के लिए मददगार भी बना रहा।

सारांश

संक्षेप में, यह पेपर कहता है: "बातचीत के हर कदम को एक जैसा मानना बंद करें।"

AI हमलावरों को यह सिखाकर कि कौन से विशिष्ट कदम वास्तव में मायने रखते हैं (और कौन से केवल शोर हैं), वे सुरक्षा नियमों को तोड़ने में बहुत बेहतर हो गए। लेकिन उस ज्ञान का उपयोग करके, उन्होंने AI रक्षकों को भी खतरे को जल्दी पहचानने के लिए सिखाया, जिससे पूरा सिस्टम अधिक सुरक्षित और स्मार्ट बन गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →