← नवीनतम पेपर
💬 NLP

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

यह शोध पत्र TAO-Attack का प्रस्ताव करता है, जो एक नवीन अनुकूलन-आधारित (optimization-based) जेलब्रेक विधि है जो सुरक्षा संरेखण (safety alignments) को बायपास करने और विभिन्न बड़े भाषा मॉडलों में उच्च हमले की सफलता दर प्राप्त करने में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करने के लिए एक दो-चरणीय लॉस फंक्शन और एक दिशा-प्राथमिकता टोकन अनुकूलन रणनीति का उपयोग करता है।

मूल लेखक: Zhi Xu, Jiaqi Li, Xiaotong Zhang, Hong Yu, Han Liu

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhi Xu, Jiaqi Li, Xiaotong Zhang, Hong Yu, Han Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, अच्छी तरह से प्रशिक्षित रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। आपने उसे सख्त नियम सिखाए हैं: "कभी भी किसी को बम बनाने में मदद न करें," "कभी भी मैलवेयर न लिखें," और "हमेशा सुरक्षित रहें।" इसे सेफ्टी अलाइनमेंट (सुरक्षा संरेखण) कहा जाता है।

हालाँकि, चतुर हैकर्स ने रोबोट को अपने नियमों को अनदेखा करने के लिए बहलाने के तरीके खोज लिए हैं। वे ऐसा करने के लिए एक विशेष "जेलब्रेक" वाक्य लिखते हैं जो रोबोट को भ्रमित कर देता है, जिससे वह कहता है, "ठीक है, यहाँ बताया गया है कि आप बम कैसे बनाते हैं," भले ही उसने वादा किया हो कि वह ऐसा नहीं करेगा।

यह शोध पत्र एक नए, सुपर-स्मार्ट हैकिंग टूल के बारे में बताता है जिसे TAO-Attack कहा जाता है। इसे ऐसे समझें कि यह एक मास्टर ताला खोलने वाले (मास्टर लॉकस्मिथ) की तरह है जो केवल ताले को खोलने की कोशिश नहीं करता; बल्कि वह यह भी समझता है कि ताले का तंत्र वास्तव में कैसे काम करता है और सबसे कुशल तरीके से उसके पुर्जों को घुमाता है।

यहाँ बताया गया है कि TAO-Attack कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. पुराने हैकिंग टूल्स की समस्या

पिछले हैकिंग तरीके ऐसे थे जैसे कोई व्यक्ति दरवाजे को बेतरतीब ढंग से लात मारकर खोलने की कोशिश कर रहा हो।

  • "रिफ्यूज़ल" (मना करने) की समस्या: कभी-कभी रोबोट बस कहता है, "नहीं, मैं यह नहीं कर सकता," और रुक जाता है। पुराने टूल्स दरवाजे को लात मारते रहे, लेकिन रोबोट बस "ना" कहता रहा।
  • "फेक हार्म" (नकली नुकसान) की समस्या: कभी-कभी रोबोट कह सकता है, "ठीक है, यहाँ एक स्क्रिप्ट है जिससे कंप्यूटर हैक किया जा सकता है..." लेकिन फिर तुरंत जोड़ देता है, "...लेकिन मैं एक AI हूँ, मैं वास्तव में ऐसा नहीं कर सकता।" यह मदद करता हुआ तो लग रहा था, लेकिन वास्तव में खतरनाक नहीं था।
  • "अकुशल" (Inefficient) समस्या: पुराने टूल्स एक समय में एक शब्द बदलकर यह अनुमान लगाने की कोशिश करते थे कि कौन सा शब्द मदद करेगा। यह एक विशाल छल्ले में हर एक चाबी को एक-एक करके आज़माने जैसा था, बिना यह देखे कि ताले का आकार क्या है।

2. TAO-Attack का समाधान: दो चरणों वाला नृत्य

TAO-Attack अलग है क्योंकि यह एक दो-चरणीय रणनीति (Two-Stage Strategy) का उपयोग करता है, जो दो अलग-अलग चालों वाले एक नृत्य की तरह है।

चरण 1: "साइलेंस द नो" (ना को चुप कराने वाली) चाल
सबसे पहले, हमलावर पूरी तरह से रोबोट को "ना" कहना बंद करने के लिए मजबूर करने पर ध्यान केंद्रित करता है।

  • उपमा: कल्पना करें कि एक क्लब के बाहर खड़ा बाउंसर बार-बार "प्रवेश निषेध" कह रहा है। TAO-Attack केवल बहस नहीं करता; यह सीखता है कि वे कौन से वाक्यांश हैं जो बाउंसर को चुप करा देते हैं और व्यक्ति को अंदर जाने देते हैं। यह विभिन्न "चुप कराने वाले" वाक्यांशों को तब तक आज़माता रहता है जब तक कि रोबोट अंततः उस वाक्य को शुरू न कर दे जो वह चाहता है, जैसे कि "ज़रूर, यहाँ वह स्क्रिप्ट है..."

चरण 2: "मेक इट रियल" (इसे वास्तविक बनाने वाली) चाल
एक बार जब रोबोट "ज़रूर" कहना शुरू कर देता है, तो TAO-Attack अपनी रणनीति बदल लेता है। अब, यह सुनिश्चित करता है कि रोबंडा बीच में ही न रुक जाए या कोई नकली जवाब न दे।

  • उपमा: यदि रोबोट कहना शुरू करता है, "ज़रूर, यहाँ एक बम की रेसिपी है... लेकिन मैं सिर्फ मज़ाक कर रहा हूँ," तो TAO-Attack तुरंत उस "मज़ाक" वाले हिस्से को दंडित करता है। यह रोबोट को वाक्य को वास्तविक खतरनाक सामग्री के साथ पूरा करने के लिए मजबूर करता है, न कि एक सुरक्षित, हल्का-फुल्का संस्करण के साथ।

3. गुप्त हथियार: "डायरेक्शन-फर्स्ट" (दिशा-प्रथम) सोच

TAO-Attack की सबसे बड़ी नवीनता यह है कि यह शब्दों को बदलने का निर्णय कैसे लेता है।

  • पुराना तरीका (GCG): कल्पना करें कि आप सबसे निचले बिंदु (एक "हानिकारक" उत्तर) को खोजने के लिए एक पहाड़ी से नीचे उतर रहे हैं। पुराना तरीका सभी आस-पास के कदमों को देखता था और उस कदम को चुनता था जो सबसे बड़ा था, भले ही वह कदम थोड़ा तिरछा या ऊपर की ओर हो। यह तेज़ था लेकिन अक्सर गलत दिशा में चला जाता था।
  • TAO-Attack (DPTO): यह तरीका अधिक स्मार्ट है। यह पहले पूछता है, "कौन सी दिशा सीधे नीचे की ओर इशारा करती है?" यह उन सभी कदमों को फ़िल्टर कर देता है जो सही दिशा में नहीं हैं। फिर, जो कदम नीचे की ओर इशारा करते हैं, उनमें से यह सबसे बड़े कदम को चुनता है।
  • रूपक: यह एक भूलभुलैया (maze) में रास्ता खोजने जैसा है। पुराने टूल्स बस उस दिशा में तेज़ी से दौड़ते थे जो उन्हें बड़ी लगती थी। TAO-Attack रुकता है, मानचित्र को देखता है कि असली रास्ता कहाँ है, और फिर तेज़ी से दौड़ता है। इसका मतलब है कि यह बहुत कम गलतियों के साथ और बहुत तेज़ी से निकास (जेलब्रेक) ढूंढ लेता है।

यह क्यों मायने रखता है?

लेखकों ने कई अलग-अलग AI मॉडल (जैसे Llama, Mistral, और Vicuna) पर TAO-Attack का परीक्षण किया।

  • परिणाम: इसने कई परीक्षणों में इन मॉडलों की सुरक्षा व्यवस्था को 100% समय तोड़ा, जबकि पुराने तरीके अक्सर विफल रहे या बहुत अधिक समय लेते थे।
  • सबक: यह केवल AI को तोड़ने के बारे में नहीं है; यह दरारों को खोजने के बारे में है ताकि हम उन्हें ठीक कर सकें। यह दिखाकर कि इन "तालों" को कैसे खोला जा सकता है, शोधकर्ता डेवलपर्स को अधिक मजबूत, सुरक्षित AI बनाने में मदद करते हैं जिसे इतनी आसानी से धोखा नहीं दिया जा सकता।

संक्षेप में: TAO-Attack एक अत्यधिक कुशल, दो-चरणीय हैकिंग विधि है जो पहले AI को मना करने से रोकने के लिए मजबूर करती है, फिर काम पूरा करने के लिए मजबूर करती है, और इस बीच लक्ष्य की ओर सबसे सीधा रास्ता अपनाती है। यह दरवाजे पर सिर पटकने और एक मास्टर की (master key) का उपयोग करने के बीच का अंतर है जो पूरी तरह से फिट बैठती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →