← नवीनतम पेपर
💬 NLP

PivotAttack: Rethinking the Search Trajectory in Hard-Label Text Attacks via Pivot Words

PivotAttack एक क्वेरी-कुशल, "इनसाइड-आउट" फ्रेमवर्क पेश करता है जो हार्ड-लेबल टेक्स्ट हमलों के लिए मल्टी-आर्म्ड बैंडिट एल्गोरिदम का लाभ उठाकर परस्पर निर्भर टोकन के रणनीतिक "पिवट सेट्स" की पहचान करता है, जिससे यह विभिन्न मॉडलों में अटैक सक्सेस रेट और क्वेरी दक्षता दोनों में मौजूदा स्टेट-ऑफ-द-आर्ट विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yuzhi Liang, Shiliang Xiao, Jingsong Wei, Qiliang Lin, Xia Li

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzhi Liang, Shiliang Xiao, Jingsong Wei, Qiliang Lin, Xia Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही सख्त सुरक्षा गार्ड (AI मॉडल) के पास से एक नोट चुपके से ले जाने की कोशिश कर रहे हैं, जो केवल "हाँ" या "नहीं" में जवाब देता है यदि आपका नोट अंदर जाने के लिए अनुमति प्राप्त है। आप गार्ड की आंतरिक चेकलिस्ट नहीं देख सकते, आप संकेत (hints) नहीं मांग सकते, और आपके पास एक समय में एक प्रश्न पूछने का केवल एक मौका है इससे पहले कि आपकी ऊर्जा (क्वेरी बजट) समाप्त हो जाए।

यह Hard-Label Text Attacks की चुनौती है।

यह पेपर एक नई विधि पेश करता है जिसे PivotAttack कहा जाता है। ब्रूट-फोर्स (brute-force) के जरिए रास्ता खोजने के बजाय, PivotAttack गार्ड को चकमा देने के लिए एक चतुर और कुशल रणनीति का उपयोग करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. पुराना तरीका: "अंधा поиск" (बाहर से अंदर की ओर)

कल्पना कीजिए कि आप एक विशाल, अंधेरी भूलभुलैया में निकास (exit) खोजने की कोशिश कर रहे हैं। पुराने तरीके (पिछले हमलों की तरह) भूलभुलैया की बाहरी दीवार से शुरू होते हैं। वे दीवार में यादृच्छिक रूप से छेद करने की कोशिश करते हैं, इस उम्मीद में कि उन्हें कोई ऐसा अंतराल मिल जाएगा जो निकास तक ले जाए।

  • समस्या: वे गलत दीवारों को छेदने में बहुत अधिक ऊर्जा बर्बाद करते हैं। वे जहाँ से शुरू हुए थे उससे बहुत दूर जा सकते हैं, जिससे नोट अजीब और संदिग्ध लग सकता है, और वे निकास खोजने से पहले ही अपनी ऊर्जा समाप्त कर देते हैं।

2. नया तरीका: "पिवट रणनीति" (अंदर से बाहर की ओर)

PivotAttack खेल बदल देता है। दीवार से शुरू करने के बजाय, यह वहीं से शुरू होता है जहाँ आप खड़े हैं (मूल टेक्स्ट) और पूछता है: "इस वाक्य को बनाने वाली विशिष्ट चीजें क्या हैं?"

एक वाक्य को एक घर की तरह समझें।

  • अधिकांश शब्द केवल फर्नीचर (कुर्सियाँ, लैंप) हैं। यदि आप एक लैंप हटाते हैं, तो घर खड़ा रहता है।
  • लेकिन कुछ शब्द भार वहन करने वाली दीवारें (load-bearing walls) होते हैं। यदि आप एक भार वहन करने वाली दीवार को हटाते या बदलते हैं, तो पूरा घर ढह जाता है।

PivotAttack का लक्ष्य उन भार वहन करने वाली दीवारों (जिसे पेपर में Pivot Sets कहा गया है) को खोजना है।

3. यह "भार वहन करने वाली दीवारों" को कैसे खोजता है

AI को नहीं पता कि दीवारें कौन से शब्द हैं। इसलिए, PivotAttack एक स्मार्ट अनुमान लगाने वाले खेल का उपयोग करता है जिसे Multi-Armed Bandit कहा जाता है।

  • उपमा: कल्पना कीजिए कि स्लॉट मशीनों (arms) की एक पंक्ति है। आपके पास सीमित सिक्के (queries) हैं। आप उस मशीन को खोजना चाहते हैं जो सबसे अधिक भुगतान करती है।
  • प्रक्रिया: PivotAttack अलग-अलग शब्दों को बदलने (लीवर खींचने) की कोशिश करता है। यह जल्दी से सीख जाता है कि "happy" (खुश) शब्द को बदलने से AI का निर्णय नहीं बदलता (यह केवल फर्नीचर है)। लेकिन "love" (प्रेम) को "hate" (नफरत) में बदलने से AI का निर्णय बदल जाता है (वह एक भार वहन करने वाली दीवार थी!)।
  • परिणाम: यह फर्नीचर पर अपने सिक्के बर्बाद करना बंद कर देता है और पूरी तरह से दीवारों पर ध्यान केंद्रित करता है।

4. "पतन" (The Collapse)

एक बार जब PivotAttack पिवट सेट (महत्वपूर्ण शब्द) की पहचान कर लेता है, तो यह केवल एक शब्द को यादृच्छिक रूप से नहीं बदलता। यह रणनीतिक रूप से उन विशिष्ट "भार वहन करने वाले" शब्दों को पर्यायवाची शब्दों (synonyms) के साथ बदल देता है।

  • रूपक: पूरे घर को गिराने की कोशिश करने के बजाय, यह केवल उस एक विशिष्ट ईंट को निकाल देता है जो छत को थामे हुए है। धड़ाक! घर (AI का अनुमान) ढह जाता है, और लेबल बदल जाता है, लेकिन घर का बाकी हिस्सा (वाक्य का अर्थ) लगभग वैसा ही दिखता है।

यह एक बड़ी बात क्यों है?

  1. दक्षता (Efficiency): क्योंकि यह "फर्नीचर" पर समय बर्बाद करना बंद कर देता है, यह निकास (हमला) बहुत तेज़ी से खोज लेता है। यह अन्य तरीकों की तुलना में बहुत कम प्रश्नों (queries) का उपयोग करता है।
  2. गोपनीयता (Stealth): चूंकि यह केवल सबसे महत्वपूर्ण शब्दों को बदलता है और बाकी को वैसे ही छोड़ देता है, इसलिए वाक्य मनुष्यों को स्वाभाविक लगता है। यह निरर्थक (gibberish) नहीं दिखता।
  3. बड़ों को हराना: इस पेपर ने पुराने AI मॉडल्स और नवीनतम, सुपर-स्मार्ट लार्ज लैंग्वेज मॉडल्स (जैसे Qwen और Gemma) दोनों पर इसका परीक्षण किया। इन शक्तिशाली मॉडल्स में भी "भार वहन करने वाली दीवारें" होती हैं, और PivotAttack ने उन्हें पिछले किसी भी तरीके की तुलना में बेहतर पाया।

सारांश

PivotAttack एक कुशल ताला खोलने वाले (locksmith) की तरह है। हर चाबी को आज़माने के बजाय (पुराना तरीका), यह ताले की आवाज़ सुनता है, उस एक विशिष्ट पिन को ढूंढता है जो तंत्र को थामे हुए है, और दरवाजे को खोलने के लिए बस उसी पिन को घुमाता है। यह स्मार्ट है, तेज़ है, और पकड़ में आना कठिन है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →