← नवीनतम पेपर
💬 NLP

Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

यह शोध पत्र 932 सुरक्षा अध्येशनों से व्युत्पन्न एक व्यापक 4×6 लक्ष्य × तकनीक (Target × Technique) वर्गीकरण और बेंचमार्क कवरेज ऑडिट फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान LLM अटैक बेंचमार्क सामूहिक रूप से अधिकतम 25% खतरे की सतह को कवर करते हैं और महत्वपूर्ण मूल्यांकन अंतराल एवं नामकरण विखंडन से ग्रस्त हैं।

मूल लेखक: Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray, Alexey A. Shvets

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray, Alexey A. Shvets

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: "सुरक्षा मानचित्र" की समस्या

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया एक विशाल, हलचल भरे शहर की तरह है। इन मॉडल्स को बनाने वाले लोग शहर योजनाकारों (city planners) की तरह हैं, जो यह सुनिश्चित करने की कोशिश कर रहे हैं कि शहर अपराधियों (हैकर्स) से सुरक्षित रहे।

कुछ वर्षों से, शोधकर्ता अपराधियों द्वारा शहर में घुसपैकरने के नए तरीके खोज रहे हैं। लेकिन समस्या यह है कि हर कोई अलग-अलग नक्शों, एक ही अपराध के लिए अलग-अलग नामों और शहर की सुरक्षा मापने के अलग-अलग तरीकों का उपयोग कर रहा है। कुछ शोधकर्ता कहते हैं, "हमने बैंकों की जाँच की!" जबकि अन्य कहते हैं, "हमने पावर प्लांट की जाँच की!" लेकिन किसी ने यह नहीं जाँचा कि क्या पूरा शहर सुरक्षित है।

यह शोध पत्र उन मानचित्रकारों (cartographers) की एक टीम की तरह है जिन्होंने नक्शों पर बहस करना बंद करने और इसके बजाय AI पर हमला करने के हर संभावित तरीके का एक विशाल, मास्टर मैप बनाने का निर्णय लिया। फिर उन्होंने सुरक्षा गार्डों (यानी "बेंचमार्क") के वर्तमान गश्त मार्गों की जाँच की ताकि यह देखा जा सके कि क्या वे वास्तव में पूरे शहर को कवर कर रहे हैं।

चौंकाने वाला निष्कर्ष? सुरक्षा गार्ड केवल एक छोटे, भीड़भाड़ वाले मोहल्ले (शहर का लगभग 25%) में गश्त कर रहे हैं, जबकि बड़े, खतरनाक जिले पूरी तरह से खाली और असुरक्षित हैं।


1. मास्टर मैप (टैक्सोनॉमी/वर्गीकरण)

शोधकर्ताओं ने 2023 और 2026 के बीच प्रकाशित 932 वैज्ञानिक शोध पत्रों का अध्ययन किया। उन्हें विभिन्न हमलों के 6,300 से अधिक उल्लेख मिले।

नामों का भ्रम:
कल्पना कीजिए कि यदि एक ही प्रकार की कार चोरी को एक शहर में "हॉटवायरिंग" कहा जाए, दूसरे में "कीलेस एंट्री थेफ्ट" कहा जाए, और तीसरे में "द साइलेंट हाइस्ट" कहा जाए। AI हमलों के साथ भी यही हो रहा था।

  • उपमा (Analogy): प्रसिद्ध "GCG" हमला (AI को चकमा देने का एक तरीका) 376 शोध पत्रों में 29 अलग-अलग नामों से जाना गया।
  • समाधान: टीम ने एक मानक शब्दकोश (टैक्सोनॉमी) बनाया जिसमें 507 विशिष्ट "पत्तियाँ" (श्रेणियाँ) थीं। उन्होंने इस अव्यवस्था को साफ किया, 29 नामों को एक में मिला दिया, ताकि सभी एक ही भाषा बोल सकें।

संरचना:
उन्होंने इन हमलों को एक 4x6 ग्रिड (मैट्रिक्स) में व्यवस्थित किया:

  • पंक्तियाँ (लक्ष्य): अपराधी क्या चाहता है?
    1. सेफ्टी बायपास (Safety Bypass): AI को कुछ बुरा कहने के लिए मजबूर करना (जैसे नफरत भरी बातें)।
    2. सिस्टम हाइजैकिंग (System Hijacking): AI से कुछ बुरा करवाना (जैसे फाइलें डिलीट करना या पैसे भेजना)।
    3. सूचना चोरी (Information Theft): AI की याददाश्त से गुप्त जानकारी चुराना।
    4. सेवा व्यवधान (Service Disruption): AI को इतना धीमा या महंगा बना देना कि वह क्रैश हो जाए (जैसे ट्रैफिक जाम)।
  • स्तंभ (विधि): वे इसे कैसे करते हैं?
    • भ्रमित करने वाले शब्दों का उपयोग करना, AI से झूठ बोलना, कोड छिपाना, या AI के आंतरिक मस्तिष्क पर हमला करना।

2. सुरक्षा जाँच (बेंचमार्क ऑडिट)

शोधकर्ताओं ने उद्योग में उपयोग किए जाने वाले तीन सबसे प्रसिद्ध "सुरक्षा परीक्षणों" (HarmBench, InjecAgent, और AgentDojo) को उनके मास्टर मैप पर अंकित किया।

परिणाम:

  • शून्य ओवरलैप (Zero Overlap): तीनों टेस्ट एक ही चीज़ की जाँच नहीं करते हैं। वे तीन अलग-अलग फायर डिपार्टमेंट की तरह हैं: एक केवल किचन की जाँच करता है, एक केवल गैरेज की, और एक केवल बेसमेंट की। उनमें से कोई भी पूरे घर की जाँच नहीं करता है।
  • कवरेज गैप: ये तीनों टेस्ट मिलकर मास्टर मैप का केवल 25% हिस्सा कवर करते हैं।
  • अंधे मोड़ (Blind Spots):
    • "सर्विस डिसरप्शन" जिला: यह वह क्षेत्र है जहाँ हमले AI को क्रैश करने या इसे चलाने में बहुत अधिक खर्च कराने की कोशिश करते हैं। शून्य प्रमुख टेस्ट इसकी जाँच करते हैं।
    • "मॉडल इंटरनल्स" जिला: यह वह क्षेत्र है जहाँ हैकर्स सीधे AI के आंतरिक मस्तिष्क में बदलाव करते हैं। शून्य टेस्ट भी इसकी जाँच करते हैं।

यह क्यों मायने रखता है:
शोध पत्र ने पाया कि इन "ब्लाइंड स्पॉट" क्षेत्रों में हमले वास्तव में बहुत प्रभावी हैं। कुछ हमले AI को 46 गुना धीमा कर सकते हैं या इसे चलाने की लागत 100 गुना अधिक बढ़ा सकते हैं, फिर भी कोई इनकी जाँच नहीं कर रहा है। यह एक ऐसे फायर अलार्म की तरह है जो केवल तब बीप करता है जब आपका टोस्ट जल जाता है, लेकिन जब पूरा घर आग की चपेट में आता है तो शांत रहता है।


3. "कैच-ऑल" (सब कुछ इसमें डाल देना) की समस्या

शोधकर्ताओं ने देखा कि क्योंकि यह क्षेत्र बहुत तेज़ी से आगे बढ़ रहा है, इसलिए कई वैज्ञानिक नए हमलों को "विविध" (Miscellaneous) बाल्टी में डाल देते हैं क्योंकि उनके पास अभी कोई विशिष्ट नाम नहीं होता।

  • उपमा: यह एक ऐसी लाइब्रेरी की तरह है जहाँ 60% नई किताबों को बस "सामान" (Stuff) लेबल वाले एक बॉक्स में ठूस दिया जाता है।
  • प्रभाव: इससे यह जानना कठिन हो जाता है कि कितने वास्तविक नए हमले हो रहे हैं। यह शोध पत्र सुझाव देता है कि हमें बेहतर नाम बनाने की आवश्यकता है ताकि हम खतरों को वास्तव में गिन सकें।

4. उन्होंने इस कार्य के साथ क्या किया

केवल कमियों की ओर इशारा करने के बजाय, शोधकर्ताओं ने अपने टूल्स को जनता के लिए जारी किया:

  1. मास्टर मैप: सभी 507 हमले के प्रकारों की डाउनलोड करने योग्य सूची।
  2. ऑडिट रिपोर्ट: एक स्पष्ट चार्ट जो दिखाता है कि मास्टर मैप के कौन से हिस्से का परीक्षण किया जा रहा है और किन हिस्सों को छोड़ दिया गया है।
  3. नए परीक्षणों के लिए ब्लूप्रिंट: उन्होंने दिखाया कि कैसे वे अपने मैप का उपयोग करके "ब्लाइंड स्पॉट्स" (जैसे सर्विस डिसरप्शन जिला) के लिए एक नया टेस्ट बना सकते हैं।

निष्कर्ष (The Bottom Line)

यह शोध पत्र तर्क देता है कि हम वर्तमान में "गलत चीजों के लिए परीक्षण कर रहे हैं।" हम इस बात के परीक्षण में बहुत अच्छे हैं कि क्या एक AI बदतमीजी करेगा, लेकिन हम इस बात के परीक्षण में बहुत खराब हैं कि क्या एक AI क्रैश हो जाएगा, डेटा चुरा लेगा, या वास्तविक दुनिया में नुकसान पहुँचाने के लिए हाइजैक कर लिया जाएगा।

मुख्य बात: सिर्फ इसलिए कि एक सुरक्षा परीक्षण कहता है कि एक AI "सुरक्षित" है, इसका मतलब यह नहीं है कि वह सुरक्षित है। इसका मतलब केवल यह है कि उसने उस विशिष्ट, संकीर्ण परीक्षण को पास कर लिया है जो उसे दिया गया था। वास्तव में सुरक्षित होने के लिए, हमें अपने परीक्षण का विस्तार पूरे शहर को कवर करने के लिए करना होगा, न कि केवल उस मोहल्ले तक सीमित रहना होगा जिसमें हम अभी सहज महसूस कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →