← नवीनतम पेपर
🤖 machine learning

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

यह अध्ययन LLM अनुप्रयोगों के लिए OWASP टॉप 10 के विरुद्ध Llama मॉडलों का बेंचमार्किंग करता है, जो यह प्रकट करता है कि विशेष, कॉम्पैक्ट Llama-Guard-3-1B मॉडल खतरे का पता लगाने की सटीकता और लेटेंसी में बड़े सामान्य-उद्देश्य वाले वेरिएंट्स से काफी बेहतर प्रदर्शन करता है और AI सुरक्षा अनुसंधान को आगे बढ़ाने के लिए एक ओपन-सोर्स डेटासेट प्रदान करता है।

मूल लेखक: Nourin Shahin, Izzat Alsmadi

प्रकाशित 2026-01-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nourin Shahin, Izzat Alsmadi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-टेक इमारत (आपका कंप्यूटर सिस्टम) की सुरक्षा के लिए सुरक्षा गार्डों की एक टीम को काम पर रख रहे हैं ताकि उन्हें चालाक चोरों (हैकर्स) से बचाया जा सके। चोर केवल दरवाजा नहीं तोड़ते; वे पहेलियाँ बुझाकर, भेष बदलकर या इमारत के मालिक होने का नाटक करके गार्डों को धोखा देने की कोशिश करते हैं।

यह पेपर एक विशिष्ट टीम के लिए रिपोर्ट कार्ड की तरह है जिसे Llama मॉडल्स कहा जाता है। शोधकर्ताओं ने इन गार्डों का परीक्षण एक प्रसिद्ध "वांटेड लिस्ट" के खिलाफ किया जो AI सिस्टम को तोड़ने के शीर्ष 10 तरीकों (OWASP Top 10) को दर्शाती है।

यहाँ उन्होंने क्या पाया, जिसे सरल भाषा में समझाया गया है:

1. "बड़ा आदमी" बनाम "विशेषज्ञ"

शोधकर्ताओं ने दो प्रकार के गार्डों का परीक्षण किया:

  • सामान्यवादी (Base Models): ये विशाल, शक्तिशाली गार्ड हैं जिन्हें सब कुछ करने के लिए प्रशिक्षित किया गया है—कहानियां लिखना, गणित हल करना और चैट करना। शोधकर्ताओं को उम्मीद थी कि वे सबसे अच्छे होंगे क्योंकि वे इतने बड़े और बुद्धिमान हैं।
  • विशेषज्ञ (Guard Models): ये छोटे गार्ड हैं जिन्हें केवल खतरे को पहचानने और "सुरक्षित" (Safe) या "असुरक्षित" (Unsafe) कहने के लिए प्रशिक्षित किया गया है।

चौंकाने वाली बात: बड़े, सामान्यवादी गार्ड चोरों को पकड़ने में बहुत खराब थे। वास्तव में, सबसे बड़े मॉडल (जैसे 8-बिलियन पैरामीटर वाले) एक भी खतरे को पकड़ने में विफल रहे (0% सटीकता)। वे धीमे भी थे, जवाब देने से पहले सोचने में काफी समय लेते थे।

छोटे, विशेषज्ञ गार्ड असली हीरो निकले। टेस्ट किए गए सबसे छोटे मॉडल (Llama-Guard-3-1B) ने 76% हमलों को पकड़ा और उसने यह काम अविश्वसनीय रूप से तेजी से किया।

उपमा (Analogy): यह एक विश्व प्रसिद्ध शेफ (बड़े मॉडल) से क्लब के दरवाजे पर फर्जी आईडी (Fake ID) पहचानने के लिए कहने जैसा है। वे खाना बनाने में बेहतरीन हो सकते हैं, लेकिन उन्हें नहीं पता कि फर्जी आईडी कैसी दिखती है। हालांकि, यदि आप एक बाउंसर को काम पर रखते हैं जो केवल आईडी चेक करता है (छोटा विशेषज्ञ), तो वह इस काम में बहुत तेज और बेहतर होता है, भले ही वह शानदार भोजन न बना सके।

2. आकार सुरक्षा की गारंटी नहीं है

एक आम धारणा है कि "बड़ा ही बेहतर है।" AI में, लोग अक्सर सोचते हैं कि अधिक "मस्तिष्क शक्ति" (पैरामीटर्स) वाला मॉडल अपने आप सुरक्षित हो जाता है।

  • पेपर का निष्कर्ष: यह सुरक्षा के लिए गलत है। अध्ययन में एक विपरीत संबंध (Inverse Relationship) पाया गया: मॉडल जितना बड़ा होता गया, खतरों को पहचानने में वह उतना ही खराब होता गया।
  • क्यों? बड़े मॉडल रचनात्मक और मददगार होने की कोशिश करते हैं, जिससे वे चालाकी भरी ट्रिक्स से आसानी से भ्रमित हो जाते हैं। छोटे मॉडल विशेष रूप से "बुरे" पैटर्न को खोजने के लिए प्रशिक्षित किए गए थे, इसलिए वे उन्हें तुरंत पहचान लेते थे।

3. "ट्रिक" (चाल) वाले टेस्ट

शोधकर्ताओं ने केवल साधारण प्रश्न नहीं पूछे। उन्होंने OWASP Top 10 सूची के आधार पर 100 अलग-अलग "ट्रिक्स" का उपयोग किया। इन ट्रिक्स में शामिल थे:

  • "DAN" ट्रिक: बिना किसी नियम वाले चरित्र का नाटक करना ताकि AI को अपने ही नियमों को तोड़ने के लिए मजबूर किया जा सके।
  • "सीक्रेट कोड" ट्रिक: कोड (जैसे Base64) के अंदर बुरे निर्देशों को छिपाना ताकि AI को पता न चले कि उससे कुछ खतरनाक करने को कहा जा रहा है।
  • "सप्लाई चेन" ट्रिक: AI को एक फर्जी वेबसाइट से वायरस लोड करने के लिए धोखा देने की कोशिश करना।

परिणामों से पता चला कि कोई भी एक गार्ड हर चीज़ में परफेक्ट नहीं था।

  • एक छोटा मॉडल "सूचना लीक" (Information Leaks) को पकड़ने में बहुत अच्छा था (90% सफलता) लेकिन "प्रॉम्प्ट इंजेक्शन" (Prompt Injection) को पकड़ने में बुरा था (50% सफलता)।
  • दूसरा मॉडल "प्रॉम्प्ट इंजेक्शन" को पकड़ने में परफेक्ट था (100%) लेकिन "सिस्टम प्रॉम्प्ट लीक" (System Prompt Leaks) को पकड़ने में बहुत खराब था (0% सफलता)।

4. "इंस्ट्रक्शन" (निर्देश) का कारक

अध्ययन से पता चला कि आप मॉडल से कैसे बात करते हैं, यह मायने रखता है।

  • यदि आप एक कच्चे, बिना प्रशिक्षित मॉडल से पूछते हैं कि "क्या यह सुरक्षित है?", तो वह बहुत लंबी और भ्रमित करने वाली बातें कर सकता है।
  • यदि आप एक ऐसे मॉडल का उपयोग करते हैं जिसे फाइन-ट्यून (Fine-tuned) किया गया है (विशेष रूप से निर्देशों का पालन करने के लिए प्रशिक्षित), तो वह प्रश्न को बहुत बेहतर समझता है। "इंस्ट्रक्ट" (Instruct) वर्जन वाले मॉडल कच्चे वर्जन की तुलना में काफी बेहतर प्रदर्शन करते हैं।

5. आपको क्या करना चाहिए? (मुख्य सीख)

इन परिणामों के आधार पर, पेपर सुझाव देता है कि यदि आप एक AI सिस्टम को सुरक्षित करना चाहते हैं:

  • केवल सबसे बड़े मॉडल का उपयोग न करें। यह धीमा और अप्रभावी है।
  • एक "विशेषज्ञ" गार्ड का उपयोग करें। अपने मुख्य सिस्टम तक पहुँचने से पहले इनपुट की जांच करने के लिए एक छोटे, विशेष मॉडल (जैसे Llama-Guard-3-1B) का उपयोग करें।
  • अपनी सुरक्षा की परतें बनाएं। चूंकि कोई भी एक मॉडल हर प्रकार के हमले को नहीं पकड़ पाता, इसलिए एक टीम का उपयोग करें: एक गार्ड "बुरे शब्दों" की जांच के लिए और दूसरा "चालाकी भरे निर्देशों" की जांच के लिए।
  • अपनी कमियों (Blind Spots) पर नज़र रखें। इस अध्ययन में मौजूद सबसे अच्छे गार्ड भी कुछ विशिष्ट ट्रिक्स को पकड़ने में चूक गए, जैसे कि AI के गुप्त निर्देशों को चुराने की कोशिश (System Prompt Leakage) या फर्जी सॉफ्टवेयर प्लगइन्स (Supply Chain) से जुड़े हमले।

संक्षेप में: AI सुरक्षा के लिए, एक विशाल, विचलित होने वाले सेलिब्रिटी की तुलना में एक छोटा, विशेषज्ञ बाउंसर अक्सर बेहतर होता है। कच्ची ताकत (Raw Size) की तुलना में गति और विशिष्ट प्रशिक्षण अधिक महत्वपूर्ण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →