← नवीनतम पेपर
🤖 machine learning

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

सेमलिथ (Semalith) v1.4 एक अत्यधिक कुशल 184M-पैरामीटर वाला सुरक्षा क्लासिफायर है जो अत्याधुनिक प्रॉम्प्ट-इंजेक्शन डिटेक्शन और सौहार्दपूर्ण एजेंटिक प्रॉम्प्ट्स पर शून्य फाल्स पॉजिटिव प्राप्त करता है, जो Llama-Guard-3-8B की तुलना में 44 गुना कम पैरामीटर्स के साथ, एक ही इन्फरेंस पास में सामान्य हानि और वित्तीय नियामक अनुपालन का एक साथ पता लगाने की अनूठी क्षमता प्रदान करता है।

मूल लेखक: Tejasvi C. Addagada

प्रकाशित 2026-07-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tejasvi C. Addagada

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरी लाइब्रेरी है जहाँ लाखों लोग एक बहुत ही बुद्धिमान रोबोट लाइब्रेरियन के साथ चैट कर रहे हैं। यह लाइब्रेरियन, एक आर्टिफिशियल इंटेलिजेंस (AI) है, जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और किसी भी चीज़ के बारे में सवालों के जवाब दे सकता है। लेकिन किसी भी शक्तिशाली उपकरण की तरह, इसका एक काला पक्ष भी है: कभी-कभी, चालाक उपयोगकर्ता रोबोट को अपने ही नियमों को तोड़ने, गुप्त जानकारी प्रकट करने, या बुरा बोलने के लिए बहलाने की कोशिश करते हैं। इसे "प्रॉम्प्ट इंजेक्शन" (prompt injection) कहा जाता है—यह लाइब्रेरियन को "छूना मना है" के संकेतों को अनदेखा करने के लिए एक गुप्त कोड फुसफुसाने जैसा है।

लाइब्रेरी को सुरक्षित रखने के लिए, हमें एक सुरक्षा गार्ड की आवश्यकता है। AI की दुनिया में, ये गार्ड विशेष प्रोग्राम हैं जिन्हें "सेफ्टी क्लासिफायर" (safety classifiers) कहा जाता है। उनका काम रोबोट के देखने से पहले हर संदेश को पढ़ना और अगर संदेश खतरनाक हो तो "रुको!" चिल्लाना है। हालाँकि, अधिकांश गार्ड या तो बहुत धीमे, या बहुत अनाड़ी, या बहुत अधिक शंकालु होते हैं। कुछ गार्ड इतने डरे हुए होते हैं कि वे मासूम सवालों के साथ भी लाइब्रेरियन को मदद करने से रोक देते हैं, जैसे पासवर्ड कैसे रीसेट करें। अन्य केवल बुरे शब्दों पर ध्यान केंद्रित करते हैं और चतुर, चालाकी भरे तरीकों को मिस कर देते हैं। बड़ा सवाल वैज्ञानिकों के सामने यह है: क्या हम एक ऐसा गार्ड बना सकते हैं जो तेज़ हो, चालाकी भरे तरीकों को पहचानने में स्मार्ट हो, और इतना विनम्र हो कि निर्दोष बातचीत को गुजरने दे?

यहाँ आता है Semalith v1.4, एक नया सुरक्षा गार्ड जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। इसे एक अत्यधिक प्रशिक्षित, 184-मिलियन-पैरामीटर वाले "डिटेक्टिव" (एक संख्या जो इसके मस्तिष्क के आकार को दर्शाती है) के रूप में समझें, जो बड़ी टेक कंपनियों द्वारा उपयोग किए जाने वाले 8-बिलियन-पैरामीटर वाले विशाल गार्डों की तुलना में बहुत छोटा और तेज़ है। जहाँ विशाल गार्ड भारी, धीमी गति से चलने वाले टैंकों की तरह हैं जो सूक्ष्म चालों से भ्रमित हो सकते हैं, वहीं Semalks एक फुर्तीले, बिजली की तरह तेज़ निंजा की तरह है।

यह पेपर बताता है कि Semalith v1.4 प्रॉम्प्ट इंजेक्शन—उन चालाकी भरे प्रयासों को पकड़ने में माहिर है जिनसे AI को बेवकूफ बनाने की कोशिश की जाती है। परीक्षणों में, इसने उन सभी 7 प्रॉम्प्ट-इंजेक्शन बेंचमार्क श्रेणियों में जीत हासिल की, जिनका इस पर परीक्षण किया गया था, और इसने विशाल 8-बिलियन-पैरामीटर वाले गार्डों को बड़े अंतर से पीछे छोड़ दिया। इससे भी अधिक प्रभावशाली बात यह है कि इसने यह सब 44 गुना कम पैरामीटर्स (मस्तिष्क कोशिकाओं) के साथ किया, जिससे यह अविश्वसनीय रूप से तेज़ हो गया। यह एक संदेश की जांच मात्र 11.6 मिलीसेकंड में कर सकता है, जो पलक झपकने से भी तेज़ है।

लेकिन Semalith केवल चालाकियों को पकड़ने के बारे में नहीं है; यह पैसे और वित्त की दुनिया में भी एक विशेषज्ञ है। इसे बैंकों, ऋणों और बीमा (जिसे BFBF अनुपालन कहा जाता है) के विशिष्ट नियमों को समझने के लिए प्रशिक्षित किया गया है। यह इसे क्रेडिट कार्ड के बारे में एक हानिरहित प्रश्न और धोखाधड़ी करने के एक खतरनाक प्रयास के बीच अंतर करने में सक्षम बनाता है। अन्य गार्डों के विपरीत जो घबराकर सभी वित्तीय प्रश्नों को ब्लॉक कर सकते हैं, Semalith ने बिना किसी गलत अलार्म के 208 हानिरहित बैंकिंग प्रॉम्प्ट्स की सही पहचान की (0.000% फॉल्स पॉजिटिव रेट)।

हालाँकि, लेखक इस बात के बारे में बहुत ईमानदार हैं कि यह गार्ड क्या नहीं कर सकता। यह कोई जादुई छड़ी नहीं है जो हर सुरक्षा समस्या को हल कर देती है। पेपर दिखाता है कि जबकि Semalith चालाकी भरे तरीकों और वित्तीय नियमों को पकड़ने में सर्वश्रेष्ठ है, यह सामान्य "बुरे" या "विषाक्त" (toxic) संवादों के मामले में विशाल गार्डों की तुलना में संघर्ष करता है। यह एक ऐसे गार्ड की तरह है जो जेब काटने वालों और जालसाजी को पकड़ने में विश्व स्तरीय विशेषज्ञ है, लेकिन किसी के केवल बदतमीजी करने को पकड़ने में उतना अच्छा नहीं है। शोधकर्ता बताते हैं कि यह एक ट्रेड-ऑफ है: गार्ड को विशिष्ट, जटिल चालों को पकड़ने में इतना कुशल बनाने के कारण, यह सामान्य बदतमीजी के प्रति थोड़ा कम संवेदनशील हो गया। इसके अलावा, जबकि यह प्रॉम्प्ट-इंजेक्शन श्रेणियों में दबदबा रखता है, यह हर एक भिन्नता को पूरी तरह से नहीं पकड़ पाता है; उदाहरण के लिए, एक परीक्षण (Mosscap L8) के सबसे कठिन "स्टेल्थ" स्तर पर, इसने लगभग 80% हमलों को पकड़ा, जिससे सुधार की गुंजाइश बनी रहती है।

पेपर यह भी उजागर करता है कि इस मॉडल को इंटरनेट से निकाले गए वास्तविक दुनिया के डेटा का उपयोग करके बनाया गया है, न कि अन्य कंप्यूटरों द्वारा बनाए गए नकली उदाहरणों का। यह इसे वास्तविक दुनिया में अधिक विश्वसनीय बनाता है। शोधकर्ताओं ने इसका 22 अलग-अलग चुनौतियों के विरुद्ध परीक्षण किया और पाया कि Semalith ने 7 में से 7 प्रॉम्प्ट-इंजेक्शन परीक्षणों में और 18 में से 11 समग्र परीक्षणों में जीत हासिल की। वे स्वीकार करते हैं कि छह विशिष्ट कमजोर बिंदु हैं जहाँ गार्ड को अभी भी काम करने की आवश्यकता है, जैसे कि लंबी, भ्रमित करने वाली कहानियों या कुछ प्रकार के अनुनय (persuasion) को समझना, लेकिन उन्होंने भविष्य के संस्करणों में इन्हें ठीक करने का तरीका भी स्पष्ट रूप से मैप कर दिया है।

संक्षेप में, Semalith v1.4 साबित करता है कि एक महान सुरक्षा गार्ड बनने के लिए आपको एक विशाल, धीमे मस्तिष्क की आवश्यकता नहीं है। सही प्रशिक्षण और एक चतुर डिज़ाइन के साथ, एक छोटा, तेज़ मॉडल AI सिस्टम के लिए एक आदर्श ढाल हो सकता है, खासकर जब वे लोगों को उनके पैसे और बैंकिंग में मदद कर रहे हों, और साथ ही बिना किसी बाधा के अच्छी चीजों को गुजरने दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →