← नवीनतम पेपर
💬 NLP

Bielik Guard: Efficient Polish Language Safety Classifiers for LLM Content Moderation

यह शोध पत्र Bielik Guard को प्रस्तुत करता है, जो एक कम्युनिटी-एनोटेटेड डेटासेट पर फाइन-ट्यून किए गए पोलिश भाषा के कुशल, कॉम्पैक्ट सुरक्षा क्लासिफायर का एक परिवार है, जो पांच सुरक्षा डोमेन में सामग्री को प्रभावी ढंग से वर्गीकृत करते हुए सटीकता और फॉल्स पॉजिटिव दरों में मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Krzysztof Wróbel, Jan Maria Kowalski, Jerzy Surma, Igor Ciuciura, Maciej Szymański

प्रकाशित 2026-02-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Krzysztof Wróbel, Jan Maria Kowalski, Jerzy Surma, Igor Ciuciura, Maciej Szymański

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक विशाल, अविश्वसनीय रूप से स्मार्ट लाइब्रेरी बनाई है जहाँ किताबें आपसे बात कर सकती हैं। ये हैं लार्ज लैंग्वेज मॉडल्स (LLMs)—AI चैटबॉट्स जो कहानियाँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, और किसी भी विषय पर चर्चा कर सकते हैं। लेकिन, बिल्कुल एक सार्वजनिक पुस्तकालय की तरह, आपको एक लाइब्रेरियन (पुस्तकालयाध्यक्ष) की आवश्यकता है ताकि यह सुनिश्चित किया जा सके कि इमारत के अंदर कोई अपशब्द न बोल रहा हो, अपराध की योजना न बना रहा हो, या खुद को नुकसान न पहुँचा रहा हो।

समस्या क्या है? दुनिया के अधिकांश बेहतरीन लाइब्रेरियन केवल अंग्रेजी बोलते हैं। यदि आप पोलिश बातचीत की निगरानी के लिए एक अंग्रेजी लाइब्रेरियन का उपयोग करने का प्रयास करते हैं, तो वे सूक्ष्म चुटकुलों, स्थानीय मुहावरों या निर्दोष शब्दों को गलती से गलत समझकर अच्छी बातचीत को रोक सकते हैं।

प्रस्तुत है बिएलिक गार्ड (Bielik Guard)

बिएलिक गार्ड की कहानी

इस शोध पत्र के लेखकों ने विशेष रूप से प्रशिक्षित पोलिश लाइब्रेरियन की एक टीम बनाई है जिसे बिएलिक गार्ड कहा जाता है। इसका नाम "बिएलिक" (एक राजसी चील) से आया है, और कोड नाम "सूयका" (Sójka) है, जिसका अर्थ है एक जे (Jay) (एक पक्षी जो शोर मचाने, सतर्क रहने और सुरक्षा करने के लिए जाना जाता है)।

उनका लक्ष्य सरल था: एक ऐसा सुरक्षा तंत्र बनाना जो पोलिश भाषा में धाराप्रवाह हो, पोलish संस्कृति को समझता हो, और इतना छोटा हो कि इसे किसी सुपरकंप्यूटर के बिना एक सामान्य कंप्यूटर पर चलाया जा सके।

उन्होंने इसे कैसे बनाया: "सामुदायिक भीड़" (The Community Crowd)

कुछ महंगे विशेषज्ञों को नियम पुस्तिका लिखने के लिए काम पर रखने के बजाय, टीम ने 1,500 आम पोलिश लोगों से मदद मांगी। उन्होंने एक सरल ऑनलाइन सर्वेक्षण स्थापित किया जहाँ स्वयंसेवकों ने टेक्स्ट के छोटे अंशों को पढ़ा और वोट दिया कि वे "सुरक्षित" थे या "असुरक्षित"।

इसे एक पड़ोस की निगरानी (neighborhood watch) की तरह समझें। एक व्यक्ति द्वारा यह तय करने के बजाय कि क्या खतरनाक है, पूरा पड़ोस वोट करता है। यदि 10 में से 6 पड़ोसी सोचते हैं कि एक मजाक बहुत बुरा है, तो सिस्टम सीख जाता है कि यह एक समस्या है। यदि केवल 2 पड़ोसी सोचते हैं कि यह बुरा है, तो सिस्टम सीख जाता है कि यह शायद ठीक है। यह दृष्टिकोण पोलिश भाषा की बारीकियों (nuance) को पकड़ता है—जैसे कि व्यंग्य, स्लैंग और सांस्कृतिक संदर्भ, जिन्हें एक विदेशी AI मिस कर सकता है।

उन्होंने अपने सिस्टम को प्रशिक्षित करने के लिए लगभग 6,885 अद्वितीय टेक्स्ट और 60,000 से अधिक वोट एकत्र किए।

दो मॉडल: "पॉकेट वॉच" और "ग्रैंडफादर क्लॉक"

टीम ने अपने सुरक्षा गार्ड के दो संस्करण बनाए:

  1. बिएलिक गार्ड 0.1B (द पॉकेट वॉच - जेब घड़ी):

    • आकार: बहुत छोटा (124 मिलियन पैरामीटर्स)। यह एक स्मार्टवॉच की तरह है।
    • गति: अत्यंत तेज़। यह टेक्स्ट की जांच लगभग तुरंत कर सकता है।
    • काम: उन ऐप्स के लिए बेहतरीन है जहाँ गति और बैटरी जीवन महत्वपूर्ण है।
    • प्रदर्शन: आश्चर्यजनक रूप से, यह छोटा मॉडल अन्य देशों के बहुत बड़े मॉडल्स की तुलना में पोलिश समस्याओं को पहचानने में अधिक स्मार्ट है।
  2. बिएलिक गार्ड 0.5B (द ग्रैंडफादर क्लॉक - दादाजी की घड़ी):

    • आकार: मध्यम (443 मिलियन पैरामीटर्स)। यह एक मजबूत दीवार घड़ी की तरह है।
    • गति: थोड़ी धीमी, लेकिन फिर भी बहुत तेज़।
    • काम: भारी काम करने वाला। यह अधिक सूक्ष्म खतरों को पकड़ता है और कठिन, जटिल टेक्स्ट को बेहतर तरीके से संभालता है।

वे किस चीज़ पर नज़र रखते हैं

पोलिश लाइब्रेरियन को पांच विशिष्ट प्रकार की परेशानियों को पहचानने के लिए प्रशिक्षित किया गया है:

  • घृणा/आक्रामकता (Hate/Aggression): लोगों के समूहों को धमकाना या उन पर हमला करना।
  • अपशब्द (Vulgarities): गाली-गलौज और गंदी भाषा।
  • यौन सामग्री (Sexual Content): स्पष्ट विवरण या कामुकता के अनुरोध।
  • अपराध (Crime): ड्रग्स बनाने या धोखाधड़ी करने के निर्देश।
  • आत्म-क्षति (Self-Harm): आत्महत्या या खान-पान संबंधी विकारों (eating disorders) को बढ़ावा देने वाली कोई भी चीज़।

नोट: वे जानबूझकर "फेक न्यूज" या "कॉपीराइट" जैसी चीजों को अनदेखा करते हैं क्योंकि उनके लिए अलग तरह की सोच की आवश्यकता होती है। वे तत्काल सुरक्षा पर ध्यान केंद्रित करते हैं।

बड़ा परीक्षण: वे क्यों जीतते हैं

टीम ने उद्योग के "दिग्गजों" (जैसे Llama Guard और QwenGuard) के खिलाफ अपने लाइब्रेरियन का परीक्षण किया, जो बहुत बड़े मॉडल हैं और 20+ भाषाएँ बोलने के लिए डिज़ाइन किए गए हैं।

यहाँ परिणाम है, जिसे सरल भाषा में समझाया गया है:

  • दिग्गज: क्योंकि वे हर भाषा बोलने की कोशिश करते हैं, वे अक्सर पोलिश भाषा में भ्रमित हो जाते हैं। वे बहुत अधिक "रुको!" चिल्लाते हैं, जिससे निर्दोष बातचीत भी रुक जाती है (उच्च फॉल्स पॉजिटिव/False Positives)। कल्पना कीजिए कि एक गार्ड हर किसी को रोकता है क्योंकि वह थोड़ा संदिग्ध दिखता है।
  • बिएलिक गार्ड: क्योंकि इसे विशेष रूप से पोलिश डेटा पर प्रशिक्षित किया गया था, यह जानता है कि वास्तव में क्या देखना है।
    • सटीकता (Precision): जब बिएलिक गार्ड कहता है, "यह खतरनाक है," तो वह 77% सही होता है।
    • दिग्गज: जब अंग्रेजी-प्रशिक्षित दिग्गज कहते हैं, "यह खतरनाक है," तो वे अक्सर गलत होते हैं (पोलिश टेक्स्ट पर केवल ~13% सही)।
    • परिणाम: बिएलिक गार्ड सामान्य लोगों को बिना रोके स्वतंत्र रूप से बात करने देता है, जबकि वास्तविक बुरे तत्वों को पकड़ लेता है। यह एक ऐसे गार्ड की तरह है जो एक चंचल धक्का और एक असली लड़ाई के बीच का अंतर जानता है, जबकि विदेशी गार्ड एक चंचल धक्के को भी लड़ाई समझ लेता है।

एक विशेष विशेषता: रोकना नहीं, बल्कि मदद करना

अधिकांश सुरक्षा प्रणालियाँ केवल "नहीं" कहती हैं और संदेश को ब्लॉक कर देती हैं। लेकिन आत्म-क्षति (Self-Harm) श्रेणी के लिए, बिएलिक गार्ड को अलग तरह से डिज़ाइन किया गया है।

यदि कोई कुछ दुखद या खतरनाक लिखता है, तो केवल उसे चुप कराने के बजाय, सिस्टम को मदद करने के लिए डिज़ाइन किया गया है। इसे संकट हेल्पलाइन (जैसे पोलैंड में "टेлефон ज़ौफ़ानिया") का नंबर प्रदान करने के लिए सेट किया जा सकता है। यह उपयोगकर्ता के साथ एक ऐसे व्यक्ति की तरह व्यवहार करता है जिसे सहायता की आवश्यकता है, न कि केवल एक नियम तोड़ने वाले के रूप में।

निष्कर्ष

बिएलिक गार्ड यह सिद्ध करता है कि किसी विशिष्ट भाषा को सुरक्षित रखने के लिए आपको विशाल, महंगे AI की आवश्यकता नहीं है। स्थानीय डेटा, सामुदायिक वोटों और स्मार्ट, छोटे मॉडल्स का उपयोग करके, आप एक ऐसा सुरक्षा तंत्र बना सकते हैं जो:

  1. पोलिश बोलने वालों के लिए अधिक सटीक है।
  2. कम परेशान करने वाला है (यह निर्दोष लोगों को नहीं रोकता)।
  3. चलाने में सस्ता और तेज़ है।

यह एक याद दिलाता है कि भाषा सुरक्षा के लिए, संस्कृति को जानना अक्सर एक बड़े दिमाग होने से अधिक महत्वपूर्ण होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →