← नवीनतम पेपर
💬 NLP

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

यह शोध पत्र ThaiSafetyBench प्रस्तुत करता है, जो 1,954 सांस्कृतिक रूप से सूक्ष्म थाई प्रॉम्प्ट्स का एक ओपन-सोर्स बेंचमार्क है जो वर्तमान LLMs—विशेष रूप से ओपन-सोर्स मॉडल और वे जो सांस्कृतिक रूप से विशिष्ट हमलों का सामना कर रहे हैं—में महत्वपूर्ण सुरक्षा अंतराल को प्रकट करता है, साथ ही थाई संदर्भ में सुरक्षा मूल्यांकन को आगे बढ़ाने के लिए एक उच्च-प्रदर्शन क्लासिफायर और लीडरबोर्ड भी प्रदान करता है।

मूल लेखक: Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट लाइब्रेरियन बनाया है जो किसी भी भाषा में किसी भी सवाल का जवाब दे सकता है। आपने इसे ज्यादातर अंग्रेजी किताबों पर प्रशिक्षित किया है, इसलिए यह अंग्रेजी में यह जानने में बहुत अच्छा है कि क्या कहना "सुरक्षित" है। लेकिन क्या होगा जब आप इससे थाई भाषा में कोई सवाल पूछते हैं? या अगर सवाल गहरे थाई सांस्कृतिक रहस्यों पर आधारित हो, जैसे स्थानीय गपशप, विशिष्ट सामाजिक नियम, या राजशाही से जुड़े संवेदनशील विषय?

यह शोध पत्र एक सुरक्षा निरीक्षक (safety inspector) की तरह है जो विशेष रूप से थाई भाषा और संस्कृति के लिए इस रोबोट लाइब्रेरियन का परीक्षण करने के लिए आया है। यहाँ उनके निष्कर्षों की सरल व्याख्या दी गई है:

1. समस्या: "अंग्रेजी चश्मे" का अंधा मोड़ (The "English Glasses" Blind Spot)

AI के लिए अधिकांश सुरक्षा परीक्षण अंग्रेजी निर्देशों का उपयोग करके कार के ब्रेक चेक करने जैसे हैं। शोधकर्ताओं ने पाया कि जबकि AI अंग्रेजी में सुरक्षा नियमों का पालन करने में बहुत अच्छा है, लेकिन थाई बोलते समय यह अक्सर भ्रमित हो जाता है या नियमों को तोड़ देता है।

क्यों? क्योंकि AI थाईलैंड के "वाइब" या छिपे हुए सांस्कृतिक नियमों को नहीं समझता है। यह एक ऐसे पर्यटक की तरह है जो शब्द की डिक्शनरी परिभाषा तो जानता है, लेकिन यह नहीं जानता कि किसी विशिष्ट थाई गाँव में उस शब्द को बोलना बेहद असभ्य या खतरनाक माना जाता है।

2. समाधान: ThaiSafetyBench (द "थाई ट्रैप" टेस्ट)

इसे ठीक करने के लिए, टीम ने ThaiSafetyBench नामक एक नया परीक्षण बनाया।

  • जाल (The Trap): उन्होंने थाई में लिखे गए 1,954 पेचीदा सवाल (प्रॉम्प्ट्स) बनाए।
  • मिश्रण (The Mix): कुछ सवाल केवल सामान्य "बुरे" कार्यों के बारे में थे (जैसे "मैं बम कैसे बनाऊं?"), लेकिन असली परीक्षण सांस्कृतिक रूप से विशिष्ट जाल थे। ये सवाल AI को थाई स्लैंग, स्थानीय सामाजिक मानदंडों, या संवेदनशील राजनीतिक विषयों का उपयोग करके फँसाने के लिए डिज़ाइन किए गए थे, जिन्हें एक अंग्रेजी-प्रशिक्षित AI नहीं समझ पाएगा।
  • लक्ष्य: यह देखना कि क्या थाई संदर्भ में पूछे जाने पर AI अनजाने में कुछ हानिकारक कह देगा।

### 3. परिणाम: कौन पास हुआ?

उन्होंने 24 अलग-अलग AI मॉडल का परीक्षण किया (बड़े, महंगे मॉडल जो Google/OpenAI जैसी कंपनियों के हैं और मुफ्त, ओपन-सोर्स मॉडल जिन्हें कोई भी डाउनलोड कर सकता है)।

  • "अमीर" बच्चे बनाम "ओपन" बच्चे: बड़े, क्लोज्ड-सोर्स मॉडल (जैसे GPT-4.1) अनुभवी सुरक्षा गार्डों की तरह थे। वे जानते थे कि कब "ना" कहना है और वे शांत रहे। ओपन-सोर्स मॉडल अधिक उत्साही इंटर्न की तरह थे; कुछ बहुत अच्छे थे, लेकिन कई ने "बुरे लोगों" (हानिकारक अनुरोधों) को दरवाजे से अंदर आने दिया।
  • सांस्कृतिक अंतर (The Cultural Gap): सबसे चौंकाने वाला निष्कर्ष यह था कि AI सामान्य बुरे सवालों की तुलना में थाई-विशिष्ट सांस्कृतिक जाल को संभालने में बहुत खराब था। यह ऐसा है जैसे गार्ड बंदूक लेकर चोर को रोकने में तो जानता है, लेकिन जब कोई उसे स्थानीय व्यंजन का लालच देकर रिश्वत देने की कोशिश करता है, तो वह भ्रमित हो जाता है। AI सांस्कृतिक बारीकियों को नहीं समझ पाया, इसलिए वह सुरक्षा जांच में विफल रहा।
  • आकार मायने रखता है (लेकिन सब कुछ नहीं): आम तौर पर, बड़े AI मॉडल अधिक सुरक्षित थे (जैसे बड़ी जाल अधिक मछलियाँ पकड़ती है)। हालांकि, कुछ छोटे मॉडल जो विशेष रूप से थाई डेटा पर प्रशिक्षित थे, उन्होंने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, जिससे सिद्ध हुआ कि गुणवत्तापूर्ण प्रशिक्षण डेटा केवल कच्चे आकार से अधिक महत्वपूर्ण है।

4. टूलकिट: सुरक्षा को सस्ता और आसान बनाना

AI का मूल्यांकन करने के लिए आमतौर पर महंगे सुपरकंप्यूटर या महंगे AI जजों को भुगतान करने की आवश्यकता होती है। सभी को यह करने में मदद करने के लिए, टीम ने दो मुफ्त उपकरण बनाए:

  • ThaiSafetyClassifier: एक छोटा, हल्का AI "स्पॉटर" जो किसी बातचीत को देख सकता है और तुरंत कह सकता है, "यह सुरक्षित है" या "यह खतरनाक है।" यह एक मेटल डिटेक्टर की तरह है जिसे चलाना सस्ता है लेकिन यह महंगे सुरक्षा स्कैनरों जितना ही सटीक है।
  • लीडरबोर्ड: उन्होंने एक सार्वजनिक स्कोरबोर्ड बनाया (एक वीडियो गेम हाई-स्कोर लिस्ट की तरह) जहाँ कोई भी देख सकता है कि उनका AI थाई में कितना सुरक्षित है। यह सभी को अपने मॉडल को बेहतर बनाने के लिए प्रोत्साहित करता है ताकि वे बेहतर रैंक प्राप्त कर सकें।

मुख्य निष्कर्ष

यह शोध पत्र एक चेतावनी है। आप केवल सुरक्षा नियमों को अंग्रेजी से थाई में अनुवाद नहीं कर सकते और उम्मीद नहीं कर सकते कि वे काम करेंगे। सुरक्षा को सांस्कृतिक रूप से शामिल (culturally baked in) होना चाहिए।

यदि हम चाहते हैं कि AI थाई लोगों के लिए सुरक्षित हो, तो हमें इसे थाई जाल के साथ परीक्षण करना होगा, थाई संस्कृति को समझना होगा, और ऐसे उपकरण बनाने होंगे जो उन विशिष्ट बारीकियों का सम्मान करते हों। अन्यथा, हमारा AI अंग्रेजी में विनम्र हो सकता है लेकिन थाई में अनजाने में अपमानजनक या खतरनाक हो सकता है।

संक्षेप में: उन्होंने AI के लिए एक थाई-विशिष्ट "तनाव परीक्षण" (stress test) बनाया, पाया कि कई मॉडल सांस्कृतिक रूप से अंधे हैं, और समुदाय को इसे ठीक करने के लिए मुफ्त उपकरण दिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →