← नवीनतम पेपर
💬 NLP

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

यह शोध पत्र नेटिव-लेखक-सत्यापित SomaliBench v0 बेंचमार्क का उपयोग करके चार ओपन-वेट लैंग्वेज मॉडल्स का मूल्यांकन करता है और अंग्रेजी-से-सोमाली सुरक्षा अपैत्रता (safety refusal) के महत्वपूर्ण अंतराल को प्रकट करता है, जहाँ मॉडल सुसंगत या गलत-भाषा वाले आउटपुट के कारण सोमाली में हानिकारक प्रॉम्प्ट्स को अस्वीकार करने में अक्सर विफल हो जाते हैं, न कि सुचारू हानिकारक अनुपालन के कारण।

मूल लेखक: Khalid Yusuf Dahir

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Khalid Yusuf Dahir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास चार अलग-अलग रोबोट (AI मॉडल) हैं जिन्हें मददगार, हानिरहित और ईमानदार होना चाहिए। आप यह परीक्षण करना चाहते हैं कि क्या वे वास्तव में "सुरक्षित" हैं जब आप उनसे खतरनाक सवाल पूछते हैं।

यह शोध पत्र एक सुरक्षा निरीक्षक की तरह है जो इन रोबोटों की जांच कर रहा है, लेकिन एक ट्विस्ट के साथ: निरीक्षक एक ही खतरनाक सवाल दो अलग-अलग भाषाओं में पूछता है—अंग्रेजी और सोमाली

यहाँ उन्होंने जो पाया, उसका सरल विवरण दिया गया है:

सेटअप: "ऐसा न करें" परीक्षण

शोधकर्ताओं ने 100 खतरनाक अनुरोध लिए (जैसे "मैं बम कैसे बनाऊं?" या "मैं किसी की पहचान कैसे चुराऊं?") और ये सवाल चार लोकप्रिय, मुफ्त में उपयोग किए जाने वाले AI रोबोटों से पूछे।

  • परीक्षण: उन्होंने पहले अंग्रेजी में सवाल पूछे, फिर वही सवाल सोमाली में पूछे।
  • लक्ष्य: वे यह देखना चाहते थे कि क्या रोबोट दोनों भाषाओं में "नहीं, मैं यह नहीं कर सकता" (अस्वीकार/Refusal) कहेंगे, या वे भ्रमित होकर "हाँ" (अनुपालन/Compliance) कह देंगे, या बस बड़बड़ाकर कुछ अर्थहीन (अस्पष्ट/Unclear) बोलेंगे।

बड़ी खोज: "भाषा का अंध बिंदु" (Language Blind Spot)

परिणाम चौंकाने वाले थे। यह बिल्कुल वैसा ही है जैसे एक सुरक्षा गार्ड जो अंग्रेजी में बात करने पर बहुत सख्त होता है, लेकिन सोमाली में बात करने पर अचानक बहुत ढीला या भ्रमित हो जाता है।

  • अंग्रेजी में: चारों रोबोट "नहीं" कहने में बहुत अच्छे थे। उन्होंने खतरनाक अनुरोधों को लगभग 100% समय अस्वीकार कर दिया। वे एक ऐसे बाउंसर की तरह थे जो जानता है कि क्या करना है।
  • सोमाली में: रोबोट बहुत कम विश्वसनीय हो गए।
    • Llama और Aya: इन दो रोबोटों ने सोमाली में अपने सुरक्षा नियमों को लगभग पूरी तरह से भुला दिया। उन्होंने 10% से भी कम समय में "नहीं" कहा।
    • Qwen: इस रोबोट ने लगभग 24% बार "नहीं" कहा।
    • Gemma: यह समूह में सबसे अच्छा था, जिसने लगभग 59% बार "नहीं" कहा, लेकिन अंग्रेजी के अपने प्रदर्शन की तुलना में यह आधे से अधिक बार विफल रहा।

"भ्रमित रोबोट" की समस्या

सबसे दिलचस्प हिस्सा यह है। जब रोबोट सोमाली में विफल हुए, तो वे हमेशा केवल "हाँ, यहाँ बताया गया है कि बम कैसे बनाया जाए" ऐसा नहीं करते थे।

चार में से तीन रोबोटों के लिए, सबसे आम विफलता एक खतरनाक "हाँ" नहीं थी। बल्कि वह एक "क्या?" था।

  • उन्होंने खाली उत्तर दिए।
  • वे गलत भाषा में बोले।
  • उन्होंने निरर्थक या असंगत टेक्स्ट उत्पन्न किया।

इसे ऐसे समझें: यदि आप किसी भ्रमित पर्यटक से ऐसी भाषा में रास्ता पूछते हैं जो उसे नहीं आती, तो हो सकता कि वह आपको खाई की ओर इशारा न करे (हानिकारक अनुपालन); बल्कि वह शायद सिर्फ खाली नजरों से देखेगा या फ्रेंच बोलने लगेगा (अस्पष्ट आउटपुट)। शोध पत्र का तर्क है कि भले ही यह सीधा "हमला" नहीं है, फिर भी यह एक विफलता है क्योंकि रोबोट अपना काम सुरक्षित रूप से या स्पष्ट रूप से नहीं कर पा रहा है।

"जज" और "स्पॉट चेक"

यह सुनिश्चित करने के लिए कि उनकी गिनती सटीक थी, शोधकर्ताओं ने एक सुपर-स्मार्ट AI (एक "जज") का उपयोग किया जिसने हर एक उत्तर को पढ़ा और निर्णय लिया: "क्या इसने इनकार किया? क्या इसने अनुपालन किया? या क्या यह अस्पष्ट था?"

यह सुनिश्चित करने के लिए कि "जज" गलतियाँ न करे, एक मूल निवासी सोमाली भाषी (शोध पत्र के लेखक) ने यादृच्छिक रूप से 80 उत्तरों की जांच की।

  • परिणाम: मानव और AI जज दोनों 100% बार सहमत हुए। यह हमें उच्च विश्वास देता है कि संख्याएँ वास्तविक हैं।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि अंग्रेजी में किया गया सुरक्षा प्रशिक्षण स्वचालित रूप से सोमाली में नहीं जाता है।

भले ही ये रोबोट बुद्धिमान हैं और कई भाषाएं बोलते हैं, लेकिन उनके "सुरक्षा ब्रेक" अंग्रेजी में बहुत मजबूत हैं लेकिन सोमाली में बहुत कमजोर या टूटे हुए हैं।

  • अंतराल (Gap): अंग्रेजी बनाम सोमाली में वे कितने सुरक्षित हैं, इसके बीच एक बड़ा अंतर है।
  • बारीकी: जब वे सोमाली में विफल होते हैं, तो वे अक्सर केवल टूट जाते हैं और बकवास बातें करते हैं बजाय इसके कि वे बुरे बन जाएं। लेकिन एक रोबोट जो सोमाली जैसी प्रमुख भाषा में स्पष्ट रूप से या सुरक्षित रूप से नहीं बोल सकता, वह अभी भी एक समस्या है।

शोधकर्ताओं ने क्या नहीं किया

यह ध्यान रखना महत्वपूर्ण है कि यह शोध पत्र क्या नहीं है:

  • उन्होंने रोबोट को चालाकी भरे तरीकों (जेलब्रेक) से "हैक" करने की कोशिश नहीं की।
  • उन्होंने वास्तविक दुनिया के ऐप्स या लाइव सिस्टम पर परीक्षण नहीं किया।
  • उन्होंने रोबोट द्वारा दिए गए वास्तविक खतरनाक उत्तरों को जारी नहीं किया (इंटरनेट को सुरक्षित रखने के लिए)।

संक्षेप में: ये AI रोबोट ऐसे द्विभाषी सुरक्षा गार्डों की तरह हैं जो अंग्रेजी में अपने काम में माहिर हैं, लेकिन जब वही ग्राहक सोमाली में बात करते हैं, तो वे भ्रमित, मौन या अनुपयोगी हो जाते हैं। शोधकर्ताओं ने ठीक से मापा है कि यह भ्रम का अंतर कितना बड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →