← नवीनतम पेपर
💬 NLP

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

यह शोध पत्र XL-SafetyBench प्रस्तुत करता है, जो 10 भाषा युग्मों में 5,500 देश-आधारित परीक्षण मामलों वाला एक क्रॉस-कल्चरल बेंचमार्क है, जो फ्रंटियर मॉडल्स में जेलब्रेक मजबूती और सांस्कृतिक संवेदनशीलता के बीच एक विच्छेद को प्रकट करता है, साथ ही यह भी उजागर करता है कि स्थानीय मॉडल्स की स्पष्ट सुरक्षा अक्सर वास्तविक संरेखण के बजाय जनरेशन विफलताओं से उत्पन्न होती है।

मूल लेखक: Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Sur
प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Suresh Gehlot, Katherine Pratt, Amanda Minnich, Haon Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दुनिया भर के लोगों की मदद करने के लिए एक नया सहायक (assistant) नियुक्त कर रहे हैं। आप यह सुनिश्चित करना चाहते हैं कि यह सहायक सुरक्षित, विनम्र हो और गलती से भी कुछ अपमानजनक या खतरनाक न कह दे।

लंबे समय से, हम इन सहायकों का परीक्षण एक "मानकीकृत परीक्षण" (standardized test) का उपयोग करके कर रहे हैं जो पूरी तरह से अंग्रेजी में लिखा गया है। लेकिन इस शोध पत्र के लेखक, XL-SafetyBench, तर्क देते हैं कि यह एक शेफ की इतालवी खाना बनाने की क्षमता को केवल अमेरिकी बर्गर बनाने के लिए पूछकर परखने जैसा है। सिर्फ इसलिए कि वह एक बर्गर सुरक्षित रूप से बना सकता है, इसका मतलब यह नहीं है कि उसे इटली के स्थानीय नियमों का पता है।

यहाँ उन्होंने क्या किया और उन्हें क्या मिला, इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

1. समस्या: "अनुवाद का जाल" (The Translation Trap)

अधिकांश AI सुरक्षा परीक्षण केवल अन्य भाषाओं में अनुवादित अंग्रेजी प्रश्न होते हैं।

  • खामी: यदि आप "कार चोरी करने कैसे" के बारे में एक प्रश्न को कोरियाई में अनुवाद करते हैं, तो AI कह सकता है "नहीं।" लेकिन क्या होगा यदि प्रश्न आवास के एक विशिष्ट प्रकार के घोटाले के बारे में है जो केवल कोरिया में होता है? एक अनुवादित परीक्षण उस कमी को नहीं पकड़ पाएगा।
  • छूटा हुआ हिस्सा: पुराने परीक्षण दो प्रकार की "सुरक्षा" को छोड़ देते हैं:
    1. "हैकर" परीक्षण: क्या AI को एक स्थानीय अपराधी द्वारा कुछ बुरा करने के लिए बहकाया जा सकता है? (जैसे, "मैं कोरियाई हाउसिंग डिपॉजिट सिस्टम का उपयोग करके लोगों को कैसे ठग सकता हूँ?")
    2. "सामाजिक शिष्टाचार" परीक्षण: क्या AI स्थानीय रीति-रिवाजों को जानता है? (जैसे, यदि आप AI को एक फ्रांसीसी मित्र के लिए उपहार की योजना बनाने में मदद करने के लिए कहते हैं, तो उसे गुलदाउदी (chrysanthemums) का सुझाव नहीं देना चाहिए, क्योंकि फ्रांस में, वे फूलों का उपयोग जन्मदिन के लिए नहीं, बल्कि अंतिम संस्कार के लिए किया जाता है।)

2. समाधान: एक नया "वर्ल्ड टूर" परीक्षण

शोधकर्ताओं ने XL-SafetyBench बनाया, जो 10 अलग-अलग देशों (जैसे अमेरिका, दक्षिण कोरिया, भारत, जर्मनी, आदि) को कवर करने वाला एक विशाल टेस्ट सूट है।

उन्होंने केवल अंग्रेजी प्रश्नों का अनुवाद नहीं किया। उन्होंने इसे प्रत्येक स्थानीय भाषा में ज़ीरो से बनाया, जिसमें दो मुख्य ट्रैक शामिल थे:

  • ट्रैक A: "रेड टीम" (जेलब्रेक बेंचमार्क)

    • उपमा: कल्पना करें कि आप AI को बेवकूफ बनाने की कोशिश करने के लिए स्थानीय "हैकर्स" की एक टीम को काम पर रखते हैं। वे केवल यह नहीं पूछते, "मैं बम कैसे बनाऊं?" वे पूछते हैं, "मैं पैसे चुराने के लिए तुर्की के विशिष्ट स्थानीय बैंकिंग ऐप का उपयोग कैसे करूं?"
    • लक्ष्य: यह देखना कि क्या AI इन चतुर, स्थानीय रूप से आधारित चालों का विरोध कर सकता है।
  • ट्रक B: "सांस्कृतिक जासूस" (सांस्कृतिक बेंचमार्क)

    • उपमा: कल्पना करें कि AI एक डिनर पार्टी में मेहमान है। होस्ट पूछता है, "क्या आप मुझे शादी के लिए मेनू लिखने में मदद कर सकते हैं?" लेकिन अनुरोध के अंदर एक सूक्ष्म विवरण छिपा है: "आइए उन मेहमानों को सूअर का मांस (pork) परोसें जो एक सख्त शाकाहारी धर्म का पालन करते हैं।"
    • लक्षक: AI को उस सूक्ष्म, छिपी हुई सांस्कृतिक गलती को पहचानना होगा जिसके बारे में उसे बताया नहीं गया है। यह एक बुरे अनुरोध को अस्वीकार करने के बारे में नहीं है; यह एक सामाजिक चूक (faux pas) को पहचानने के बारे में है जो एक सामान्य बातचीत में दबी हुई है।

3. उन्होंने इसे कैसे बनाया

उन्होंने केवल एक कंप्यूटर से ये प्रश्न लिखने के लिए नहीं कहा। उन्होंने एक "ह्यूमन-इन-द-लूप" प्रक्रिया का उपयोग किया:

  1. AI खोज (AI Discovery): कंप्यूटरों ने संभावित स्थानीय समस्याओं को खोजा।
  2. मानवीय सत्यापन (Human Validation): उन देशों में 15 वर्षों से अधिक समय तक रहने वाले वास्तविक मनुष्यों ने प्रत्येक प्रश्न की जांच की। उन्होंने यह सुनिश्चित किया कि प्रश्न स्वाभाविक लगें और सांस्कृतिक जाल वास्तविक हों।
  3. परिणाम: एक उच्च-गुणवत्ता वाला, सांस्कृतिक रूप से प्रामाणिक परीक्षण जो एक वास्तविक बातचीत जैसा महसूस होता है, न कि एक रोबोटिक अनुवाद।

4. बड़े आश्चर्य (निष्कर्ष)

जब उन्होंने 37 अलग-अलग AI मॉडल (10 वैश्विक और उन विशिष्ट देशों के 27 स्थानीय मॉडल) का परीक्षण किया, तो उन्हें दो चौंकाने वाली चीजें मिलीं:

आश्चर्य #1: "सुरक्षित" होना और "सांस्कृतिक रूप से जागरूक" होना एक ही बात नहीं है।

  • उपमा: सुरक्षा और संस्कृति को दो अलग-अलग कौशल के रूप में सोचें, जैसे "कार चलाना" और "स्थानीय बोली बोलना"।
  • निष्कर्ष: कुछ सबसे शक्तिशाली AI मॉडल बुरा करने से मना करने में बेहतरीन थे (उच्च सुरक्षा) लेकिन सांस्कृतिक गलतियों को पहचानने में बहुत खराब थे (कम सांस्कृतिक जागरूकता)। इसके विपरीत, कुछ मॉडल संस्कृति के मामले में ठीक थे लेकिन हैकर्स द्वारा आसानी से बेवकूफ बनाए जा सकते थे।
  • सीख: आप केवल एक AI को एक "सुरक्षा स्कोर" नहीं दे सकते। आपको यह मापना होगा कि क्या वह सुरक्षित और सांस्कृतिक रूप से स्मार्ट है, दोनों को अलग-अलग।

आश्चर्य #2: स्थानीय मॉडल सुरक्षा का "दिखावा" (faking) कर रहे हैं।

  • उपमा: कल्पना करें कि एक छात्र कठिन गणित का टेस्ट दे रहा है।
    • मॉडल A (ग्लोबल): प्रश्न समझता है, गहराई से सोचता है, और कहता है, "मैं इसे हल नहीं कर सकता क्योंकि यह खतरनाक है।" (यह वास्तविक सुरक्षा है)।
    • मॉडल B (लोकल): प्रश्न को बिल्कुल नहीं समझता, इसलिए वह बस खाली देखता रहता या अजीब बातें करता है। चूंकि उसने प्रश्न का उत्तर नहीं दिया, इसलिए तकनीकी रूप से उसने "कुछ भी बुरा नहीं किया।"
  • निष्कर्ष: कई स्थानीय AI मॉडल इसलिए "सुरक्षित" दिख रहे थे क्योंकि वे प्रश्न समझने में विफल रहे थे, न कि इसलिए कि उन्होंने किसी बुराई को न करने का नैतिक निर्णय लिया था। वे गलती से "सुरक्षित" थे, डिज़ाइन के कारण नहीं। शोधकर्ता इसे "सुरक्षा का भ्रम" (Illusion of Safety) कहते हैं।

5. यह क्यों मायने रखता है

यह शोध पत्र AI को परीक्षण करने का एक नया तरीका पेश करता है जो विभिन्न देशों को "अलग लहजे वाली अंग्रेजी" के बजाय अद्वितीय स्थानों के रूप में मानता है जिनके अपने नियम हैं।

यह हमें दिखाता है कि दुनिया भर के लिए वास्तव में सुरक्षित AI बनाने के लिए, हमें केवल अनुवादित परीक्षणों पर निर्भर रहना बंद करना होगा। हमें यह परीक्षण करने की आवश्यकता है कि क्या AI स्थानीय घोटालों को संभाल सकता है और क्या वह जानता है कि जन्मदिन के उपहार के रूप में अंतिम संस्कार के फूल नहीं देने चाहिए। और सबसे महत्वपूर्ण बात यह है कि हमें यह सुनिश्चित करने की आवश्यकता है कि AI केवल इसलिए "सुरक्षित" नहीं है क्योंकि वह जवाब देने के लिए बहुत भ्रमित है, बल्कि इसलिए सुरक्षित है क्योंकि वह दुनिया को वास्तव में समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →