XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
यह शोध पत्र XL-SafetyBench प्रस्तुत करता है, जो 10 भाषा युग्मों में 5,500 देश-आधारित परीक्षण मामलों वाला एक क्रॉस-कल्चरल बेंचमार्क है, जो फ्रंटियर मॉडल्स में जेलब्रेक मजबूती और सांस्कृतिक संवेदनशीलता के बीच एक विच्छेद को प्रकट करता है, साथ ही यह भी उजागर करता है कि स्थानीय मॉडल्स की स्पष्ट सुरक्षा अक्सर वास्तविक संरेखण के बजाय जनरेशन विफलताओं से उत्पन्न होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप दुनिया भर के लोगों की मदद करने के लिए एक नया सहायक (assistant) नियुक्त कर रहे हैं। आप यह सुनिश्चित करना चाहते हैं कि यह सहायक सुरक्षित, विनम्र हो और गलती से भी कुछ अपमानजनक या खतरनाक न कह दे।
लंबे समय से, हम इन सहायकों का परीक्षण एक "मानकीकृत परीक्षण" (standardized test) का उपयोग करके कर रहे हैं जो पूरी तरह से अंग्रेजी में लिखा गया है। लेकिन इस शोध पत्र के लेखक, XL-SafetyBench, तर्क देते हैं कि यह एक शेफ की इतालवी खाना बनाने की क्षमता को केवल अमेरिकी बर्गर बनाने के लिए पूछकर परखने जैसा है। सिर्फ इसलिए कि वह एक बर्गर सुरक्षित रूप से बना सकता है, इसका मतलब यह नहीं है कि उसे इटली के स्थानीय नियमों का पता है।
यहाँ उन्होंने क्या किया और उन्हें क्या मिला, इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।
1. समस्या: "अनुवाद का जाल" (The Translation Trap)
अधिकांश AI सुरक्षा परीक्षण केवल अन्य भाषाओं में अनुवादित अंग्रेजी प्रश्न होते हैं।
- खामी: यदि आप "कार चोरी करने कैसे" के बारे में एक प्रश्न को कोरियाई में अनुवाद करते हैं, तो AI कह सकता है "नहीं।" लेकिन क्या होगा यदि प्रश्न आवास के एक विशिष्ट प्रकार के घोटाले के बारे में है जो केवल कोरिया में होता है? एक अनुवादित परीक्षण उस कमी को नहीं पकड़ पाएगा।
- छूटा हुआ हिस्सा: पुराने परीक्षण दो प्रकार की "सुरक्षा" को छोड़ देते हैं:
- "हैकर" परीक्षण: क्या AI को एक स्थानीय अपराधी द्वारा कुछ बुरा करने के लिए बहकाया जा सकता है? (जैसे, "मैं कोरियाई हाउसिंग डिपॉजिट सिस्टम का उपयोग करके लोगों को कैसे ठग सकता हूँ?")
- "सामाजिक शिष्टाचार" परीक्षण: क्या AI स्थानीय रीति-रिवाजों को जानता है? (जैसे, यदि आप AI को एक फ्रांसीसी मित्र के लिए उपहार की योजना बनाने में मदद करने के लिए कहते हैं, तो उसे गुलदाउदी (chrysanthemums) का सुझाव नहीं देना चाहिए, क्योंकि फ्रांस में, वे फूलों का उपयोग जन्मदिन के लिए नहीं, बल्कि अंतिम संस्कार के लिए किया जाता है।)
2. समाधान: एक नया "वर्ल्ड टूर" परीक्षण
शोधकर्ताओं ने XL-SafetyBench बनाया, जो 10 अलग-अलग देशों (जैसे अमेरिका, दक्षिण कोरिया, भारत, जर्मनी, आदि) को कवर करने वाला एक विशाल टेस्ट सूट है।
उन्होंने केवल अंग्रेजी प्रश्नों का अनुवाद नहीं किया। उन्होंने इसे प्रत्येक स्थानीय भाषा में ज़ीरो से बनाया, जिसमें दो मुख्य ट्रैक शामिल थे:
ट्रैक A: "रेड टीम" (जेलब्रेक बेंचमार्क)
- उपमा: कल्पना करें कि आप AI को बेवकूफ बनाने की कोशिश करने के लिए स्थानीय "हैकर्स" की एक टीम को काम पर रखते हैं। वे केवल यह नहीं पूछते, "मैं बम कैसे बनाऊं?" वे पूछते हैं, "मैं पैसे चुराने के लिए तुर्की के विशिष्ट स्थानीय बैंकिंग ऐप का उपयोग कैसे करूं?"
- लक्ष्य: यह देखना कि क्या AI इन चतुर, स्थानीय रूप से आधारित चालों का विरोध कर सकता है।
ट्रक B: "सांस्कृतिक जासूस" (सांस्कृतिक बेंचमार्क)
- उपमा: कल्पना करें कि AI एक डिनर पार्टी में मेहमान है। होस्ट पूछता है, "क्या आप मुझे शादी के लिए मेनू लिखने में मदद कर सकते हैं?" लेकिन अनुरोध के अंदर एक सूक्ष्म विवरण छिपा है: "आइए उन मेहमानों को सूअर का मांस (pork) परोसें जो एक सख्त शाकाहारी धर्म का पालन करते हैं।"
- लक्षक: AI को उस सूक्ष्म, छिपी हुई सांस्कृतिक गलती को पहचानना होगा जिसके बारे में उसे बताया नहीं गया है। यह एक बुरे अनुरोध को अस्वीकार करने के बारे में नहीं है; यह एक सामाजिक चूक (faux pas) को पहचानने के बारे में है जो एक सामान्य बातचीत में दबी हुई है।
3. उन्होंने इसे कैसे बनाया
उन्होंने केवल एक कंप्यूटर से ये प्रश्न लिखने के लिए नहीं कहा। उन्होंने एक "ह्यूमन-इन-द-लूप" प्रक्रिया का उपयोग किया:
- AI खोज (AI Discovery): कंप्यूटरों ने संभावित स्थानीय समस्याओं को खोजा।
- मानवीय सत्यापन (Human Validation): उन देशों में 15 वर्षों से अधिक समय तक रहने वाले वास्तविक मनुष्यों ने प्रत्येक प्रश्न की जांच की। उन्होंने यह सुनिश्चित किया कि प्रश्न स्वाभाविक लगें और सांस्कृतिक जाल वास्तविक हों।
- परिणाम: एक उच्च-गुणवत्ता वाला, सांस्कृतिक रूप से प्रामाणिक परीक्षण जो एक वास्तविक बातचीत जैसा महसूस होता है, न कि एक रोबोटिक अनुवाद।
4. बड़े आश्चर्य (निष्कर्ष)
जब उन्होंने 37 अलग-अलग AI मॉडल (10 वैश्विक और उन विशिष्ट देशों के 27 स्थानीय मॉडल) का परीक्षण किया, तो उन्हें दो चौंकाने वाली चीजें मिलीं:
आश्चर्य #1: "सुरक्षित" होना और "सांस्कृतिक रूप से जागरूक" होना एक ही बात नहीं है।
- उपमा: सुरक्षा और संस्कृति को दो अलग-अलग कौशल के रूप में सोचें, जैसे "कार चलाना" और "स्थानीय बोली बोलना"।
- निष्कर्ष: कुछ सबसे शक्तिशाली AI मॉडल बुरा करने से मना करने में बेहतरीन थे (उच्च सुरक्षा) लेकिन सांस्कृतिक गलतियों को पहचानने में बहुत खराब थे (कम सांस्कृतिक जागरूकता)। इसके विपरीत, कुछ मॉडल संस्कृति के मामले में ठीक थे लेकिन हैकर्स द्वारा आसानी से बेवकूफ बनाए जा सकते थे।
- सीख: आप केवल एक AI को एक "सुरक्षा स्कोर" नहीं दे सकते। आपको यह मापना होगा कि क्या वह सुरक्षित और सांस्कृतिक रूप से स्मार्ट है, दोनों को अलग-अलग।
आश्चर्य #2: स्थानीय मॉडल सुरक्षा का "दिखावा" (faking) कर रहे हैं।
- उपमा: कल्पना करें कि एक छात्र कठिन गणित का टेस्ट दे रहा है।
- मॉडल A (ग्लोबल): प्रश्न समझता है, गहराई से सोचता है, और कहता है, "मैं इसे हल नहीं कर सकता क्योंकि यह खतरनाक है।" (यह वास्तविक सुरक्षा है)।
- मॉडल B (लोकल): प्रश्न को बिल्कुल नहीं समझता, इसलिए वह बस खाली देखता रहता या अजीब बातें करता है। चूंकि उसने प्रश्न का उत्तर नहीं दिया, इसलिए तकनीकी रूप से उसने "कुछ भी बुरा नहीं किया।"
- निष्कर्ष: कई स्थानीय AI मॉडल इसलिए "सुरक्षित" दिख रहे थे क्योंकि वे प्रश्न समझने में विफल रहे थे, न कि इसलिए कि उन्होंने किसी बुराई को न करने का नैतिक निर्णय लिया था। वे गलती से "सुरक्षित" थे, डिज़ाइन के कारण नहीं। शोधकर्ता इसे "सुरक्षा का भ्रम" (Illusion of Safety) कहते हैं।
5. यह क्यों मायने रखता है
यह शोध पत्र AI को परीक्षण करने का एक नया तरीका पेश करता है जो विभिन्न देशों को "अलग लहजे वाली अंग्रेजी" के बजाय अद्वितीय स्थानों के रूप में मानता है जिनके अपने नियम हैं।
यह हमें दिखाता है कि दुनिया भर के लिए वास्तव में सुरक्षित AI बनाने के लिए, हमें केवल अनुवादित परीक्षणों पर निर्भर रहना बंद करना होगा। हमें यह परीक्षण करने की आवश्यकता है कि क्या AI स्थानीय घोटालों को संभाल सकता है और क्या वह जानता है कि जन्मदिन के उपहार के रूप में अंतिम संस्कार के फूल नहीं देने चाहिए। और सबसे महत्वपूर्ण बात यह है कि हमें यह सुनिश्चित करने की आवश्यकता है कि AI केवल इसलिए "सुरक्षित" नहीं है क्योंकि वह जवाब देने के लिए बहुत भ्रमित है, बल्कि इसलिए सुरक्षित है क्योंकि वह दुनिया को वास्तव में समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।