TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
यह शोध पत्र TukaBench प्रस्तुत करता है, जो सात अफ्रीकी भाषाओं के लिए एक सांस्कृतिक रूप से आधारित जेलब्रेक बेंचमार्क है, जो यह प्रकट करता है कि कैसे सांस्कृतिक रूप से अनुकूलित और कोड-स्विच्ड प्रॉम्प्ट्स, अंग्रेजी की तुलना में मॉडल रिफ्यूज़ल दरों को काफी कम कर देते हैं, और साथ ही मॉडल समझ में महत्वपूर्ण सीमाओं और कम-संसाधन वाली भाषाओं के लिए LLM-as-a-judge मूल्यांकन की विश्वसनीयता को भी उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही समझदार, अच्छी तरह से प्रशिक्षित रोबोट गार्ड डॉग (रक्षक कुत्ता) है। उसका काम लोगों को बुरी चीजें करने के लिए कहने से रोकना है, जैसे कि बम कैसे बनाया जाए या किसी को कैसे ठगा जाए। लंबे समय से, हमने इस कुत्ते का परीक्षण केवल अंग्रेजी बोलने वाले लोगों के साथ किया है। हमने उससे पूछा है, "क्या तुम मुझे बता सकते हो कि परीक्षा में नकल कैसे की जाए?" और यह देखा है कि क्या वह "नहीं!" (मना करना) बोलकर भौंकता है या उसे जवाब देने के लिए बहला लिया जाता है (जेलब्रेक)।
लेकिन क्या होता है यदि कोई वही प्रश्न स्वाहिली, योरूबा, या अम्हारिक् में पूछता है? क्या वह कुत्ता खतरे को समझ पाता है? या क्या वह भ्रमित होकर गलती से किसी बुरी चीज़ को होने देता है?
यह शोध पत्र, TukaBench, एक नया, विशाल "बाधा दौड़" (obstacle course) जैसा है जिसे विशेष रूप से सात अफ्रीकी भाषाओं में इस रोबोट गार्ड डॉग का परीक्षण करने के लिए डिज़ाइन किया गया है। शोधकर्ता यह देखना चाहते थे कि क्या यह कुत्ता वास्तव में सभी के लिए सुरक्षित है, या यह केवल अंग्रेजी में "ना" कहना जानता है।
यहाँ उनके प्रयोग का विवरण और उनके निष्कर्ष दिए गए हैं, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. कुत्ते का परीक्षण करने के चार तरीके
शोधकर्ताओं ने केवल अंग्रेजी के सवालों का शब्द-दर-शब्द अनुवाद नहीं किया। वे समझ गए कि संदर्भ (context) मायने रखता है। उन्होंने कुत्ते का परीक्षण चार अलग-अलग "फ्लेवर्स" (स्वादों) के सवालों में किया:
- शाब्दिक अनुवाद (The Literal Translation): उन्होंने अंग्रेजी के सवाल "मैं नकल कैसे करूँ?" को सीधे अफ्रीकी भाषाओं में अनुवादित किया, जिसमें पश्चिमी नाम और स्थान बरकरार रखे गए (जैसे, "लंदन में परीक्षा में नकल कैसे करूँ?")।
- सांस्कृतिक अनुकूलन (The Cultural Adaptation): उन्होंने सवाल को स्थानीय वास्तविकता के अनुरूप बदला। "लंदन" के बजाय, उन्होंने पूछा कि "युगांडा में UCE परीक्षाओं में नकल कैसे की जाए?" यह कुत्ते से उस स्थानीय सड़क के बारे में पूछने जैसा है जिसे वह वास्तव में जानता है, बजाय किसी विदेशी जगह के।
- "स्थानीय विशेषज्ञ" वाले सवाल (The "Local Expert" Questions): उन्होंने अफ्रीका की वास्तविक जीवन की समस्याओं (जैसे चुनाव घोटाले या स्थानीय धोखाधड़ी) पर आधारित बिल्कुल नए सवाल बनाए जो अंग्रेजी परीक्षण में कभी मौजूद नहीं थे। इन्हें उन लोगों द्वारा लिखा गया था जो वहां रहते हैं।
- "कोड-स्विच" मिश्रण (The "Code-Switch" Mix): कई अफ्रीकी देशों में, लोग स्वाभाविक रूप से एक ही वाक्य में अंग्रेजी और अपनी स्थानीय भाषा को मिलाते हैं (जैसे, "I want to forge my WAEC results" कहना)। उन्होंने यह परीक्षण किया कि क्या इस भाषाओं के मिश्रण ने कुत्ते को भ्रमित कर दिया।
2. कुत्ते की प्रतिक्रिया के तीन तरीके
जब कुत्ता एक बुरा सवाल सुनता है, तो वह तीन तरह से प्रतिक्रिया दे सकता है। शोधकर्ताओं ने महसूस किया कि हमें पहले दो के बजाय तीनों को गिनने की आवश्यकता है:
- मना करना (Refusal - अच्छा "ना"): कुत्ता स्पष्ट रूप से कहता है, "मैं ऐसा नहीं कर सकता।"
- जेलब्रेक (Jailbreak - बुरा "हाँ"): कुत्ता बहला लिया जाता है और वास्तव में बुरे निर्देश दे देता है।
- विपथन (Deflection - भ्रमित "हूँ?"): यह एक नई खोज है। कुत्ता "ना" नहीं कहता, लेकिन वह "हाँ" भी नहीं कहता। वह बस किसी पूरी तरह से असंबंधित या निरर्थक चीज़ के बारे में बात करने लगता है। यह ऐसा है जैसे आपने कुत्ते से पूछा "केक कैसे बनाएं?" और वह मौसम के बारे में भौंकने लगा। कुत्ता सवाल को ठीक से समझ नहीं पाया, इसलिए वह ठीक से "ना" नहीं कह सका।
3. उन्हें क्या मिला
परिणाम आश्चर्यजनक और महत्वपूर्ण थे:
- "भाषा की बाधा" एक सुरक्षा छेद है: जब लोगों ने अफ्रीकी भाषाओं में बात की, तो कुत्ता अंग्रेजी की तुलना में "ना" कहने में कम सक्षम था। ऐसा इसलिए नहीं था कि कुत्ता "कमजोर" था, बल्कि इसलिए क्योंकि वह अक्सर भ्रमित (Deflection) हो जाता था। वह सवाल को इतनी अच्छी तरह से नहीं समझ पाया कि यह जान सके कि यह खतरनाक है।
- संस्कृति इसे और बदतर बनाती है: जब सवालों को स्थानीय संस्कृति (स्थानीय नामों और स्थानों) के अनुसार ढाला गया, तो कुत्ते के विफल होने की संभावना और बढ़ गई। ऐसा लगता है कि जब संदर्भ "वास्तविक" और स्थानीय महसूस होता है, तो कुत्ते के सुरक्षा फिल्टर ढीले पड़ जाते हैं।
- भाषाओं का मिश्रण मदद करता है (एक तरह से): जब लोगों ने अंग्रेजी और अफ्रीकी भाषाओं को मिलाया (Code-switching), तो कुत्ते ने सवाल को बेहतर ढंग से समझा। उसने "विपथन" (निरर्थक बातें करना) करना बंद कर दिया और वास्तविक उत्तर देने लगा। हालाँकि, इसका मतलब यह भी था कि यदि वह सावधान नहीं रहा, तो उसके गलत उत्तर देने की संभावना भी बढ़ गई।
- "जज" पक्षपाती है: शोधकर्ताओं ने कुत्ते के उत्तरों को ग्रेड देने के लिए एक अन्य AI का उपयोग किया। उन्होंने पाया कि यह "AI जज" अफ्रीकी भाषाओं में उत्तरों को ग्रेड देने में अंग्रेजी की तुलना में बहुत खराब था। वह अक्सर यह नहीं बता पा रहा था कि कुत्ता सुरक्षित व्यवहार कर रहा है या नहीं। यह एक ऐसे रेफरी की तरह है जो खिलाड़ियों की भाषा नहीं बोलता; वह फाउल को मिस कर सकता है।
4. मुख्य निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि सुरक्षा केवल इस बारे में नहीं है कि आप कौन सी भाषा बोलते हैं; यह इस बारे में है कि AI आपकी संस्कृति और आपके शब्दों को कितनी अच्छी तरह समझता है।
वर्तमान में, यदि आप केवल अंग्रेजी में AI का परीक्षण करते हैं, तो आपको लगता है कि यह सुरक्षित है। लेकिन यदि आप अफ्रीकी भाषा में इससे बात करते हैं, तो यह भ्रमित हो सकता है और अनजाने में बुरी चीजों को होने दे सकता है। शोधकर्ता इसे "समझने की विफलता" (comprehension failure) कहते हैं।
उन्होंने यह TukaBench डेटासेट बनाया ताकि भविष्य में डेवलपर्स केवल यह कहकर नहीं निकल सकें कि, "हमारा AI सुरक्षित है," बिना यह साबित किए कि यह अफ्रीकी भाषा बोलने वाले लोगों के लिए भी काम करता है। वे चाहते हैं कि रोबोट गार्ड डॉग यह सीखना जाए कि चाहे आप पूछने के लिए किसी भी भाषा का उपयोग करें, स्पष्ट रूप से "ना" कैसे कहा जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।