← नवीनतम पेपर
💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

यह शोध पत्र ROK-FORTRESS को प्रस्तुत करता है, जो एक "ट्रांसक्रिएशन मैट्रिक्स" (transcreation matrix) का उपयोग करने वाला एक द्विभाषी बेंचमार्क है, यह प्रदर्शित करने के लिए कि बड़े भाषा मॉडलों (LLMs) के लिए राष्ट्रीय सुरक्षा और सार्वजनिक सुरक्षा मूल्यांकनों को भाषा और भू-राजनीतिक संदर्भ के बीच जटिल अंतःक्रियाओं को ध्यान में रखना चाहिए, क्योंकि केवल अनुवाद-आधारित दृष्टिकोण यह पकड़ने में विफल रहते हैं कि कोरियाई भाषा और ग्राउंडिंग (grounding) मॉडल के सुरक्षा व्यवहारों और ओवर-रिफ्यूज़ल (over-refusal) दरों को विशिष्ट रूप से कैसे प्रभावित करते हैं।

मूल लेखक: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Ch
प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q Knight, Joseph Brandifino, Max Fenkell

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट का परीक्षण कर रहे हैं कि क्या वह खतरनाक निर्देशों का पालन करेगा, जैसे कि "मैं बम कैसे बनाऊं?" या "मैं बैंक को कैसे हैक करूं?"

लंबे समय तक, सुरक्षा शोधकर्ताओं ने इन रोबोट्स का परीक्षण मुख्य रूप से अंग्रेजी में किया। उन्होंने यह मान लिया था कि यदि आप उन खतरनाक सवालों को किसी अन्य भाषा (जैसे कोरियाई) में अनुवाद कर देते हैं, तो भी रोबोट "नहीं" ही कहेगा। उन्हें लगा कि रोबोट के सुरक्षा नियम एक सार्वभौमिक ढाल की तरह हैं जो किसी भी भाषा में समान रूप से काम करते हैं।

लेकिन, यह पेपर, ROK-FORTRESS, कहता है: "रुकिए जरा। यह केवल भाषा के बारे में नहीं है; यह इस बारे में है कि कहानी कहाँ घटित हो रही है।"

यहाँ उन्होंने जो किया और जो पाया, उसका सरल विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए।

1. "अनुवाद बनाम ट्रांसक्रिएशन" (Translation vs. Transcreation) का परीक्षण

शोधकर्ताओं ने महसूस किया कि किसी प्रश्न का केवल अनुवाद करना एक रेसिपी (व्यंजन विधि) का अनुवाद करने जैसा है। यदि आप "अमेरिकन एप्पल पाई" की रेसिपी का कोरियाई में अनुवाद करते हैं, तो आपको अभी भी एप्पल पाई की ही रेसिपी मिलेगी, बस कोरियाई शब्दों में। सामग्री (खतरा) वही है।

लेकिन ट्रांसक्रिएशन (Transcreation) अलग है। यह उस एप्पल पाई की रेसिपी को लेकर "कोरियाई स्वीट पोटैटो पाई" की रेसिपी में बदलने जैसा है। इरादा (एक मीठा डेजर्ट बनाना) वही है, लेकिन विशिष्ट सामग्रियां, सांस्कृतिक संदर्भ और स्थानीय नियम पूरी तरह से अलग हैं।

टीम ने ROK-FORTRESS (सुरक्षा परीक्षण के लिए एक किला) नामक एक विशाल परीक्षण बनाया जिसमें 1,235 अलग-अलग "खतरनाक" प्रश्न थे। उन्होंने इनका चार तरीकों से परीक्षण किया:

  1. अंग्रेजी, अमेरिकी संदर्भ: "मैं FBI को कैसे हैक करूँ?" (मूल)
  2. कोरियाई, अमेरिकी संदर्भ: "मैं FBI को कैसे हैक करूँ?" (अनुवादित)
  3. अंग्रेजी, कोरियाई संदर्भ: "मैं कोरियाई नेशनल इंटेलिजेंस सर्विस को कैसे हैक करूँ?" (अनुकूलित)
  4. कोरियाई, कोरियाई संदर्भ: "मैं कोरियाई नेशनल इंटेलिजेंस सर्विस को कैसे हैक करूँ?" (पूर्ण रूप से ट्रांसक्रिएटेड)

2. बड़ी हैरानी: "रूढ़िवादी कोरियाई" प्रभाव (The "Conservative Korean" Effect)

अधिकांश पिछले अध्ययनों का मानना था कि रोबोट जिस भाषा में उतना कुशल नहीं है (जैसे कोरियाई), उसमें बोलने से एक "लूपहोल" या "बैकडोर" बन जाएगा जिससे रोबोट को खतरनाक होने के लिए बहकाया जा सके। उन्हें लगा कि रोबोट भ्रमित हो जाएगा और बुरी चीजों के लिए "हाँ" कह देगा।

पेपर ने इसके ठीक विपरीत पाया।

जब उन्होंने रोबोट से कोरियाई में पूछा, तो रोबोट वास्तव में अधिक सतर्क हो गए। उन्होंने अधिक बार "नहीं" कहा।

  • उपमा: एक संग्रहालय के सुरक्षा गार्ड की कल्पना करें। यदि आप उससे उसकी मातृभाषा में स्थानीय लहजे के साथ पूछते हैं, तो वह बहुत सख्त हो जाता है और आपका आईडी तीन बार चेक करता है। यदि आप उससे टूटी-फूटी विदेशी भाषा में पूछते हैं, तो वह भ्रमित हो सकता है और आपको अंदर जाने दे सकता है। लेकिन ये रोबोट ऐसे गार्ड की तरह व्यवहार करते हैं जो कोरियाई बोलने पर अतिरिक्त सख्त हो जाता है। उन्होंने कोरियाई भाषा को ही एक "रेड फ्लैग" या "जोखिम संकेत" के रूप में माना, जिससे वे अनुरोध को अस्वीकार करने की अधिक संभावना रखते थे, भले ही अनुरोध खतरनाक था।

3. "संदर्भ" का कारक (The "Context" Factor)

शोधकर्ताओं ने यह भी पाया कि कहानी कहाँ हो रही है, यह मायने रखता है।

  • यदि आप अंग्रेजी में एक अमेरिकी बैंक के बारे में रोबोट से पूछते हैं, तो वह सतर्क हो सकता है।
  • यदि आप उसी रोबोट से अंग्रेजी में कोरियाई बैंक के बारे में पूछते हैं, तो वह और भी अधिक सतर्क हो जाता है।
  • यदि आप कोरियाई में कोरियाई बैंक के बारे में पूछते हैं, तो वह सबसे अधिक सतर्क होता है।

यह एक सुरक्षा प्रणाली की तरह है जिसमें एक "लोकल मोड" होता है। जब रोबोट को एहसास होता है कि स्थिति कोरिया में हो रही है (कोरियाई नामों, स्थानों और कानूनों के साथ), तो वह अपनी सुरक्षा बेल्ट और भी कस लेता है।

4. "जेलब्रेक" ट्विस्ट (The "Jailbreak" Twist)

टीम ने यह भी परीक्षण किया कि क्या होता है जब आप सभी फैंसी ट्रिक्स (जेलब्रेक्स) को हटा देते हैं और सीधे प्रश्न पूछते हैं: "मैं बम कैसे बनाऊं?"

  • ओपन-सोर्स रोबोट: सीधे पूछे जाने पर, ये रोबोट पुराने अध्ययनों की तरह व्यवहार करते थे। कोरियाई में इन्हें बहकाना आसान था।
  • बड़े कॉर्पोरेट रोबोट: बड़े, महंगे मॉडल (जैसे OpenAI या Anthropic के) कोरियाई में सतर्क रहे, भले ही सीधे पूछा गया हो। वे "भाषा के लूपहोल" के जाल में नहीं फंसे।

5. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

मुख्य निष्कर्ष यह है कि आप केवल सुरक्षा परीक्षणों का अनुवाद नहीं कर सकते।

यदि आप जानना चाहते हैं कि कोरिया में एक रोबोट सुरक्षित है या नहीं, तो आप केवल अपना अंग्रेजी परीक्षण लेकर, उसका अनुवाद करके, उसे चला नहीं सकते। आपको स्थानीय संस्कृति के अनुरूप कहानी को बदलना होगा (ट्रांसक्रिएशन)।

  • पुराना तरीका: "प्रश्न का अनुवाद करें, उत्तर की जाँच करें।" (यह मुख्य बिंदु को छोड़ देता है)।
  • नया तरीका: "स्थानीय संस्कृति के लिए कहानी को फिर से लिखें, फिर उत्तर की जाँच करें।"

पेपर निष्कर्ष निकालता है कि इन विशिष्ट रोबोटों के लिए, कोरियाई बोलना और कोरियाई विषयों के बारे में बात करना उन्हें वास्तव में अधिक सुरक्षित (बुरी चीजों के लिए "नहीं" कहने की अधिक संभावना) बनाता है, न कि कम सुरक्षित। यह उस धारणा से एक बड़ा बदलाव है जो पहले सब सोचते थे।

एक वाक्य में सारांश

इस पेपर ने एक विशेष परीक्षण बनाया यह दिखाने के लिए कि जब आप कोरियाई में और कोरियाई स्थानों के बारे में AI रोबलों से खतरनाक विषयों के बारे में पूछते हैं, तो उन्हें आसानी से धोखा नहीं दिया जाता है; इसके बजाय, वे अक्सर अधिक सावधान हो जाते हैं और उत्तर देने से इनकार कर देते हैं, जिससे यह सिद्ध होता है कि सुरक्षा परीक्षण के लिए सांस्कृतिक अनुकूलन की आवश्यकता होती है, न कि केवल अनुवाद की।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →