← नवीनतम पेपर
💬 NLP

Taiwan Safety Benchmark and Breeze Guard: Toward Trustworthy AI for Taiwanese Mandarin

यह शोध पत्र ताइवानी मंदारिन में सुरक्षा के मूल्यांकन के लिए एक मानकीकृत बेंचमार्क, TS-Bench, और Breeze Guard का परिचय देता है, जो सांस्कृतिक रूप से आधारित डेटा पर फाइन-ट्यून किया गया एक 8B सुरक्षा मॉडल है, जो क्षेत्र-विशिष्ट जोखिमों पर सामान्य-उद्देश्य वाले सुरक्षा मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि प्रभावी सुरक्षा पहचान के लिए बेस मॉडल में पूर्व-मौजूद सांस्कृतिक आधार आवश्यक है।

मूल लेखक: Po-Chun Hsu, Meng-Hsi Chen, Tsu Ling Chao, Chia Tien Han, Da-shan Shiu

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Po-Chun Hsu, Meng-Hsi Chen, Tsu Ling Chao, Chia Tien Han, Da-shan Shiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुशिक्षित सुरक्षा गार्ड है। इस गार्ड ने लाखों किताबें पढ़ी हैं और अंग्रेजी में खतरे को पहचानने में माहिर है। वे आपको बता सकते हैं कि अगर कोई कहानी में बटुआ चुराने की कोशिश कर रहा है या वायरस फैलाने की कोशिश कर रहा है, तो वह क्या है।

लेकिन अब, कल्पना कीजिए कि इस गार्ड को ताइवान के एक विशिष्ट पड़ोस की सुरक्षा के लिए काम पर रखा गया है। वहां के लोग स्थानीय बोली बोलते हैं, अनूठे मुहावरों का उपयोग करते हैं, और उन्हें ऐसे विशेष प्रकार के धोखों का सामना करना पड़ता है जो अंग्रेजी बोलने वाली दुनिया में मौजूद नहीं हैं।

गार्ड अपनी पूरी कोशिश करता है, लेकिन वह बार-बार खतरों को पहचानने में चूक जाता है। क्यों? क्योंकि वह स्थानीय संस्कृति को नहीं समझता। वह "ताइवानी महिलाएं" जैसे वाक्यांश को देख सकता है और सोच सकता है कि यह केवल एक विवरण है, यह नहीं समझ पाता कि इस विशिष्ट पड़ोस में, यह वास्तव में एक भद्दा अपमान है। वह "ATM किस्तों" के बारे में एक संदेश देख सकता है और सोच सकता है कि यह बैंक का एक सामान्य नोटिस है, यह नहीं समझ पाता कि यह ताइवान में इस्तेमाल होने वाला एक क्लासिक स्कैम स्क्रिप्ट है।

यह शोध एक नए, विशिष्ट सुरक्षा गार्ड (जिसे Breeze Guard कहा जाता है) और एक नए टेस्ट (जिसे TS-Bench कहा जाता है) के निर्माण के बारे में है, ताकि यह सुनिश्चित किया जा सके कि AI ताइवान के लोगों के लिए सुरक्षित है।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "ग्लोबल गार्ड" की कुछ कमियां हैं

लेखक बताते हैं कि बड़े, प्रसिद्ध AI सुरक्षा मॉडल ग्लोबल सुरक्षा गार्ड की तरह हैं। वे सामान्य बुराई (जैसे अंग्रेजी में हिंसा या घृणास्पद भाषण) को पकड़ने में बहुत अच्छे हैं, लेकिन वे स्थानीय सांस्कृतिक बारीकियों के प्रति अंधे हैं।

  • उपमा: एक ऐसे गार्ड की कल्पना करें जो जानता है कि "सेब" एक फल है। लेकिन ताइवान में, लोग किसी ऐसे घोटाले के लिए एक विशिष्ट शब्द का उपयोग कर सकते हैं जो "सेब" जैसा सुनाई देता है लेकिन जिसका अर्थ बिल्कुल अलग होता है। ग्लोबल गार्ड इसे मिस कर देता है क्योंकि उसने कभी उस विशिष्ट स्थानीय मजाक या चाल के बारे में नहीं सुना है।
  • परिणाम: ताइवान में स्कैमर, नकली डॉक्टर और राजनीतिक हेरफेर करने वाले इन ग्लोबल AI मॉडलों को आसानी से धोखा दे सकते हैं क्योंकि मॉडल स्थानीय संस्कृति को "समझते" नहीं हैं।

2. समाधान: एक नया टेस्ट (TS-Bench)

इससे पहले कि वे गार्ड को ठीक कर सकें, उन्हें यह जांचने का एक तरीका चाहिए था कि क्या गार्ड वास्तव में ताइवान में अच्छा काम कर रहा है। इसलिए, उन्होंने TS-Bench बनाया।

  • यह क्या है: 400 प्रश्नों का एक टेस्ट बैंक। आधे खतरनाक जाल हैं, और आधे सुरक्षित प्रश्न हैं जो जाल दिखते हैं (गार्ड को बहुत अधिक संदिग्ध बनाने के लिए)।
  • सामग्री: ये केवल रैंडम प्रश्न नहीं हैं। ये स्थानीय स्वाद से भरे हुए हैं:
    • स्कैम: Shopee (एक लोकप्रिय शॉपिंग ऐप) या सरकार की ओर से फर्जी संदेश।
    • वित्त: LINE ग्रुप्स में मुफ्त स्टॉक का वादा करने वाले "इन्वेस्टमेंट टीचर्स"।
    • स्वास्थ्य: मिथक जैसे कि "नींबू के साथ झींगा खाने से जहर बन जाता है।"
    • राजनीति और घृणा: ताइवान की राजनीतिक बहसों में या कुछ जातीय समूहों (जैसे हाक्का समुदाय) के खिलाफ इस्तेमाल किए जाने वाले विशिष्ट अपमान।
  • लक्ष्य: यह देखना कि क्या एक AI उन स्थानीय खतरों को पहचान सकता है जिन्हें एक मानक अंग्रेजी-प्रशिक्षित AI मिस कर देगा।

3. नया गार्ड: Breeze Guard

उन्होंने केवल एक नया गार्ड शुरू से प्रशिक्षित नहीं किया। उन्होंने एक स्मार्ट बेस मॉडल जिसे Breeze 2 कहा जाता है (जो पहले से ही ताइवान की संस्कृति जानता है क्योंकि इसे बहुत सारे स्थानीय टेक्स्ट पर प्रशिक्षित किया गया था) लिया और उसे विशेष सुरक्षा प्रशिक्षण दिया।

  • मुख्य विचार: आप केवल गार्ड को सुरक्षा के नियम नहीं सिखा सकते; उन्हें पहले संस्कृति को समझना होगा। यदि गार्ड नहीं जानता कि स्थानीय संदर्भ में "हाक्का" का क्या अर्थ है, तो कितनी भी सुरक्षा ट्रेनिंग काम नहीं आएगी।
  • प्रशिक्षण: उन्होंने मॉडल को हजारों स्थानीय स्कैम और घृणास्पद भाषण के उदाहरण दिए, जिससे उसे यह सिखाया गया कि जब वह उन्हें देखे तो "रुको!" कहना है।
  • परिणाम: जब TS-Bench पर परीक्षण किया गया, तो Breeze Guard ने प्रतियोगिता को पछाड़ दिया। यह सर्वश्रेष्ठ ग्लोबल सुरक्षा मॉडलों की तुलना में स्थानीय स्कैम और सांस्कृतिक घृणास्पद भाषणों को पहचानने में बहुत बेहतर था।

4. ट्रेड-ऑफ: विशेषज्ञ बनाम सामान्यज्ञ

पेपर एक महत्वपूर्ण बात स्वीकार करता है: Breeze Guard एक विशेषज्ञ है, न कि एक सामान्यज्ञ।

  • उपमा: Breeze Guard को एक ताइवानी जासूस के रूप में सोचें। वे ताइपे में अपराध सुलझाने में अद्भुत हैं। लेकिन यदि आप उनसे अंग्रेजी स्लैंग का उपयोग करके न्यूयॉर्क में अपराध सुलझाने के लिए कहते हैं, तो वे एक न्यूयॉर्क के जासूस जितने अच्छे नहीं हो सकते हैं।
  • डेटा: अंग्रेजी सुरक्षा परीक्षणों पर, Breeze Guard ने ठीक-ठाक प्रदर्शन किया, लेकिन ग्लोबल मॉडलों जितना अच्छा नहीं। यह अपेक्षित है क्योंकि इसे विशेष रूप से ताइवान के लिए प्रशिक्षित किया गया था। लेखक तर्क देते हैं कि यह एक उचित समझौता है: आप अपने पड़ोस को सबसे अच्छी तरह जानने वाले गार्ड चाहते हैं, भले ही वे दुनिया के हर पड़ोस की रखवाली करने में सर्वश्रेष्ठ न हों।

5. यह कैसे काम करता है: "सोचना" बनाम "सहज ज्ञान"

पेपर ने गार्ड के सोचने के दो तरीकों का भी परीक्षण किया:

  1. इंस्टिंक्ट मोड (बिना सोचे - No-Think): गार्ड तुरंत कहता है "सुरक्षित" या "खतरा।" यह तेज़ है।
  2. थिंकिंग मोड (चेन-ऑफ-थॉट): गार्ड थोड़ा समय लेता है और कहता है, "रुको, यह एक स्कैम लग रहा है क्योंकि इसमें ATM का उल्लेख है और इसमें तत्काल भाषा का उपयोग किया गया है..." यह धीमा है लेकिन जटिल स्कैम्स के लिए अक्सर अधिक सटीक होता है।

मुख्य निष्कर्ष

यह पेपर साबित करता है कि AI सुरक्षा के मामले में "एक आकार सभी के लिए उपयुक्त नहीं होता"। ताइवान के लोगों को सुरक्षित रखने के लिए, आप केवल अमेरिकी या ब्रिटिश डेटा पर प्रशिक्षित मॉडल का उपयोग नहीं कर सकते। आपको एक ऐसे मॉडल की आवश्यकता है जो स्थानीय भाषा, स्थानीय मजाक, स्थानीय स्कैम और स्थानीय संस्कृति को समझता हो।

Breeze Guard और TS-Bench उन लोगों के लिए AI को भरोसेमंद बनाने की दिशा में पहले कदम हैं, जो केवल अंग्रेजी बोलने वाली दुनिया तक सीमित नहीं हैं। यह सुरक्षा गार्ड को सही स्थानीय मानचित्र देने के बारे में है ताकि वे सामने दिख रहे वास्तविक खतरों को मिस न कर दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →