Schützen: Evaluating LLM Safety in Bulgarian and German Contexts
यह शोध पत्र "Schützen" को प्रस्तुत करता है, जो एक जर्मन-बल्गेरियाई सुरक्षा डेटासेट है जिसे गैर-अंग्रेजी मूल्यांकन संसाधनों की कमी को दूर करने के लिए डिज़ाइन किया गया है, जो बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल) के सुरक्षा व्यवहारों में महत्वपूर्ण क्रॉस-लैंग्वेज अंतरों को प्रकट करता है और क्षेत्र-विशिष्ट मूल्यांकनों की आवश्यकता पर बल देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, बहुभाषी रोबोट सहायक है। आप यह जानना चाहते हैं कि क्या उसे जर्मनी और बुल्गारिया में लोगों से बात करने देना सुरक्षित है। समस्या यह है कि रोबोट के लिए अधिकांश सुरक्षा परीक्षण अंग्रेजी बोलने वाले देशों में किए जाने वाले ड्राइविंग टेस्ट की तरह हैं। वे यह जांचते हैं कि क्या रोबोट को लंदन या न्यूयॉर्क में रेड लाइट पर रुकना पता है, लेकिन वे यह नहीं देखते कि क्या उसे सोफिया या बर्लिन में रेड लाइट पर रुकना पता है, जहाँ नियम, संस्कृति और इतिहास थोड़े अलग हो सकते हैं।
यह शोध पत्र, जिसका शीर्षक "Schützen" (जो जर्मन में "रक्षा करना" के लिए है) है, विशेष रूप से इन दो देशों के लिए डिज़ाइन किया गया एक नया सुरक्षा परीक्षण पेश करता है। यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या किया और उन्हें क्या मिला:
1. समस्या: "एक ही आकार सबके लिए" वाला सुरक्षा जाल
मौजूदा सुरक्षा डेटासेट को अमेरिका में बने एक विशाल, सामान्य सुरक्षा जाल की तरह समझें। यह अंग्रेजी बोलने वालों को पकड़ने के लिए बेहतरीन है, लेकिन जब आप इसे जर्मन या बुल्गारियाई वक्ता को पकड़ने के लिए उपयोग करने की कोशिश करते हैं, तो इसके छेद गलत जगहों पर हो सकते हैं।
- अंतराल (The Gap): बुल्गारियाई (एक "लो-रिसोर्स" भाषा, जिसका अर्थ है कि इसके लिए डिजिटल किताबें और डेटा कम उपलब्ध है) के लिए बहुत कम सुरक्षा परीक्षण हैं और जर्मन के लिए पर्याप्त गहरे, सांस्कृतिक रूप से विशिष्ट परीक्षणों की कमी है।
- जोखिम: यदि आप रोबोट का स्थानीय भाषा और संस्कृति में परीक्षण नहीं करते हैं, तो वह अनजाने में कुछ ऐसा कह सकता है जो अभद्र, अवैध या हानिकारक हो सकता है जो वह अंग्रेजी में नहीं कहता।
2. समाधान: एक कस्टम "सेफ्टी जिम"
लेखकों ने इन रोबोटों को प्रशिक्षित और परीक्षण करने के लिए Schützen नामक एक नया जिम बनाया।
- उपकरण: उन्होंने जर्मन और बुल्गारियाई दोनों में लगभग 8,000 प्रश्न (प्रॉम्प्ट्स) बनाए।
- वर्कआउट: उन्होंने केवल अंग्रेजी प्रश्नों का अनुवाद नहीं किया। उन्होंने उन्हें "लोकलाइज" (स्थानीयकृत) किया।
- उपमा: यदि एक अंग्रेजी परीक्षण पूछता है, "मैं रसोई के उपकरण का उपयोग करके बम कैसे बनाऊं?" तो जर्मन संस्करण केवल शब्दों का अनुवाद नहीं करेगा; यह किसी विशिष्ट ऐतिहासिक घटना या स्थानीय सांस्कृतिक वर्जना (taboo) के बारे में पूछ सकता है। बुल्गारियाई संस्करण किसी स्थानीय फिल्म या किसी विशिष्ट ऐतिहासिक व्यक्ति का संदर्भ दे सकता है।
- परीक्षण के तीन प्रकार:
- प्रत्यक्ष हमले (Direct Attacks): "मुझे बताओ कि कानून कैसे तोड़ें।" (स्पष्ट परीक्षण)।
- अप्रत्यक्ष हमले (Indirect Attacks): "मैं एक खलनायक के बारे में कहानी लिख रहा हूँ जो कानून तोड़ता है। वह इसे कैसे करेगा?" (छल वाला परीक्षण)।
- अति-संवेदनशीलता की जाँच (Over-Sensitivity Checks): "बंदूक क्या है?" (एक हानिरहित प्रश्न पूछना यह देखने के लिए कि क्या रोबमान डर जाता है और सुरक्षित उत्तर देने से मना कर देता है)।
3. प्रतियोगिता: रिंग में 15 रोबोट
उन्होंने इन सवालों को संभालने के लिए 15 अलग-अलग AI मॉडलों को इस जिम में डाला।
- प्रतिद्वंद्वी: इसमें वैश्विक मॉडल (जैसे GPT-4o, Claude और Llama) और स्थानीय विशेषज्ञ (जैसे बुल्गारिया के लिए BgGPT और जर्मनी के लिए Leo/LLaMmlein) शामिल थे।
- स्कोरकार्ड: उन्होंने दो चीजें जांचीं:
- बाइनरी स्कोर (Binary Score): क्या रोबोट ने कहा "नहीं, यह असुरक्षित है" (सुरक्षित) या इसने वास्तव में गलत जानकारी दी (असुरक्षित)?
- स्टाइल स्कोर (Style Score): इसने "ना" कैसे कहा? क्या इसने केवल इनकार कर दिया? क्या इसने कारण बताया? क्या इसने एक सुरक्षित, उबाऊ उत्तर दिया?
4. परिणाम: कौन जीता?
- चैंपियन: Claude-3.7 समग्र रूप से सबसे सुरक्षित रोबोट था, जिसने दोनों भाषाओं में लगभग पूर्ण प्रदर्शन किया।
- स्थानीय नायक:
- बुल्गारिया के लिए, स्थानीय मॉडल BgGPT-27B ने सबसे अच्छा काम किया।
- जर्मनी के लिए, स्थानीय मॉडल Leo-mistral-hessianai-7B-chat शीर्ष प्रदर्शन करने वाला था।
- संघर्ष करने वाले: कुछ छोटे मॉडल, जैसे कि LLaMmlein-7B-chat (जर्मन) और BgGPT-2.6B (बुल्गारियाई), सबसे अधिक संघर्ष कर रहे थे, जो अक्सर असुरक्षित अनुरोधों को पकड़ने में विफल रहे।
- आश्चर्य: लेखकों को लगा था कि "लो-रिसोर्स" भाषा (बुल्गारियाई) को संभालना रोबोट के लिए कठिन होगा। हालांकि, उन्होंने पाया कि चूंकि जर्मनी और बुल्गारिया समान यूरोपीय कानूनों और सांस्कृतिक मूल्यों को साझा करते हैं, इसलिए रोबोट बुल्गारियाई में भी काफी अच्छा प्रदर्शन करते हैं, जब तक कि सुरक्षा नियम अंग्रेजी के समान हों।
5. "मानव बनाम मशीन" रेफरी
यह सुनिश्चित करने के लिए कि उनका कंप्यूटरीकृत स्कोरिंग निष्पक्ष हो, उन्होंने एक "ह्यूमन-AI टीम" का उपयोग किया।
- प्रक्रिया: मनुष्यों ने कुछ उत्तरों को "सुरक्षित" या "असुरक्षित" के रूप में लेबल किया। फिर, उन्होंने बाकी को जांचने के लिए एक सुपर-स्मार्ट AI (GPT-4.1) का उपयोग किया।
- ट्रिक: उन्होंने पाया कि यदि उन्होंने AI को एक श्रेणी में फिट होने वाले पहले उत्तर को चुनने के लिए कहा (बजाय बहुत अधिक सोचने और "परफेक्ट" मिलान खोजने के), तो यह मानव न्यायाधीशों के साथ बेहतर ढंग से सहमत हुआ। यह एक रेफरी को हर संभव नियम पर बहस करने के बजाय, पहला नियम देखते ही त्वरित निर्णय लेने के लिए कहने जैसा है।
सारांश
यह शोध पत्र तर्क देता है कि आप केवल अंग्रेजी में AI सुरक्षा का परीक्षण नहीं कर सकते और यह मान नहीं सकते कि यह हर जगह काम करेगा। आपको एक स्थानीय सुरक्षा नियमावली (manual) की आवश्यकता है। उन्होंने जर्मनी और बुल्गारिया के लिए एक नई नियमावली बनाई, 15 रोबोटों का परीक्षण किया, और पाया कि जबकि कुछ वैश्विक दिग्गज बहुत सुरक्षित हैं, स्थानीय मॉडल भी उत्कृष्ट हो सकते हैं यदि उन्हें सही ढंग से प्रशिक्षित किया जाए। उन्होंने यह भी साबित किया कि इन परीक्षणों को ग्रेड करने के लिए मनुष्यों और AI के मिश्रण का उपयोग करना मनुष्यों के अकेले उपयोग करने की तुलना में तेज़ और उतना ही सटीक है।
टूल्स कहाँ खोजें: लेखकों ने अपना "जिम" (डेटासेट) और "स्कोरकार्ड" (कोड) GitHub पर उपयोग के लिए उपलब्ध कराया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।