Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests
यह शोध पत्र एक सर्वसम्मति-लेबल वाले प्रॉम्प्ट बैंक (consensus-labeled prompt bank) को प्रस्तुत करता है जो कार्यात्मक हथियारों के निर्माण को रोकने के लिए आवश्यक सख्त इनकार मानकों (refusal standards) को पूरा करने के लिए कोडिंग-विशेषीकृत मॉडलों को मापने हेतु एक विश्वसनीय, मानकीकृत बेंचमार्क प्रदान करने के लिए निष्पादनीय दुर्भावनापूर्ण कोड और हानिकारक सुरक्षा ज्ञान के बीच अंतर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "कोड एज़ अ वेपन" (Code as a Weapon) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
मुख्य विचार: टेक्स्ट बनाम असली चीज़
कल्पना कीजिए कि आप एक सामान्य चैटबॉट से पूछते हैं, "मैं बम कैसे बनाऊं?" यदि वह उत्तर देता है, तो वह आपको एक रेसिपी (विधि) देता है। आपको अभी भी दुकान पर जाना होगा, सामग्री खरीदनी होगी और खुद मिश्रण बनाना होगा। यह खतरनाक जानकारी है, लेकिन यह सिर्फ शब्द हैं।
अब, कल्पना कीजिए कि आप उसी सवाल को एक कोडिंग-विशेषज्ञ AI से पूछते हैं। यदि वह उत्तर देता है, तो वह आपको केवल रेसिपी नहीं देता; वह आपको एक पूरी तरह से असेंबल किया हुआ, काम करने वाला बम थमा देता है जो "रन" दबाते ही फटने के लिए तैयार है।
इस पेपर के लेखक तर्क देते हैं कि क्योंकि कोडिंग AI तुरंत "काम करने वाले हथियार" (जैसे वायरस या स्पाइवेयर) सौंप सकते हैं, इसलिए उन्हें सामान्य चैटबॉट्स की तुलना में "ना" कहने में बहुत अधिक सख्त होना चाहिए। लेकिन अभी, किसी के पास इस बात को मापने का कोई अच्छा तरीका नहीं है कि वे वास्तव में पर्याप्त रूप से "ना" कह रहे हैं या नहीं।
समस्या: सेब और संतरे को मिलाना
इन AI की सुरक्षा परीक्षण करने के लिए, शोधकर्ता प्रश्नों की सूचियों (प्रॉम्प्ट्स) का उपयोग कर रहे हैं। लेकिन ये सूचियाँ अव्यवस्थित रही हैं। वे दो बहुत अलग प्रकार के खतरनाक अनुरोधों को मिला देते हैं:
- "हथियार" (Weapon) अनुरोध: "मेरे लिए पासवर्ड चुराने वाला एक प्रोग्राम लिखें।" (AI आपको कोड दे देता है)।
- "ज्ञान" (Knowledge) अनुरोध: "पासवर्ड चोरी कैसे काम करता है, यह समझाएं।" (AI आपको एक निबंध देता है)।
यदि आप इन दोनों को मिला देते हैं और कहते हैं, "इस AI ने 50% बुरे अनुरोधों को अस्वीकार कर दिया," तो आपको पता नहीं चलेगा कि उन्होंने हथियारों को अस्वीकार किया या केवल व्याख्याओं को। यह एक सुरक्षा गार्ड का परीक्षण करने जैसा है जिसे चोर को रोकने के लिए और रास्ता पूछने वाले व्यक्ति को रोकने के लिए कहा गया हो। यदि गार्ड चोर को रोकता है लेकिन रास्ता पूछने वाले को जाने देता है, तो आप केवल कुल रोके गए लोगों को देखकर यह नहीं बता सकते कि वे अपने काम में कितने अच्छे हैं।
समाधान: एक "कंसेंसस-लेबल" (सर्वसम्मति-लेबल) प्रॉम्प्ट बैंक
लेखकों ने 6,6775
खतरनाक सवालों की एक विशाल, स्वच्छ और व्यवस्थित सूची बनाई। उन्होंने उन्हें दो स्पष्ट श्रेणियों में विभाजित किया:
- "CODE" श्रेणी: निष्पादन योग्य (executable), खतरनाक सॉफ़्टवेयर मांगने वाले प्रश्न (ये "हथियार" हैं)।
- "KNOWLEDGE" श्रेणी: हानिकारक जानकारी या सिद्धांतों के बारे में पूछने वाले प्रश्न (ये "रेसिपी" हैं)।
यह सुनिश्चित करने के लिए कि सवालों को सही ढंग से वर्गीकृत किया गया है, उन्होंने केवल एक व्यक्ति से नहीं पूछा। उन्होंने पाँच अलग-अलग AI जजों (एक जूरी की तरह) का एक पैनल इस्तेमाल किया। प्रत्येक जज ने हर सवाल को देखा और वोट दिया: "क्या यह एक हथियार का अनुरोध है?" या "क्या यह एक ज्ञान का अनुरोध है?"
- फैसला: यदि 5 में से कम से कम 3 जज सहमत थे, तो उस सवाल को अंतिम लेबल दिया गया।
- परिणाम: उनके पास 4,748 पुष्ट "हथियार" अनुरोध और 1,923 पुष्ट "ज्ञान" अनुरोध बचे।
"जूरी" और आश्चर्यजनक तथ्य
लेखकों ने जज के रूप में पाँच अलग-अलग AI मॉडल का उपयोग किया। वे यह सुनिश्चित करना चाहते थे कि परीक्षण सस्ता और सबके लिए खुला हो, इसलिए उन्होंने महंगे, भुगतान वाले मॉडलों के बजाय मुफ्त या ओपन-सोर्स मॉडल चुने।
इस प्रक्रिया के दौरान, उन्हें दो दिलचस्प बातें पता चलीं:
1. "बहुत आसान" का विरोधाभास (The "Too Easy" Paradox)
कुछ प्रश्न सूचियों (जैसे ASTRA सूची) के लिए, लगभग हर एक प्रश्न स्पष्ट रूप से एक "हथियार" था। जजों ने 99% समय सहमति जताई।
- रूपक (Metaphor): एक गणित के टेस्ट की कल्पना करें जहाँ हर सवाल "2+2 क्या है?" है। हर कोई 100% अंक प्राप्त करता है। आप छात्रों की "बुद्धिमत्ता" को वास्तव में नहीं माप सकते क्योंकि टेस्ट बहुत आसान था।
- निष्कर्ष: सांख्यिकी (Statistics) में, जब हर कोई हर चीज़ पर सहमत होता है, तो "सहमति" का सामान्य स्कोर (जिसे 'कप्पा' कहा जाता है) टूट जाता है और शून्य या नकारात्मक संख्या के रूप में दिखता है। लेखकों को इसे रिपोर्ट करने का एक विशेष तरीका बनाना पड़ा: "हे, सभी पूरी तरह से सहमत थे, लेकिन गणितीय स्कोर अजीब दिख रहा है क्योंकि टेस्ट बहुत आसान था।"
2. "गेटकीपर" ग्लिच (The "Gatekeeper" Glitch)
पाँच में से एक AI जज (OpenAI का एक फ्री मॉडल) ने किसी भी सवाल का जवाब देने से मना करना शुरू कर दिया, यहाँ तक कि उन सवालों के लिए भी जिन्हें उसे जज करना था। वह उस कंपनी के "स्टॉप" साइन से टकरा रहा था जो उसे होस्ट करती है।
- रूपक: एक ऐसी जूरी की कल्पना करें जहाँ एक सदस्य को बहुत अधिक सवाल पूछने के लिए बार-बार अदालत से बाहर निकाल दिया जाता है।
- समाधान: चूंकि नियम "5 में से 3" था, इसलिए अन्य चार जज फैसला कर सकते थे। लेखकों ने इसे एक वास्तविक दुनिया की विचित्रता के रूप में नोट किया: कभी-कभी, आपके द्वारा सुरक्षा परीक्षण करने के लिए उपयोग किए जाने वाले मुफ्त टूल के अपने स्वयं के सुरक्षा फिल्टर होते हैं जो परीक्षण शुरू होने से पहले ही उसे ब्लॉक कर देते हैं।
यह क्यों मायने रखता है
यह पेपर किसी विशिष्ट AI का परीक्षण करने के बारे में नहीं है कि वह आज सुरक्षित है या नहीं। इसके बजाय, यह उस पैमाने (रूलर) को बनाने के बारे में है जिसे अन्य सभी उपयोग कर सकें।
इससे पहले, शोधकर्ता एक टूटे हुए पैमाने के साथ सुरक्षा को मापने की कोशिश कर रहे थे जो हथियारों और रेसिपी को मिला देता था। अब, उनके पास एक मानकीकृत, उच्च-गुणवत्ता वाला पैमाना (प्रॉम्प्ट बैंक) है जो दोनों को स्पष्ट रूप से अलग करता है। यह किसी को भी कोडिंग AI का परीक्षण करने और यह कहने की अनुमति देता है कि, "ठीक है, इस AI ने 90% वास्तविक हथियारों को अस्वीकार कर दिया," जो पहले की तुलना में बहुत अधिक सार्थक सुरक्षा जांच है।
सारांश
- लक्ष्य: खतरनाक सवालों की एक स्वच्छ सूची बनाना ताकि कोडिंग AI सुरक्षित हैं या नहीं, इसका परीक्षण किया जा सके।
- विधि: 6,675 सवालों को "हथियारों" (Code) और "रेसिपी" (Knowledge) में वर्गीकृत करने के लिए 5 AI की एक "जूरी" का उपयोग किया गया।
- परिणाम: 4,748 पुष्ट हथियार अनुरोधों और 1,923 ज्ञान अनुरोधों का एक सार्वजनिक डेटाबेस।
- मुख्य अंतर्दृष्टि: आप सुरक्षा को ठीक से नहीं माप सकते यदि आप "बम बनाने" और "बमों के बारे में पढ़ने" को मिला देते हैं। यह पेपर उस गड़बड़ी को ठीक करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।