A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts
यह शोध पत्र एक मान्य 1,554-प्रॉम्प्ट "CODE" बैंक और एक सर्वसम्मति-लेबल वाली वर्गीकरण रूपरेखा प्रस्तुत करता है जो मौजूदा भाषा मॉडल सुरक्षा बेंचमार्क में निहित संलयन संबंधी समस्याओं को संबोधित करने के लिए निष्पादन योग्य दुर्भावनापूर्ण सॉफ़्टवेयर अनुरोधों को हानिकारक सुरक्षा ज्ञान प्रश्नों से कठोरता से अलग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि एक सुरक्षा गार्ड बुरे लोगों को रोकने में कितना कुशल है। आपके पास गार्ड को देने के लिए अनुरोधों की एक सूची है। कुछ अनुरोध ऐसे हैं जैसे आप गार्ड को एक भरी हुई बंदूक थमा रहे हों और कह रहे हों, "इस व्यक्ति को गोली मारो।" अन्य अनुरोध ऐसे हैं जैसे आप गार्ड को एक पाठ्यपुस्तक थमा रहे हों और कह रहे हों, "एक बंदूक कैसे काम करती है और इसे निशाना कैसे लगाना है, यह समझाओ।"
लंबे समय से, एआई सुरक्षा (AI safety) का परीक्षण करने वाले शोधकर्ता इन दो प्रकार के अनुरोधों को एक ही बड़े ढेर में मिला देते थे। वे एआई से "एक वायरस लिखें" (भरी हुई बंदूक) और "एक वायरस कैसे फैलता है यह समझाएं" (पाठ्यपुस्तक) जैसे अनुरोध करते थे और फिर बस इस बात को गिनते थे कि एआई ने कितनी बार "नहीं" कहा।
इस शोध पत्र के लेखक, रिचर्ड जे. यंग और ग्रेगरी डी. मूडी, कहते हैं कि यह परीक्षण करने का एक अव्यवस्थित तरीका है। यदि एआई वायरस लिखने से मना कर देता है लेकिन खुशी-खुशी पाठ्यपुस्तक समझा देता है, या इसके विपरीत, तो एक एकल "नहीं" की गिनती आपको यह नहीं बताती कि एआई के मस्तिष्क के अंदर वास्तव में क्या हो रहा है। यह एक गार्ड द्वारा गोलियों को रोकने की क्षमता मापने के साथ-साथ यह भी गिनने जैसा है कि वह गोलियों के बारे में पढ़ने से कितनी अच्छी तरह रोकता है। आप यह नहीं बता सकते कि गार्ड हथियारों को रोकने में अच्छा है या केवल जानकारी को रोकने में अच्छा है।
बड़ी अवधारणा: "हथियारों" को "ज्ञान" से अलग करना
इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया उपकरण बनाया: एक सत्यापित प्रॉम्प्ट बैंक (Validated Prompt Bank)। इसे एक अत्यधिक व्यवस्थित, दोहरी-जांची गई फाइलिंग कैबिनेट के रूप में समझें। उन्होंने चार अलग-अलग मौजूदा परीक्षण सूचियों से हजारों प्रश्न लिए और उन्हें दो अलग-अलग दराजों में वर्गीकृत किया:
- "हथियारों" वाली दराज: ये वे प्रॉम्प्ट हैं जो एआई से कुछ खतरनाक बनाने के लिए कहते हैं, जैसे कि कोई मैलवेयर या एक स्क्रिप्ट जो कंप्यूटर पर चल सके। ये "निष्पादन योग्य हथियार" (executable weapons) हैं।
- "ज्ञान" वाली दराज: ये वे प्रॉम्प्ट हैं जो एआई से खतरनाक चीजों का वर्णन करने के लिए कहते हैं, जैसे कि एक वायरस कैसे काम करता है या एक सिस्टम को कैसे हैक किया जाता है, बिना वास्तविक कोड बनाए।
उन्होंने फाइलिंग कैबिनेट कैसे बनाया
उन्होंने केवल कागजों को छाँटा नहीं; वे पूरी तरह सुनिश्चित होना चाहते थे कि छंटनी सही थी। इसलिए, उन्होंने पांच अलग-अलग एआई न्यायाधीशों की एक "जूरी" स्थापित की। ये न्यायाधीश पांच अलग-अलग तकनीकी कंपनियों (Anthropic, OpenAI, Google, Zhipu AI, और Alibaba) से थे।
कल्पना कीजिए कि पांच अलग-अलग विशेषज्ञ एक ही अनुरोध को देख रहे हैं। उन सभी को मतदान करना होगा: "क्या यह एक हथियार के लिए अनुरोध है, या यह केवल जानकारी के लिए एक अनुरोध है?"
- यदि पांच में से कम से कम तीन सहमत होते हैं, तो वही अंतिम उत्तर होता है।
- उन्होंने अपना काम जांचने के लिए एक सांख्यिकीय उपकरण (जिसे Fleiss' कहा जाता है) का उपयोग किया कि वे कितने सहमत थे। परिणाम "लगभग पूर्ण" सहमति (1.0 में से 0.876) था। इसका मतलब है कि वर्गीकरण अविश्वसनीय रूप से विश्वसनीय है।
परिणाम: एक स्वच्छ, सत्यापित सूची
17,000 से अधिक मूल अनुरोधों को छाँटने और डुप्लिकेट या भ्रमित करने वाले अनुरोधों को हटाने के बाद, उनके पास 1,554 प्रॉम्प्ट की एक स्वच्छ, सत्यापित सूची बची, जो पूरी तरह से "हथियारों" (दुर्भावनापूर्ण कोड) के बारे में पूछने के बारे में है। उन्होंने तुलना के लिए बाद में उपयोग करने के लिए 388 प्रॉम्प्ट की एक छोटी सूची भी रखी जो "ज्ञान" के बारे में थी।
यह क्यों महत्वपूर्ण है
इस शोध पत्र से पहले, यदि कोई शोधकर्ता यह परीक्षण करना चाहता था कि एक एआई सुरक्षित था या नहीं, तो उसे अपने स्वयं के अव्यवस्थित प्रश्नों का ढेर बनाना पड़ता था, जिसमें यह अनुमान लगाना पड़ता था कि कौन से "हथियार" हैं और कौन से "ज्ञान"। इसका मतलब था कि प्रत्येक अध्ययन थोड़ा अलग था, जिससे परिणामों की तुलना करना कठिन हो गया था।
यह शोध पत्र एक मानकीकृत, पूर्व-वर्गीकृत प्रश्नों का सेट प्रदान करता है। अब, शोधकर्ता कह सकते हैं, "हमने एआई का इन विशिष्ट 1,554 हथियार अनुरोधों पर परीक्षण किया," और बाकी सभी जानते हैं कि इसका क्या अर्थ है। यह अनुमान को हटा देता है और विभिन्न एआई मॉडल द्वारा खतरनाक अनुरोधों को संभालने के तरीके की निष्पक्ष, सेब-से-सेब (apples-to-apples) तुलना करने की अनुमति देता है।
महत्वपूर्ण सुरक्षा नोट
लेखक बहुत स्पष्ट हैं: उन्होंने कोई नया वायरस या खतरनाक कोड नहीं बनाया। उन्होंने केवल अन्य शैक्षणिक अध्ययनों से मौजूदा प्रश्न लिए और उन्हें वर्गीकृत किया। इस उपकरण का लक्ष्य शोधकर्ताओं को यह समझने में मदद करना है कि एआई कहाँ विफल होता है, ताकि वे एआई को अधिक सुरक्षित बना सकें, न कि किसी को हमले बनाने में मदद करना। डेटा एक "गेटेड" प्रणाली के पीछे लॉक है, जिसका अर्थ है कि केवल सुरक्षा पर काम करने वाले सत्यापित शोधकर्ताओं को ही प्रश्नों के वास्तविक टेक्स्ट तक पहुंच प्राप्त है।
संक्षेप में, इस शोध पत्र ने एआई सुरक्षा को मापने के लिए एक बेहतर, स्वच्छ पैमाना बनाया, जो "बुरा काम करने" के अनुरोधों को "बुरी चीज़ के बारे में बात करने" के अनुरोधों से अलग करता है ताकि हम उन्हें सटीक रूप से माप सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।