Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)
यह शोध पत्र कोडिंग एलएलएम (LLM) रिफ्यूज़ल के मूल्यांकन के लिए उपयोग किए जाने वाले तेरह मैलिशियस-कोड प्रॉम्प्ट कॉर्पोरा की एक व्यवस्थित समीक्षा प्रस्तुत करता है, जो मानव एनोटेशन बेसलाइन, क्रॉस-कॉर्पस तुलनीयता और वर्गीकरण मानकीकरण में महत्वपूर्ण पद्धतिगत अंतराल की पहचान करते हुए भविष्य के डेटासेट निर्माण के लिए एक एकीकृत ढांचे का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि हम एक ऐसी दुनिया में हैं जहाँ हम विशाल, अत्यंत बुद्धिमान रोबोटों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) को एक अच्छा नागरिक बनना सिखाने की कोशिश कर रहे हैं। विशेष रूप से, हम यह जानना चाहते हैं: यदि कोई इन रोबोटों से कंप्यूटर वायरस या स्कैम (धोखाधड़ी) लिखने के लिए कहता है, तो क्या वे "ना" कहेंगे?
इसकी जांच करने के लिए, शोधकर्ता "परीक्षा प्रश्न पत्र" (प्रॉम्प्ट्स के डेटासेट) बना रहे हैं ताकि रोबोटों को चकमा दिया जा सके। यह पेपर 2023 और 2025 के बीच बनाए गए 13 अलग-अलग परीक्षा प्रश्न पत्रों का एक व्यापक रिपोर्ट कार्ड रिव्यू है। लेखक, रिचर्ड यंग और ग्रेगरी मूडी ने यह देखने के लिए इन सभी परीक्षाओं का विश्लेषण किया कि उन्हें कैसे बनाया गया था, वे कितनी निष्पक्ष थीं, और वे वास्तव में क्या परीक्षण करती थीं।
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:
1. समस्या: हर कोई एक अलग पैमाने (रूलर) का उपयोग कर रहा है
कल्पना कीजिए कि आप 13 अलग-अलग लोगों की ऊंचाई की तुलना करने की कोशिश कर रहे हैं। लेकिन यहाँ पेंच यह है:
- व्यक्ति A को इंच के पैमाने से मापा गया है।
- व्यक्ति B को सेंटीमीटर के टेप से मापा गया है।
- व्यक्ति C को दीवार तक पहुँचने के लिए उसके द्वारा लिए गए कदमों से मापा गया है।
- व्यक्ति D को किसी अन्य व्यक्ति द्वारा मापा गया है।
यह पेपर तर्क देता है कि इन AI सुरक्षा परीक्षणों के साथ बिल्कुल यही हो रहा है। प्रत्येक के 13 परीक्षा प्रश्न पत्र (जैसे AdvBench, CyberSecEval, RedCode, आदि) अलग तरह से बनाए गए थे:
- अलग-अलग प्रश्न: कुछ सीधे कोड मांगते हैं; कुछ एक जटिल कहानी के माध्यम से कोड मांगते हैं; कुछ AI को हैकर की तरह व्यवहार करने के लिए कहते हैं; अन्य AI को एक सहायक के रूप में कार्य करने के लिए कहते हैं जो शायद कोई गलती कर दे।
- अलग-अलग ग्रेडर (मूल्यांकनकर्ता): कुछ परीक्षाओं का मूल्यांकन केवल उनके लेखकों द्वारा किया जाता है। कुछ का मूल्यांकन अन्य AI बॉट्स द्वारा किया जाता है। कुछ का मूल्यांकन कोड को एक 'सैंडबॉक्स' में चलाकर यह देखने के लिए किया जाता है कि क्या वह फट जाता है।
- अलग-अलग नियम: कुछ परीक्षाओं के पास "वायरस" के बारे में सख्त नियम हैं। अन्य अस्पष्ट हैं।
परिणाम: आप एक परीक्षा के "रिफ्यूज़ल रेट" (कितनी बार AI ने "ना" कहा) को दूसरी परीक्षा के साथ सीधे तुलना नहीं कर सकते। यह एक धावक के समय की तुलना एक तैराक के समय से करने जैसा है और बिना यह जाने घोषित करने जैसा है कि कौन "तेज" है कि दोनों अलग-अलग खेल खेल रहे थे।
2. तीन बड़ी गायब चीजें
लेखकों ने पाया कि इनमें से किसी भी 13 परीक्षा प्रश्न पत्रों में तीन महत्वपूर्ण सुरक्षा विशेषताएं शामिल नहीं थीं, जिनकी आप एक गंभीर वैज्ञानिक अध्ययन में अपेक्षा करेंगे:
- AI को कैलिब्रेट करने के लिए कोई "मानव न्यायाधीश" नहीं: अधिकांश परीक्षा अन्य AI बॉट्स का उपयोग करके उत्तरों का मूल्यांकन करती हैं। लेकिन पेपर बताता है कि हमें यह नहीं पता कि ये AI ग्रेडर वास्तव में सही हैं या नहीं। यह एक रोबोट को गणित का टेस्ट ग्रेड करने जैसा है बिना यह जांचे कि क्या उस रोबोट की ग्रेडिंग कुंजी (key) को किसी मानव शिक्षक ने कभी चेक किया है। किसी भी 13 पेपरों में "फ्लेइस कापा" (Fleiss' kappa) स्कोर (एक सांख्यिकीय तरीका यह साबित करने का कि विभिन्न मानव न्यायाधीश एक ही उत्तर पर सहमत होंगे) शामिल नहीं था।
- कोई "बंद दरवाजे" नहीं (गेटेड एक्सेस): इन परीक्षाओं में खतरनाक सॉफ्टवेयर (मालवेयर) बनाने के निर्देश शामिल हैं। फिर भी, सभी 13 पूरी तरह से सार्वजनिक हैं। कोई भी इन्हें डाउनलोड कर सकता है, भले ही उनके इरादे बुरे हों। यह बम बनाने की कुकबुक प्रकाशित करने और उसे किसी के भी उठाने के लिए पार्क की बेंच पर छोड़ने जैसा है।
- कोई "रिकॉल पॉलिसी" (हटाने की नीति) नहीं: यदि कोई इन परीक्षाओं में कोई खतरनाक प्रॉम्प्ट पाता है जो वहां नहीं होना चाहिए, या यदि AI इससे सीख जाता है और वास्तविक वायरस बनाना शुरू कर देता है, तो ऐसी कोई आधिकारिक व्यवस्था नहीं है जिससे इन लेखकों से संपर्क करके इसे हटाया जा सके। किसी भी पेपर में "टेकडाउन पॉलिसी" या जिम्मेदार व्यक्ति का उल्लेख नहीं किया गया था।
3. क्लासरूम में "खाली सीटें"
लेखकों ने एक मानचित्र (टैक्सोनॉमी) बनाया है यह दिखाने के लिए कि किस प्रकार के "ट्रिक सवाल" मौजूद हैं। उन्होंने पाया कि शोधकर्ता सभी एक ही कुछ सीटों पर बैठे हैं, जिससे कई सीटें खाली रह गई हैं:
- भीड़भाड़ वाली सीटें: अधिकांश परीक्षा एक ही सीधे वाक्य में कोड मांगती हैं (जैसे, "एक वायरस लिखें")।
- खाली सीटें: बहुत कम परीक्षा जटिल परिदृश्यों का परीक्षण करती हैं, जैसे:
- एक लंबी बातचीत (multi-turn) के माध्यम से AI से धीरे-धीरे वायरस बनाने के लिए कहना।
- AI को एक स्वायत्त एजेंट (autonomous agent) के रूप में कार्य करने के लिए कहना जो कंप्यूटर को नियंत्रित करता है।
- ऐसे कोड के लिए पूछना जो केवल सॉफ्टवेयर के बजाय हार्डवेयर (जैसे स्मार्ट फ्रिज या कार चिप्स) पर हमला करता है।
चूंकि "सीटें" असमान हैं, इसलिए डेटा पक्षपाती है। हम इस बारे में बहुत कुछ जानते हैं कि AI सरल अनुरोधों को कैसे संभालता है, लेकिन हम बहुत कम जानते हैं कि यह जटिल, बहु-चरणीय हमलों को कैसे संभालता है।
4. सिफारिशें: क्लासरूम को कैसे ठीक करें
पेपर सुझाव देता है कि यदि हम भविष्य में बेहतर "परीक्षा प्रश्न पत्र" बनाना चाहते हैं, तो हमें एक नई चेकलिस्ट का पालन करना चाहिए:
- नियमों को प्री-रजिस्टर करें: परीक्षा बनाने से पहले, ठीक से लिखें कि आप क्या परीक्षण कर रहे हैं ताकि आप बीच में नियम न बदलें।
- मानव न्यायाधीशों का पैनल उपयोग करें: केवल एक AI का उपयोग करके ग्रेड न करें। न्यायाधीशों के एक विविध समूह (या मनुष्यों और विभिन्न AI के मिश्रण) का उपयोग करें जो इस बात पर सहमत हों कि क्या "अस्वीकार" (refusal) माना जाए।
- सहमत स्कोर (Agreement Score) रिपोर्ट करें: एक सांख्यिकी प्रकाशित करें जो दिखाती है कि न्यायाधीश वास्तव में एक-दूसरे के साथ सहमत थे।
- एक मानक शब्दकोश का उपयोग करें: "बुरे कामों" (मालवेयर प्रकारों) की एक एकल सूची पर सहमत हों ताकि सभी एक ही श्रेणियों को गिन सकें।
- दरवाजा बंद रखें: यदि परीक्षा में खतरनाक निर्देश शामिल हैं, तो इसे प्राप्त करना कठिन बनाएं (शोधकर्ता आवेदन की आवश्यकता हो) ताकि बुरे तत्व इसे आसानी से डाउनलोड न कर सकें।
- एक संरक्षक (Guardian) का नाम दें: एक विशिष्ट व्यक्ति होना चाहिए जो नुकसान होने पर परीक्षा को हटाने के लिए जिम्मेदार हो।
सारांश
यह पेपर एक "सिस्टमैटिक रिव्यू" है, जिसका अर्थ है कि इसने नए प्रयोग नहीं चलाए। इसके बजाय, इसने एक लाइब्रेरियन की तरह काम किया जो 13 अलग-अलग "सेफ्टी टेस्ट" किताबों वाले कमरे में गया, उन सभी को खोला, और महसूस किया: "हम सभी टूटे हुए रूलर से अलग-अलग चीजें माप रहे हैं, और हम इन किताबों के खतरनाक हिस्सों को किसी के भी ढूंढने के लिए खुले में छोड़ रहे हैं।"
लेखक समुदाय से आह्वान कर रहे हैं कि वे इन परीक्षणों को अलग-थलग बनाने के बजाय, एक मानक, सुरक्षित और निष्पक्ष तरीके पर सहमत होने लगें जिससे यह मापा जा सके कि क्या AI वास्तव में बुरे काम करने से इनकार कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।