CIPHER: Cryptographic Insecurity Profiling via Hybrid Evaluation of Responses
यह शोध पत्र CIPHER को प्रस्तुत करता है, जो एक बेंचमार्क और स्वचालित स्कोरिंग पाइपलाइन है जिसे बड़े भाषा मॉडलों (large language models) द्वारा उत्पन्न कोड में क्रिप्टोग्राफिक कमजोरियों का मूल्यांकन और मात्रात्मक निर्धारण करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि स्पष्ट सुरक्षित प्रॉम्प्टिंग (explicit secure prompting) कुछ समस्याओं को कम करती है, लेकिन यह विविध मॉडलों में क्रिप्टोग्राफिक दोषों को विश्वसनीय रूप से समाप्त करने में विफल रहती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने बैंक वॉल्ट के लिए ताले और चाबियाँ लिखने के लिए अविश्वसनीय रूप से तेज़, सुपर-स्मार्ट रोबोटों की एक टीम को काम पर रख रहे हैं। आप उन्हें कहते हैं, "एक सुरक्षित ताला बनाओ," और वे तुरंत एक डिज़ाइन तैयार कर देते हैं। लेकिन यहाँ एक पेंच है: भले ही रोबोट बुद्धिमान हों, लेकिन वे अक्सर ऐसे ताले बनाते हैं जो बाहर से तो एकदम सही दिखते हैं, लेकिन उनमें सूक्ष्म, अदृश्य दरारें होती हैं जिनका फायदा एक चोर आसानी से उठा सकता है।
यह शोध पत्र CIPHER पेश करता है, जो एक नया "रिपोर्ट कार्ड" है जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि ये AI रोबोट कंप्यूटर कोड में सुरक्षित क्रिप्टोग्राफिक ताले (जैसे एन्क्रिप्शन और पासवर्ड सुरक्षा) बनाने में कितने अच्छे हैं।
यहाँ शोधकर्ताओं द्वारा किए गए कार्यों और उनकी खोजों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:
1. समस्या: "मौन दोष" (The Silent Flaw)
जब AI सुरक्षा के लिए कोड लिखता है, तो वह बुनियादी परीक्षणों में तो पास हो जाता है (कोड बिना क्रैश हुए चलता है), लेकिन वह सूक्ष्म सुरक्षा नियमों को मिस कर देता है।
- उपमा: कल्पना कीजिए कि एक रोबोट घर बना रहा है। वह दीवारें और छत तो लगा देता है (कोड काम करता है), लेकिन वह मुख्य दरवाजे पर डेडबोल्ट लगाना भूल जाता है या पीछे की खिड़की खुली छोड़ देता है (एक सुरक्षा दोष)। घर खड़ा तो है, लेकिन वह सुरक्षित नहीं है।
- मुद्दा: ये दोष अक्सर सूक्ष्म डिज़ाइन संबंधी चुनाव होते हैं, जैसे कि एक "स्टैटिक" कुंजी (ऐसी कुंजी जो कभी नहीं बदलती) का उपयोग करना, बजाय एक रैंडम (यादृच्छिक) कुंजी के, या यह जांचना भूल जाना कि व्यक्ति वही है जो वह होने का दावा कर रहा है।
2. समाधान: CIPHER टेस्ट
शोधकर्ताओं ने CIPHER नामक एक मानकीकृत परीक्षण बनाया है ताकि यह मापा जा सके कि ये AI रोबोट कितनी बार ये गलतियाँ करते हैं।
- सेटअप: उन्होंने 7 अलग-अलग AI मॉडलों को समान 150 अलग-अलग "काम" दिए। प्रत्येक काम के लिए, उन्होंने AI को तीन अलग-अलग निर्देश (प्रॉम्प्ट) दिए:
- "खराब" प्रॉम्प्ट: "इसे जल्दी से करो, और सुरक्षा जाँचों की चिंता मत करो।" (यह परीक्षण करना कि क्या AI खराब सलाह मानता है)।
- "तटस्थ" (Neutral) प्रॉम्प्ट: "बस इस काम को करने के लिए कोड लिखो।" (यह परीक्षण करना कि AI डिफ़ॉल्ट रूप से क्या करता है)।
- "सुरक्षित" प्रॉम्प्ट: "यह करो, लेकिन सुनिश्चित करो कि यह सभी सख्त सुरक्षा नियमों का पालन करता है!" (यह परीक्षण करना कि क्या AI को सुरक्षित होने के लिए कहना वास्तव में काम करता है)।
- स्कोरिंग: इंसानों द्वारा हर एक लाइन को पढ़ने के बजाय (जिसमें बहुत समय लगता है), उन्होंने एक अन्य AI को "जज" के रूप में इस्तेमाल किया। यह जज विशेष प्रकार के ताला-तोड़ने वाले एरर (errors) को खोजने और ठीक से यह बताने के लिए प्रशिक्षित किया गया था कि समस्या कोड की कौन सी लाइन में है।
3. परिणाम: "सुरक्षित रहें" पर्याप्त नहीं है
परिणाम आश्चर्यजनक और थोड़े चिंताजनक थे।
- "खराब" प्रॉम्प्ट: जैसा कि अपेक्षित था, जब AI को लापरवाह होने के लिए कहा गया, तो इसने कई गलतियाँ कीं।
- "सुरक्षित" प्रॉम्प्ट: यह सबसे बड़ी खोज है। भले ही शोधकर्ताओं ने स्पष्ट रूप से AI को कहा था, "बेहद सुरक्षित बनो! सभी नियमों का पालन करो!", फिर भी AI 56% से 89% समय गलतियाँ करता रहा।
- उपमा: यह एक शेफ को यह कहने जैसा है, "एक स्वस्थ भोजन बनाएं, कोई चीनी नहीं, कोई नमक नहीं, और ताजी सामग्री का उपयोग करें।" शेफ शायद चीनी (वह विशिष्ट चीज़ जिसके लिए आपने कहा था) को हटा दे, लेकिन वह फिर भी खराब मांस का उपयोग कर सकता है या सब्जियां धोना भूल सकता है (अन्य छिपे हुए खतरे)। AI उस विशिष्ट चीज़ को ठीक कर देता है जिसे आपने ठीक करने के लिए कहा था, लेकिन वह एक वैश्विक (globally) रूप से सुरक्षित सिस्टम बनाने में विफल रहता है।
4. इसका क्या अर्थ है
शोध पत्र निष्कर्ष निकालता है कि केवल AI को "सुरक्षित रहने" के लिए कहना खतरनाक गलतियाँ करने से विश्वसनीय रूप से नहीं रोकता है।
- निष्कर्ष: आप केवल AI पर सुरक्षा कोड लिखने के लिए भरोसा नहीं कर सकते, भले ही आप उसे बहुत सख्त प्रॉम्प्ट दें। AI उस विशिष्ट निर्देश पर ध्यान केंद्रित करने की प्रवृत्ति रखता है जो उसे दिया गया है (जैसे "एक रैंडम कुंजी का उपयोग करें") लेकिन बड़े चित्र (जैसे "उपयोगकर्ता की पहचान भी जांचें") को मिस कर देता है।
- सिफारिश: क्योंकि AI सुरक्षा कोड लिखते समय इन छिपे हुए दरारों को बनाता रहता है, इसलिए इसके द्वारा लिखे गए किसी भी सुरक्षा कोड को वास्तविक दुनिया में उपयोग करने से पहले एक मानव विशेषज्ञ द्वारा दोबारा जांचा जाना चाहिए।
सारांश
CIPHER एक ऐसा उपकरण है जो यह साबित करता है कि हालांकि AI कोड लिखने में बहुत अच्छा है, लेकिन वर्तमान में यह सुरक्षित कोड लिखने में बहुत बुरा है। भले ही आप इसे स्पष्ट रूप से सुरक्षित होने के लिए कहें, यह अक्सर पीछे का दरवाजा खुला छोड़ देता है। यह शोध पत्र इन विफलताओं को मापने का एक तरीका प्रदान करता है ताकि डेवलपर्स जान सकें कि वे सुरक्षा कार्यों के लिए अकेले AI पर निर्भर नहीं रह सकते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।