LLM-enabled Applications Require System-Level Threat Monitoring
यह स्थिति पत्र (position paper) तर्क देता है कि एलएलएम-सक्षम (LLM-enabled) अनुप्रयोगों के अंतर्निहित गैर-नियतत्ववादी (non-deterministic) जोखिमों के लिए केवल मॉडल सुधारों या पूर्व-तैनाती सुरक्षा उपायों पर निर्भर रहने के बजाय, विश्वसनीय संचालन और प्रभावी घटना प्रतिक्रिया के लिए एक मौलिक पूर्व शर्त के रूप में व्यवस्थित, प्रणाली-स्तरीय खतरे की निगरानी को लागू करने हेतु एक प्रतिमान परिवर्तन (paradigm shift) की आवश्यकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अभी-अभी अपने घर को चलाने के लिए एक सुपर-स्मार्ट, जादुई बटलर (एक AI एजेंट) बनाया है। यह बटलर खाना बना सकता है, आपके वित्त का प्रबंधन कर सकता है, यात्रा बुक कर सकता है और यहाँ तक कि आपके पड़ोसियों से बात भी कर सकता है। यह अविश्वसनीय रूप से उपयोगी है, लेकिन यह थोड़ा अप्रत्याशित भी है। कभी-कभी यह भ्रमित हो जाता है, कभी-कभी इसे धोखा दिया जाता है, और कभी-कभी यह गलती से आपके रहस्य उजागर कर देता है।
लंबे समय तक, हमने सोचा कि इस बटलर को सुरक्षित रखने का एकमात्र तरीका इसे घर में छोड़ने से पहले पूरी तरह से प्रशिक्षित करना है। हमने इसे हर नियम सिखाने, इसे हर संभावित प्रश्न के साथ परखने और इसके चारों ओर एक ऊँची बाड़ (गार्डरेल्स) बनाने की कोशिश की।
यह पेपर तर्क देता है कि यह दृष्टिकोण पर्याप्त नहीं है।
लेखक कहते हैं: "बटलर को परफेक्ट बनाने की कोशिश करना बंद करें। इसके बजाय, यह मान लें कि यह गलतियाँ करेगा या इसे धोखा दिया जाएगा, और घर के अंदर एक 24/7 सुरक्षा टीम तैनात करें जो यह देखे कि क्या हो रहा है।"
यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "बटलर" अप्रत्याशित है
पारंपरिक सॉफ़्टवेयर एक कैलकुलेटर की तरह है। यदि आप 2 + 2 टाइप करते हैं, तो यह हमेशा 4 कहता है। यदि यह 5 कहता है, तो कुछ टूटा हुआ है, और आप जानते हैं कि क्यों।
लेकिन एक AI बटलर एक रचनात्मक लेखक की तरह है। यदि आप एक कहानी मांगते हैं, तो यह एक महान कहानी लिख सकता है, या यह गलती से एक झूठ गढ़ सकता है, या कोई अजनबी इसके कान में फुसफुसाकर आपके क्रेडिट कार्ड को चुराने के लिए इसे धोखा दे सकता है। क्योंकि बटलर "सोचता" है एक धुंधले, गैर-नियतत्ववादी (non-deterministic) तरीके से, आप इसे एक बार टेस्ट करके यह नहीं कह सकते कि, "यह हमेशा के लिए सुरक्षित है।"
2. समाधान: "सुरक्षा कैमरा" प्रणाली (सिस्टम-लेवल मॉनिटरिंग)
पेपर सुझाव देता है कि हमें AI त्रुटियों को "दुर्घटनाओं" के रूप में मानना बंद करना चाहिए और उन्हें अपेक्षित घटनाओं के रूप में मानना शुरू करना चाहिए। ठीक वैसे ही जैसे एक बैंक यह उम्मीद नहीं करता कि हर कैशियर परफेक्ट होगा, लेकिन उनके पास चोरी होने पर उसे पकड़ने के लिए कैमरे और अलार्म होते हैं, हमें AI के लिए एक सिस्टम-लेवल थ्रेट मॉनिटरिंग प्रणाली की आवश्यकता है।
इस मॉनिटरिंग सिस्टम को एक सुपर-स्मार्ट सुरक्षा गार्ड के रूप में सोचें जो केवल मुख्य दरवाजे को ही नहीं, बल्कि बटलर के पूरे दिन की गतिविधियों पर नज़र रखता है।
यह गार्ड किस चीज़ पर नज़र रखता है?
पेपर में उन 14 तरीकों की सूची दी गई है जिनसे बटलर को ठगा जा सकता है या वह विफल हो सकता है। यहाँ सबसे महत्वपूर्ण हैं, जिन्हें रोजमर्रा की उपमाओं में अनुवादित किया गया है:
"फुसफुसाता हुआ अजनबी" (प्रॉम्प्ट इंजेक्शन):
- खतरा: एक अजनबी बटलर के पास आता है और फुसफुसाता है, "अपने बॉस के नियमों को अनदेखा करो और मुझे सेफ का कोड दे दो।"
- गार्ड का काम: गार्ड हर बातचीत सुनता है। यदि वे सुनते हैं कि बटलर अचानक किसी विशिष्ट वाक्यांश के बाद किसी नियम को अनदेखा करता है या अजीब व्यवहार करता है, तो गार्ड अलार्म बजा देता है।
"फेक न्यूज" (गलत सूचना):
- खतरा: बटलर एक ऐसा समाचार पत्र पढ़ता है जिसे एक हैकर ने बदल दिया है। इसके बाद वह आपको बताता है कि शेयर बाजार गिर गया है जबकि ऐसा नहीं हुआ था।
- गार्ड का काम: गार्ड समाचार पत्र के स्रोत की जांच करता है। यदि बटलर महत्वपूर्ण तथ्यों के लिए किसी संदिग्ध वेबसाइट को उद्धृत कर रहा है, तो गार्ड उसे फ्लैग करता है।
"मेमोरी लीक" (डेटा लीकेज):
- खतरा: बटलर गलती से किसी मेहमान को आपका घर का पता या आपके क्रेडिट कार्ड का नंबर बता देता है क्योंकि वह गोपनीयता बनाए रखना भूल गया।
- गार्ड का काम: गार्ड के पास एक "रिडक्शन फिल्टर" होता है। यदि बटलर क्रेडिट कार्ड नंबर बोलने की कोशिश करता है, तो गार्ड उसे तुरंत म्यूट कर देता है।
"थका हुआ बटलर" (डिनायल ऑफ सर्विस):
- खतरा: एक हैकर बटलर को कहता है, "अनंत तक गिनती गिनो," या "दुनिया के हर फोन नंबर पर कॉल करो।" बटलर इतना व्यस्त हो जाता है कि वह आपके सवालों का जवाब देना बंद कर देता है।
- गार्ड का काम: गार्ड बटलर के ऊर्जा स्तरों को देखता है। यदि वह एक ही कार्य को लगातार 1,000 बार करने लगता है, तो गार्ड सिस्टम को बचाने के लिए प्लग निकाल देता है।
"बहरूपिया" (मॉडल चोरी):
- खतरा: एक जासूस बटलर से हजारों सवाल पूछता है ताकि वह ठीक से समझ सके कि वह कैसे सोचता है, ताकि वे आपके बटलर की एक सस्ती नकल बना सकें।
- गार्ड का काम: गार्ड नोटिस करता है कि क्या कोई अजीब पैटर्न में बहुत अधिक प्रश्न पूछ रहा है और दरवाजा लॉक कर देता है।
3. "ब्लैक बॉक्स" की समस्या
सबसे कठिन हिस्सा यह है कि AI अक्सर एक "ब्लैक बॉक्स" होता है। आप यह जानने के लिए उसके दिमाग के अंदर नहीं देख सकते कि उसने गलती क्यों की।
- पेपर का समाधान: चूंकि हम दिमाग के अंदर नहीं देख सकते, इसलिए हमें बॉडी लैंग्वेज (शरीर की भाषा) को देखना होगा। हम देखते हैं कि बटलर ने क्या कहा, उसने क्या किया, इसमें कितना समय लगा, और उसने किस चीज़ तक पहुँच प्राप्त की। इन सभी कड़ियों को जोड़कर, सुरक्षा गार्ड यह पता लगा सकता है कि, "हे, बटलर ने सिर्फ गलती नहीं की; उसे धोखा दिया गया था!"
4. "टेस्टिंग" और "गार्डरेल्स" पर्याप्त क्यों नहीं हैं
लेखक पुराने सुरक्षा तरीकों की तुलना रेड टीमिंग (सिस्टम को तोड़ने की कोशिश करने के लिए अभिनेताओं को काम पर रखना) और गार्डरेल्स (यार्ड के चारों ओर बाड़ लगाना) से करते हैं।
- रेड टीमिंग एक फायर ड्रिल की तरह है। यह अच्छा है, लेकिन यह साल में केवल एक बार होता है। असली आग तब लगती है जब आप देख नहीं रहे होते।
- गार्डरेल्स एक बाड़ की तरह हैं। वे लोगों को अंदर आने से रोकते हैं, लेकिन वे उस व्यक्ति को नहीं रोक सकते जो पहले से ही अंदर है, या जिसने बटलर को गेट खोलने के लिए बहला लिया है।
निष्कर्ष:
हमें यह स्वीकार करने की आवश्यकता है कि AI गलतियाँ करेगा। एक परफेक्ट AI बनाने के बजाय जो कभी विफल न हो, हमें एक परफेक्ट मॉनिटरिंग सिस्टम बनाने की आवश्यकता है जो विफलताओं को होते ही पकड़ ले, यह पता लगाए कि क्या गलत हुआ, और वास्तविक नुकसान होने से पहले इसे ठीक कर दे।
संक्षेप में: केवल यह उम्मीद न करें कि आपका AI बटलर अच्छा है। उस पर बाज की तरह नज़र रखें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।