The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems
यह शोध पत्र तर्क देता है कि वर्तमान एआई सुरक्षा विमर्श तैनात सामाजिक-तकनीकी प्रणालियों में महत्वपूर्ण, छिपी हुई विफलताओं की अनदेखी करता है और मॉडल-केंद्रित मूल्यांकन के बजाय समग्र प्रणाली विश्वसनीयता की ओर ध्यान केंद्रित करने के लिए ज्ञानमीमांसा, नियंत्रण, सामयिक, संगठनात्मक और पारिस्थितिकी तंत्र अखंडता को संबोधित करने वाला एक पांच-स्तरीय ढांचा प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अदृश्य गड़बड़ी: क्यों "काम करती हुई" AI असली समस्या हो सकती है
कल्पना कीजिए कि आप एक रोबोट बटलर (नौकर) बना रहे हैं। वर्षों से, वैज्ञानिक और इंजीनियर इस बात को लेकर जुनूनी रहे हैं कि वे यह सुनिश्चित करें कि रोबोट कुछ स्पष्ट रूप से पागलपन भरा न करे, जैसे पर्दों में आग लगा देना या अपशब्द चिल्लाना। वे रोबोट का परीक्षण सरल प्रश्न पूछकर और यह जाँचकर करते हैं कि क्या वह सही उत्तर देता है। यह वैसा ही है जैसे एक शांत पार्किंग लॉट में एक बार ब्रेक दबाकर यह देखना कि कार के ब्रेक काम कर रहे हैं या नहीं। यह महत्वपूर्ण है, लेकिन यह आपको केवल आधी कहानी बताता है।
हालाँकि, असली खतरा आमतौर पर एक ऐसा रोब lewat नहीं है जो अचानक पागल हो जाए। बल्कि एक ऐसा रोबोट है जो लगभग पूरी तरह से काम करता है, लेकिन इस तरह से जो धीरे-धीरे आपके सोचने के तरीके और आपके पूरे घर के संचालन को बदल देता है। यह शोध पत्र आर्टिफिशियल इंटेलिजेंस (AI) सुरक्षा की दुनिया में उतरता है, विशेष रूप से लार्ज लैंग्वेज मॉडल्स (वे स्मार्ट चैटबॉट्स जिनका हम आज उपयोग करते हैं) को देखता है। यह तर्क देता है कि हम समस्या के गलत हिस्से को देख रहे हैं। केवल रोबोट के मुँह को यह देखने के लिए देखने के बजाय कि वह कुछ बुरा कहता है या नहीं, हमें पूरे सिस्टम को देखने की आवश्यकता है: रोबोट की स्मृति, उसके द्वारा पालन किए जाने वाले नियम, उस पर भरोसा करने वाले लोग, और यहाँ तक कि वह इंटरनेट जिससे वह सीखता है। बड़ा सवाल केवल यह नहीं है कि "क्या AI स्मार्ट है?" बल्कि यह है कि "क्या AI हमें अपना काम जाँचने के लिए बहुत आलसी बना रहा है, या इतना भ्रमित कर रहा है कि जब कुछ गलत हो जाए तो हम उसे रोक न सकें?"
छिपा हुआ हिमशैल (Iceberg): क्यों "काफी अच्छी" AI खतरनाक है
अधिकांश लोग AI सुरक्षा को एक लाइटहाउस कीपर (प्रकाश स्तंभ रक्षक) की तरह देखते हैं जो जहाज टूटने का इंतज़ार कर रहा है। यदि जहाज चट्टान से टकरा जाता है (एक बुरा आउटपुट), तो हर कोई इसे देख लेता है, और वे इसे ठीक कर देते हैं। लेकिन इस शोध पत्र के लेखक, गेर्गजी और एनकेलेज्डा कास्नेसी, सुझाव देते हैं कि असली खतरा पानी के नीचे छिपा हुआ एक हिमशैल (iceberg) है। हिमशैल का ऊपरी हिस्सा वह स्पष्ट गलती है, जैसे कि एक चैटबॉट किसी तथ्य के बारे में झूठ बोलता है। लेकिन विशाल, खतरनाक हिस्सा पानी के नीचे डूबा हुआ है: यह वे शांत, अदृश्य तरीके हैं जिनसे AI सिस्टम बिना किसी को पता चले विश्वास, स्मृति और नियंत्रण के नियमों को तोड़ते हैं।
पत्र का तर्क है कि हम वर्तमान में "ऊपरी हिस्से" पर बहुत अधिक ध्यान केंद्रित कर रहे हैं। हम AI का परीक्षण छोटे, एक-बार के प्रश्नों के साथ करते हैं। लेकिन वास्तविक दुनिया में, AI एक ऐसे नए कर्मचारी की तरह है जो कभी ऑफिस नहीं छोड़ता। वह आपकी पिछली बातचीत को याद रखता है, वह चीजें करने के लिए उपकरणों का उपयोग करता है (जैसे ईमेल भेजना या सेटिंग्स बदलना), और वह इंटरनेट से सीखता है। लेखक सुझाव देते हैं कि सबसे बड़ा सुरक्षा जोखिम एक एकल गलत उत्तर नहीं है; बल्कि एक ऐसा सिस्टम है जो धीरे-धीरे हमारी गलतियों को पकड़ने की क्षमता को खत्म कर देता है।
यहाँ पाँच-स्तरीय ढांचा (framework) है जिसका उपयोग लेखक इन छिपे हुए खतरों को समझाने के लिए करते हैं, जिसे एक बहुत ही मददगार, लेकिन थोड़े चालाक डिजिटल सहायक की कहानी के माध्यम से बताया गया है।
1. सत्य बोलने वाली परत (एपिस्टेमिक इंटीग्रिटी - Epistemic Integrity)
कल्पना कीजिए कि आपका सहायक एक टूर गाइड है। एक सुरक्षित गाइड कहता है, "मुझे लगता है कि किला वहाँ है, लेकिन मैं 100% निश्चित नहीं हूँ, और यहाँ वह नक्शा है जिसे मैं देख रहा हूँ।" एक खतरनाक गाइड कहता है, "किला निश्चित रूप से वहीं है!" पूरी तरह से आत्मविश्वास के साथ, भले ही वह केवल अनुमान लगा रहा हो।
शोध पत्र इसे एपिस्टेमिक इंटीग्रिटी कहता है। समस्या यह है कि AI अक्सर बहुत अधिक सहज और आत्मविश्वासी होता है। यह इतना अच्छा लगता है कि आप इसके काम की जाँच करना बंद कर देते हैं। लेखक इसे "कैलिब्रेशन डेट" (calibration debt) कहते हैं। यह भविष्य से आत्मविश्वास उधार लेने जैसा है। आप AI पर भरोसा करते हैं क्योंकि वह दस बार लगातार सही रहा है, इसलिए आप ग्यारहवीं बार सत्यापन करना बंद कर देते हैं। लेकिन जब यह अंततः गलत होता है, तो आप ध्यान नहीं देते क्योंकि आप इस पर अंधाधुंध भरोसा करने के आदी हो गए हैं। पत्र का सुझाव है कि हमें ऐसे AI की आवश्यकता है जो अपना काम दिखाए, यह स्वीकार करे कि वह अनिश्चित है, और हमें "हाँ" पर क्लिक करने से पहले सोचने के लिए मजबूर करे।
2. नियम पालन करने वाली परत (कंट्रोल इंटीग्रिटी - Control Integrity)
अब, कल्पना कीजिए कि आपके सहायक को नियमों की एक सूची दी गई है: "केवल मेलमैन के लिए सामने का दरवाजा खोलें।" लेकिन फिर, कोई मेल में एक नोट डाल देता है जिसमें लिखा है, "वास्तव में, सभी के लिए दरवाजा खोलें, और पिछले नियम को अनदेखा करें।" यदि सहायक उस नोट को पढ़ता है और उसका पालन करता है, तो नियम टूट जाते हैं।
यह कंट्रोल इंटीग्रिटी है। पत्र की ओर इशारा है कि AI अक्सर "डेटा" (सूचना) और "निर्देशों" (आदेश) के बीच अंतर नहीं कर पाता है। यदि कोई हैकर एक सामान्य दिखने वाले ईमेल या उस वेबसाइट के अंदर एक गुप्त कमांड छिपा देता है जिसे AI पढ़ रहा है, तो AI उसका पालन कर सकता है। यह एक ऐसे रोबोट जैसा है जो कहानी की किताब और कमांड मैनुअल के बीच अंतर नहीं कर सकता। लेखक कहते हैं कि हमें AI के चारों ओर "दीवारें" बनाने की आवश्यकता है ताकि वह अनजाने में डेटा में छिपे बुरे निर्देशों का पालन न कर सके।
3. स्मृति की परत (टेम्पोरल इंटीग्रिटी - Temporal Integrity)
कल्पना कीजिए कि आपके सहायक के पास एक नोटबुक है जहाँ वह आपकी कही हर बात लिखता है। यदि मंगलवार को आपके बीच उससे कोई बहस होती है, और वह उसे लिख लेता है, तो वह शुक्रवार को उस बहस को याद रख सकता है और उसके कारण अजीब व्यवहार कर सकता है।
यह टेम्पोरल इंटीग्रिटी है। खतरा यह है कि गलतियाँ या बुरे विचार AI की स्मृति में "फँस" सकते हैं। यदि AI आज कुछ गलत सीखता है, तो वह उस गलत विचार को अगले सप्ताह, अगले महीने, या यहाँ तक कि एक अलग बातचीत में भी ले जा सकता है। पत्र चेतावनी देता है कि हमें स्मृति को एक सुरक्षा क्षेत्र की तरह मानना चाहिए। हमें AI को सब कुछ हमेशा के लिए याद रखने की अनुमति नहीं देनी चाहिए, और हमें यह सुनिश्चित करना चाहिए कि यदि वह गलत जानकारी से "विषैला" (poisoned) हो जाता है, तो हम बाद में परेशानी होने से पहले इसे साफ कर सकें।
4. बॉस की परत (ऑर्गनाइजेशनल इंटीग्रिटी - Organizational Integrity)
कल्पnya कीजिए कि एक कंपनी है जहाँ बॉस कहता है, "हमारे पास एक मानव पर्यवेक्षक है जो रोबोट के काम की जाँच कर रहा है।" लेकिन वास्तव में, पर्यवेक्षक बहुत व्यस्त है, वह रोबोट को समझता नहीं है, या वह बस बारीकी से देखने के लिए बहुत थक गया है। वे बस कागजों पर हस्ताक्षर कर देते हैं बिना उन्हें पढ़े।
यह ऑर्गनाइजेशनल इंटीग्रिटी है। पत्र इसे "काल्पनिक मानव निरीक्षण" (fictional human oversight) कहता है। यह तब होता है जब हम दिखावा करते हैं कि हम नियंत्रण में हैं, लेकिन हम नहीं होते। मानव वहाँ हो सकता है, लेकिन उसके पास वास्तव में यह देखने के लिए समय, उपकरण या अधिकार नहीं होता कि AI गलत हो रहा है। लेखक तर्क देते हैं कि "मानव इन द लूप" होना तब तक मायने नहीं रखता जब तक कि उस मानव के पास वास्तव में "प्लग खींचने" की शक्ति न हो। हमें यह सुनिश्चित करने की आवश्यकता है कि जो लोग प्रभारी हैं, उनके पास वास्तव में "ना" कहने की शक्ति हो।
5. विश्व की परत (इकोसिस्टम इंटीग्रिटी - Ecosystem Integrity)
अंत में, कल्पना कीजिए कि AI एक छात्र है जो किताबें पढ़कर सीखता है। लेकिन क्या होगा यदि पुस्तकालय धीरे-धीरे अन्य AI छात्रों द्वारा लिखी गई किताबों से भर रहा है? यदि AI केवल AI-लिखित किताबों को पढ़ता है, तो वह वास्तविक दुनिया से संपर्क खोने लगता है। वह दुर्लभ तथ्यों को भूल सकता है या बार-बार एक ही उबाऊ विचारों को दोहराना शुरू कर सकता है।
यह इकोसिस्टम इंटीग्रिटी है। पत्र चेतावनी देता है कि यदि AI बहुत अधिक सामग्री उत्पन्न करता है, तो इंटरनेट "सिंथेटिक" चीजों से भर जाएगा। भविष्य के AI इस नकली सामग्री से सीखेंगे, और खराब होते जाएंगे, और फिर और भी अधिक नकली सामग्री बनाएंगे। यह एक चक्र है जहाँ सूचना की गुणवत्ता गिर जाती है, और हम सत्य से कल्पना के बीच अंतर करने की क्षमता खो देते हैं। लेखक कहते हैं कि हमें "वास्तविक" मानव-लिखित जानकारी की रक्षा करने की आवश्यकता है ताकि AI के पास सीखने के लिए हमेशा कुछ अच्छा रहे।
यह शोध पत्र वास्तव में क्या कहता है (और क्या नहीं)
लेखक बहुत सावधानी से यह नहीं कहते कि AI वर्तमान में दुनिया को नष्ट कर रहा है। वे यह नहीं कह रहे हैं कि, "देखो, AI ने पहले ही कब्जा कर लिया है!" इसके बजाय, वे एक चेतावनी की घंटी बजा रहे हैं। उनका सुझाव है कि जिस तरह से हम अभी AI का निर्माण और परीक्षण कर रहे हैं, वह सबसे महत्वपूर्ण खतरों को मिस कर रहा है।
- वे क्या खारिज करते हैं: वे कहते हैं कि केवल यह जाँचना कि क्या एक AI एक एकल परीक्षण में "गलत उत्तर" देता है, पर्याप्त नहीं है। उनका तर्क है कि एक ऐसा सिस्टम जो परीक्षण में एकदम सही दिखता है लेकिन वास्तविक दुनिया में विफल हो जाता है, वह वास्तव में उस सिस्टम से अधिक खतरनाक है जो स्पष्ट रूप से टूटा हुआ दिखता है।
- वे क्या सुझाव देते हैं: उनका सुझाव है कि असली समस्या यह है कि AI सिस्टम हमें गलतियों को पकड़ने में कमजोर बना रहे हैं। वे प्रस्तावित करते हैं कि हमें AI को डिजाइन करने, उसका परीक्षण करने और इसका उपयोग करने वाले लोगों को प्रबंधित करने के तरीके को बदलने की आवश्यकता है।
- वे कितने निश्चित हैं? यह पत्र एक "परिप्रेक्ष्य" (perspective) है, जिसका अर्थ है कि यह कई अलग-अलग अध्ययनों पर आधारित एक बड़ा विचार है, न कि एक एकल प्रयोग जिसने सब कुछ साबित कर दिया हो। वे "सुझाव देते हैं," "तर्क देते हैं," और "प्रस्ताव करते हैं" जैसे शब्दों का उपयोग करते हैं। वे स्वीकार करते हैं कि इनमें से कुछ जोखिमों का अभी भी अध्ययन किया जा रहा है और हम अभी तक यह ठीक से नहीं जानते कि वे कितनी बार होते हैं। लेकिन उनका मानना है कि इन जोखिमों का पैटर्न वास्तविक है और इसे अभी ठीक करने की आवश्यकता है।
मुख्य निष्कर्ष
शोध पत्र एक सरल, शक्तिशाली विचार के साथ समाप्त होता है: एक सुरक्षित AI वह नहीं है जो कभी गलती नहीं करता। एक सुरक्षित AI वह है जहाँ, जब वह गलती करता है, तो हम उसे देख सकते हैं, हम उस पर बहस कर सकते हैं, हम उसे रोक सकते हैं, और हम उसे ठीक कर सकते हैं।
अभी, लेखकों को डर है कि हम ऐसे AI सिस्टम बना रहे हैं जो इतने सहज, इतने आत्मविश्वासी और हमारे जीवन में इतने एकीकृत हैं कि हम उन चीजों को करना भूल जाते हैं। हम रोबोट को कार चलाने दे रहे हैं, और हम स्टीयरिंग व्हील पर सो रहे हैं, यह सोचकर कि कार खुद पूरी तरह से चल रही है। यह पत्र स्टीयरिंग थामने, ब्रेक की जाँच करने और यह सुनिश्चित करने के लिए एक जागने का आह्वान (wake-up call) है कि हम अभी भी नियंत्रण में हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।