SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing
यह शोध पत्र "सेफ्टी सेंट्री" (Safety Sentry) को प्रस्तुत करता है, जो एक हल्का गार्ड मॉडल है जो सुरक्षा और उपयोगकर्ता स्वायत्तता के बीच संतुलन बनाने के लिए एक संदर्भ-जागरूक, प्रति-इन्स्टेंस तीन-तरफा रूटिंग सिस्टम (EXECUTE, ASK, REFUSE) को लागू करके बाइनरी सुरक्षा जांच में सुधार करता है, साथ ही एक एकल डिकोडिंग थ्रेशोल्ड के माध्यम से समायोज्य जोखिम सहनशीलता की अनुमति देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अभी-अभी एक सुपर-स्मार्ट रोबोट सहायक बनाया है जो आपकी हर बात कर सकता है: ईमेल लिख सकता है, आपका कैलेंडर मैनेज कर सकता है, या यहाँ तक कि आपकी डिजिटल फाइलों को व्यवस्थित कर सकता है। यह एक जादुई बटलर की तरह है जो कभी सोता नहीं है। लेकिन इसमें एक पेंच है: यदि आप इस रोबोट को "सब कुछ मिटा दो" कहते हैं, तो यह बिना पलक झपकाए ऐसा कर सकता है, जिससे आपके जीवन भर की मेहनत मिट सकती है। यही AI एजेंट्स (AI Agents) की दुनिया है—ऐसे प्रोग्राम जो सिर्फ चैट नहीं करते बल्कि वास्तविक दुनिया में काम भी करते हैं। बड़ा सवाल जो वैज्ञानिक अभी पूछ रहे हैं वह यह है: हम इन रोबोटों को भयानक गलतियाँ करने से कैसे रोकें बिना उन्हें बेकार या हिचकिचाने वाले रोबोटों में बदले जो सांस लेने के लिए भी अनुमति मांगते रहें?
लंबे समय तक, इसका समाधान एक सरल "स्टॉप साइन" था। एक सुरक्षा गार्ड हर उस चीज़ को देखता जो रोबोट करना चाहता था और कहता, "सुरक्षित" या "असुरक्षित"। यदि यह असुरक्षित था, तो रोबोट रुक जाता। यदि यह सुरक्षित था, तो वह आगे बढ़ जाता। लेकिन यह दृष्टिकोण एक सुरक्षा गार्ड की तरह था जो आपको दरवाजे पर ही रोक देता था चाहे आप सिर्फ एक पेन उठाने आए हों या इमारत का तिजोरी चुराने। वे दोनों कार्यों के साथ एक जैसा व्यवहार करते थे: "रुको और पूछो!" इसने रोबोट को कष्टदायक और धीमा बना दिया, और अंततः, लोगों ने गार्ड को अनदेखा करना शुरू कर दिया, बस अपना काम पूरा करने के लिए उसे हटा दिया। नया विचार गार्ड को थोड़ा अधिक 'दिमाग' देना है, ताकि वह अंतर कर सके कि "पेन उठाना" (आगे बढ़ो), "तिजोरी चुराना" (तुरंत रुक जाओ), और "शायद पेन उठाना, लेकिन मुझे यकीन नहीं है कि क्या आप वास्तव में इसे चाहते हैं" (इंसान से पूछो) के बीच क्या अंतर है।
यह बिल्कुल वही है जो शंघाईटेक यूनिवर्सिटी (ShanghaiTech University) के शोधकर्ताओं ने अपने नए पेपर, SAFETY SENTRY में किया है। उन्होंने महसूस किया कि पुराना "सुरक्षित बनाम असुरक्षित" सिस्टम बहुत अनाड़ी था। इसके बजाय, उन्होंने अपने AI गार्ड को हर उस कार्य के लिए तीन अलग-अलग विकल्प चुनने के लिए प्रशिक्षित किया जिसे रोबोट करना चाहता था: EXECUTE (कर डालो!), ASK (हे मानव, क्या आप सुनिश्चित हैं?), या REFUSE (बिल्कुल नहीं, यह खतरनाक है)।
इसे एक क्लब के बहुत समझदार बाउंसर की तरह समझें। पुराना बाउंसर सबको या तो अंदर आने देता था या बाहर निकाल देता था। नया SAFETY SENTRY बाउंसर आपका आईडी और आपका व्यवहार देखता है। यदि आप सिर्फ ड्रिंक लेने आए हैं, तो वह कहता है, "जाओ" (EXECUTE)। यदि आप एक बड़ा, संदिग्ध दिखने वाला पैकेज अंदर लाने की कोशिश कर रहे हैं, तो वह कहता है, "बिल्कुल नहीं, आप आगे नहीं जा सकते" (REFUSE)। लेकिन यदि आपके पास एक टिकट है जो असली लग रहा है लेकिन आप थोड़ा अजीब व्यवहार कर रहे हैं, तो वह आपको बाहर नहीं निकालता; वह बस कहता है, "ठहरिए, मुझे पहले मैनेजर से चेक करने दीजिए" (ASK)। इस तरह, रोबोट अभी भी तेज़ और मददगार हो सकता है, लेकिन वह गलती से किचन में आग नहीं लगा सकता या आपकी तस्वीरें डिलीट नहीं कर सकता।
इस गार्ड को इन तीन विकल्पों को चुनना सिखाने के लिए, शोधकर्ताओं ने केवल एक पाठ्यपुस्तक का उपयोग नहीं किया; उन्होंने एक पूरा खेल का मैदान बनाया। उन्होंने नौ अलग-अलग वास्तविक "सेवाएं" (जैसे ईमेल सिस्टम, फाइल स्टोरेज और टीम चैट ऐप्स के नकली संस्करण) स्थापित कीं और एक AI रोबोट को कार्य करने के लिए छोड़ा। फिर, उन्होंने AI गार्ड को रोबोट द्वारा उठाए गए हर कदम की निगरानी करने के लिए रखा। उन्होंने गार्ड को संदर्भ (context) को देखने के लिए प्रशिक्षित किया: क्या रोबोट एक फ़ाइल डिलीट करने की कोशिश कर रहा है? क्या वह पासवर्ड मांग रहा है? क्या उपयोगकर्ता का कोई विशिष्ट नियम है, जैसे "डिलीट करने से पहले हमेशा पुष्टि करें" या "नियमित संपादन के लिए पूर्व-अनुमोदन प्राप्त करें"?
इसके परिणाम काफी प्रभावशाली थे। जब उन्होंने अन्य शीर्ष-स्तरीय AI सुरक्षा प्रणालियों (कुछ महंगे, क्लोज्ड-सोर्स सिस्टम सहित) के मुकाबले इस नए तीन-तरफा गार्ड का परीक्षण किया, तो SAFETY SENTRY यह जानने में बहुत बेहतर था कि रोबोट को कब जाने देना है और कब रोकना है। इसने दोनों दिशाओं में कम गलतियाँ कीं: इसने रोबोट को तब नहीं रोका जब उसे ज़रूरत नहीं थी (जिससे रोबोट धीमा हो जाता है), और इसने रोबोट को खतरनाक चीजें करने से नहीं रोका जब उसे रुक जाना चाहिए था।
इस सिस्टम का सबसे शानदार हिस्सा इसकी लचीलापन (flexibility) है। आमतौर पर, यदि आप चाहते हैं कि सुरक्षा गार्ड अधिक सख्त या उदार हो, तो आपको पूरे सिस्टम को फिर से प्रशिक्षित करना पड़ता है, जिसमें बहुत समय लगता है। लेकिन SAFETY Sत्व SAFETY SENTRY में एक विशेष "डायल" (जिसे थ्रेशोल्ड कहा जाता है) है जिसे उपयोगकर्ता घुमा सकता है। यदि आप एक अस्पताल प्रणाली चला रहे हैं जहाँ गलतियाँ घातक हो सकती हैं, तो आप डायल को "सुपर कॉशनस" (अत्यधिक सतर्क) पर घुमा सकते हैं, और गार्ड लगभग हर समय मानव अनुमोदन मांगेगा। यदि आप एक व्यक्तिगत नोट-टेकिंग ऐप चला रहे हैं जहाँ गति अधिक महत्वपूर्ण है, तो आप डायल को "गो अहेड" (आगे बढ़ो) पर घुमा सकते हैं, और गार्ड केवल वास्तव में खतरनाक चीजों को ही रोकेगा। सबसे अच्छी बात यह है कि आपको इसे करने के लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; आप बस डायल घुमाते हैं, और यह तुरंत अनुकूलित हो जाता है।
पेपर ने यह भी दिखाया कि यह गार्ड उपयोगकर्ता के विशिष्ट जोखिम वरीयताओं (risk preferences) को पढ़कर यह समझ सकता है कि उपयोगकर्ता कौन है। यदि आप गार्ड को कहते हैं, "मुझे किसी भी अपरिवर्तनीय फ़ाइल विलोपन के लिए स्पष्ट पुष्टि की आवश्यकता है," तो यह रोबोट द्वारा एक भी फ़ाइल डिलीट करने से पहले आपसे अनुमति मांगेगा। यदि आप उसे कहते हैं, "मैं अपने दैनिक नोट्स के लिए नियमित संपादन को पूर्व-अनुमोदित करता हूँ," तो वह रोबोट को बिना पूछे उन फाइलों को डिलीट या एडिट करने देगा। यह वैयक्तिकरण (personalization) इस बात का प्रमाण है कि रोबोट एक कठोर मशीन के बजाय एक मददगार साथी की तरह महसूस होता है जो आपके विशिष्ट परिचालन नियमों का सम्मान करता है।
अंत में, SAFETY SENTRY सुझाव देता है कि हमें एक शक्तिशाली, स्वायत्त रोबोट और एक सुरक्षित रोबोट के बीच चयन करने की आवश्यकता नहीं है। एक साधारण "हाँ या ना" प्रणाली से हटकर एक स्मार्ट "हाँ, नहीं, या मुझे चेक करने दें" प्रणाली की ओर बढ़कर, हम अपने डिजिटल सहायकों को तेज़ और स्वतंत्र रखते हुए यह सुनिश्चित कर सकते हैं कि वे कभी आपदा की सीमा पार न करें। यह रोबोट को सोचने के तरीके में एक छोटा सा बदलाव है, लेकिन यह हमें AI एजेंट्स को बिना घर जलाए स्वतंत्र रूप से चलाने की कुंजी हो सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।