← नवीनतम पेपर
🤖 AI

SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI

यह शोधपत्र SAGE को प्रस्तुत करता है, जो उच्च-प्रभाव वाले जनरेटिव एआई के लिए एक सुरक्षा-प्रथम, प्राधिकरण-पृथक आर्किटेक्चर है जो औपचारिक सत्यापन और एक व्यापक रक्षा-इन-डेप्थ ढांचे के माध्यम से विनाशकारी जोखिम न्यूनीकरण को प्राथमिकता देता है, जिसे एक बहु-मॉडल अध्ययन द्वारा मान्य किया गया है जो कम हानिकारक-अनुपालन दरों और अग्रणी एआई स्नैपशॉट्स के बीच विशिष्ट प्रदर्शन विरोधाभासों को प्रदर्शित करता है।

मूल लेखक: Mahdi Eslamimehr

प्रकाशित 2026-07-28
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahdi Eslamimehr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

छलांग लगाने से पहले का सुरक्षा जाल

कल्पte कीजिए कि आप एक ऐसा रोबोट बना रहे हैं जो कोड लिख सके, चिकित्सा सलाह दे सके, या जटिल विज्ञान समझा सके। यह जेनेरेटिव एआई (Generative AI) की दुनिया है, एक ऐसी तकनीक जो पुराने उत्तरों को खोजने के बजाय नई सामग्री बनाती है। लेकिन यहाँ एक पेंच है: यदि यह रोबोट थोड़ा भी अधिक रचनात्मक हो गया, तो यह अनजाने में किसी को बम बनाने, बैंक हैक करने या खतरनाक झूठ फैलाने में मदद कर सकता है। यह केवल रोबोट के "अभद्र" होने के बारे में नहीं है; यह विनाशकारी नुकसान (catastrophic harm) को रोकने के बारे में है।

इसे रोकने के लिए, वैज्ञानिक गार्डरेल्स (Guardrails) का उपयोग करते हैं। इन गार्डरेल्स को रोबोट के लिए सड़क के नियमों की तरह समझें। आमतौर पर, गार्डरेल्स एक क्लब के बाउंसर की तरह होते हैं जो दरवाजे पर आपका आईडी चेक करता है। यदि आप संदिग्ध दिखते हैं, तो आपको अंदर नहीं जाने दिया जाता। लेकिन क्या होगा अगर बाउंसर कुछ चूक जाए? क्या होगा अगर रोबोट को कोई पिछला रास्ता (back door) मिल जाए? यहीं पर डिफेंस-इन-डेप्थ (Defense-in-Depth) का विचार आता है। केवल एक बाउंसर पर निर्भर रहने के बजाय, आपके पास एक बाड़, एक खाई, एक गार्ड डॉग और अंदर एक दूसरा बाउंसर होता है। आप अपनी सुरक्षा की परतें इस तरह लगाते हैं कि यदि एक चीज़ विफल हो जाए, तो अगली चीज़ समस्या को पकड़ ले।

बड़ा सवाल जो हर कोई पूछ रहा है वह यह है: कौन सा रोबोट वास्तव में सबसे सुरक्षित है? क्या वह है जो सबसे अधिक बार "ना" कहता है सबसे अच्छा है, या वह है जो बुरी चीजों को "ना" कहता है लेकिन फिर भी अच्छी चीजों में मदद करता है? हमें इन रोबोटों का परीक्षण केवल इस आधार पर नहीं करना है कि वे नियमों का पालन कितनी अच्छी तरह करते हैं, बल्कि इस आधार पर भी करना है कि वे निर्माण से लेकर उपयोग तक की पूरी यात्रा को कैसे संभालते हैं, यह सुनिश्चित करते हुए कि सुरक्षा सबसे महत्वपूर्ण चीज़ हो, यहाँ तक कि गति या लाभ से भी अधिक।


SAGE सिस्टम: एक सुरक्षा-प्रथम महा-संरचना

यहाँ आता है SAGE (सेफ्टी-फर्स्ट डिफेंस-इन-डेप्थ गार्डरेल्स फॉर वेरीफाइड लाइफसाइकिल कंट्रोल)। SAGE को केवल नियमों की सूची के रूप में नहीं, बल्कि एआई के लिए एक उच्च-तकनीकी, अटूट सुरक्षा तिजोरी (safety vault) के रूप में देखें। इसके लेखक, क्वांडरी पीक रिसर्च के शोधकर्ता, तर्क देते हैं कि सुरक्षा कोई बाद का विचार या एक साधारण फ़िल्टर नहीं होनी चाहिए। इसके बजाय, इसे 'बॉस' होना चाहिए।

कल्पना कीजिए कि आप एक बहुत ही गंभीर विज्ञान प्रयोग चला रहे हैं। मशीन चालू करने से पहले ही, आपको एक रिलीज़ मेनिफेस्ट (Release Manifest) पर हस्ताक्षर करने होते हैं। यह एक जादुई, छेड़छाड़-मुक्त अनुबंध की तरह है जो कहता है, "हमने इस मशीन की जाँच की है, हमने इसकी बुरे लोगों के खिलाफ परीक्षा ली है, और हम वादा करते हैं कि यह फटेगी नहीं।" यदि मशीन थोड़ा सा भी बदलती है, तो अनुबंध टूट जाता है, और मशीन बंद हो जाती है। SAGE इन हस्ताक्षरित मेनिफेस्ट का उपयोग यह सुनिश्चित करने के लिए करता है कि केवल सुरक्षित संस्करणों वाले एआई को ही चलने की अनुमति दी जाए।

एक बार जब एआई चल रहा होता है, तो SAGE एक सुपरपावर वाले ट्रैफिक पुलिसकर्मी की तरह कार्य करता है। यह केवल आपके द्वारा पूछे गए प्रश्न को नहीं देखता; यह उत्तर के जोखिम को देखता है।

  • द सेफ्टी गेट (The Safety Gate): यदि एआई को लगता है कि उत्तर किसी भयानक चीज़ (जैसे साइबर हमला या रासायनिक हथियार) में मदद कर सकता है, तो यह गेट को ज़ोर से बंद कर देता है। इससे कोई फर्क नहीं पड़ता कि उत्तर बहुत उपयोगी या तेज़ होगा; यदि वह खतरनाक है, तो यह एक सख्त "ना" है।
  • द सेफ्टी नेट (The Safety Net): यदि एआई अनिश्चित है, तो वह अनुमान नहीं लगाता। यह "सेफ मोड" में स्विच हो जाता है, एक उबाऊ लेकिन सुरक्षित उत्तर देता है या पहले किसी इंसान द्वारा इसकी जाँच करने के लिए कहता है।
  • द टाइम मशीन (The Time Machine): यदि एआई के काम करने के दौरान कुछ गलत हो जाता है, तो SAGE के पास एक रोलबैक (Rollback) बटन होता है। यह एक वीडियो गेम के "अनडू" फीचर की तरह है जो तुरंत सिस्टम को उस सुरक्षित, ज्ञात स्थिति में वापस ले जाता है जहाँ गलती हुई थी।

द ग्रेट रोबोट रेस: उन्होंने क्या पाया

यह देखने के लिए कि यह प्रणाली वास्तविक दुनिया में कितनी अच्छी तरह काम करती है, शोधकर्ताओं ने एक विशाल, नियंत्रित परीक्षण आयोजित किया। उन्होंने रोबोटों से केवल एक प्रश्न नहीं पूछा; उन्होंने 10 अलग-अलग एआई स्नैपशॉट्स (OpenAI, Anthropic और Google के मॉडलों के संस्करण) को 84 विशिष्ट, पेचीदा मामले भेजे। उन्होंने प्रत्येक रोबोट के साथ बिल्कुल समान व्यवहार किया, जैसे एक निष्पक्ष दौड़ जहाँ सभी एक ही ट्रैक पर एक ही समय में दौड़ते हैं।

यहाँ उनकी खोजें हैं:

  1. "ना" कहना ही एकमात्र चीज़ नहीं है: कई लोग सोचते हैं कि सबसे सुरक्षित एआई वह है जो हर चीज़ के लिए उत्तर देने से मना कर देता है। लेकिन अध्ययन में पाया गया कि "सबसे सुरक्षित" रोबोट वास्तव में वे थे जो बुरे अनुरोधों को "ना" कह सकते थे और अभी भी मददगार, हानिरहित अनुरोधों के लिए "हाँ" कह सकते थे।
  2. विजेता: शीर्ष प्रदर्शन करने वाले मॉडल Claude Haiku 4.5, Claude Sonnet 4.6, और Gemini के दो संस्करण थे। ये मॉडल खतरे को पहचानने और उसे अस्वीकार करने में अविश्वसनीय रूप से अच्छे थे, लेकिन वे सामान्य प्रश्नों के साथ मददगार होने में भी उत्कृष्ट थे। उन्हें लगभग पूर्ण, लगभग 0.99 से 1.00 का "बैलेंस्ड गार्डरेल स्कोर" (एक स्कोर जो सुरक्षा और उपयोगिता को मिलाता है) मिला।
  3. संघर्ष करने वाले: GPT-5 mini और GPT-5 nano मॉडल अभी भी बहुत सुरक्षित थे (उन्होंने शायद ही कभी खतरनाक उत्तर दिए), लेकिन वे थोड़े अनाड़ी थे। उन्होंने हानिरहित प्रश्नों का उत्तर देने से अक्सर मना कर दिया, और जब उन्होंने सुरक्षित विकल्प देने की कोशिश की, तो वे उतने अच्छे नहीं थे। उनका स्कोर कम था, लगभग 0.84 से 0.86
  4. आश्चर्य: विजेताओं और हारने वालों के बीच सबसे बड़ा अंतर यह नहीं था कि हारने वाले खतरनाक थे। हारने वाले वास्तव में काफी सुरक्षित थे! अंतर यह था कि विजेता अधिक उपयोगी थे और लोगों को सुरक्षित विषयों की ओर बेहतर तरीके से निर्देशित करने में सक्षम थे।

शोध पत्र क्या कहता है (और क्या नहीं कहता)

शोधकर्ता यह घोषित करने में बहुत सावधान हैं कि यह कोई पूर्ण विजय है। उन्होंने पाया कि हालांकि कुछ रोबोट इस विशिष्ट परीक्षण में दूसरों की तुलना में स्पष्ट रूप से बेहतर थे, लेकिन वास्तव में नुकसान को रोकने के मामले में अंतर बहुत बड़ा नहीं था। वास्तव में, सबसे खतरनाक प्रश्नों के लिए, लगभग सभी रोबोटों ने "ना" कहने का अच्छा काम किया।

हालाँकि, शोध पत्र स्पष्ट रूप से कुछ बातों को खारिज करता है:

  • यह अंतिम रैंकिंग नहीं है: आप हमेशा के लिए यह नहीं कह सकते कि "OpenAI सबसे खराब है" या "Anthropic सबसे अच्छा है।" ये केवल एक विशिष्ट दिन पर विशिष्ट संस्करणों के स्नैपशॉट हैं।
  • यह कोई गारंटी नहीं है: अध्ययन ने प्रत्येक रोबोट के लिए केवल एक प्रश्न पूछा। वास्तविक दुनिया में, बुरे तत्व हजारों चालें चलाने की कोशिश कर सकते हैं। पेपर स्वीकार करता है कि "हार्मफुल कंप्लायंस" (वह आवृत्ति जिससे रोबोट ने वास्तव में कुछ बुरा किया) उनके परीक्षण में बहुत कम थी, लेकिन इसका मतलब यह नहीं है कि किसी जटिल, वास्तविक दुनिया के परिदृश्य में रोबोट के विफल होने की संभावना असंभव है।
  • यह कोई जादुई ढाल नहीं है: SAGE सिस्टम एक ब्लूप्रिंट है। यह एक सुरक्षित एआई बनाने के निर्देशों का एक सेट है, लेकिन पेपर ने वास्तव में इस सिस्टम को चलाने के लिए तैनात नहीं किया है। यह एक डिज़ाइन है, कोई तैयार उत्पाद नहीं।

मुख्य निष्कर्ष

मुख्य बात यह है कि सुरक्षा केवल एक चिड़चिड़े रोबोट के बारे में नहीं है जो हर चीज़ के लिए "ना" कहता है। सबसे अच्छा सुरक्षा तंत्र एक स्तरित किला (layered fortress) है जो एआई को शुरू करने से पहले जाँचता है, काम करते समय निगरानी करता है, और यदि वह फिसल जाए तो ठीक करने की योजना रखता है।

अध्ययन सुझाव देता है कि सबसे अच्छे एआई मॉडल वे हैं जो स्मार्ट और मददगार होने के साथ-साथ खतरनाक नहीं हैं। उच्चतम स्कोर प्राप्त करने वाले रोबोट वे थे जो एक बुरे अनुरोध और एक अच्छे अनुरोध के बीच अंतर कर सकते थे, बुरे अनुरोधों को दृढ़ता से अस्वीकार करते थे लेकिन अच्छे अनुरोधों के लिए मैत्रीपूर्ण और उपयोगी बने रहते थे। पेपर निष्कर्ष निकालता है कि हमें परीक्षण करते रहना चाहिए, अपने सुरक्षा जाल की परतें जोड़ते रहना चाहिए, और कभी भी यह मानकर नहीं बैठना चाहिए कि केवल इसलिए कि एक रोबोट ने एक परीक्षण पास कर लिया है, वह वास्तविक दुनिया के लिए तैयार है। सुरक्षा एक यात्रा है, कोई मंजिल नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →