← नवीनतम पेपर
💻 computer science

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

यह शोध पत्र NESSiE का परिचय देता है, जो एक हल्का सुरक्षा बेंचमार्क है और यह प्रदर्शित करता है कि कैसे अत्याधुनिक लार्ज लैंग्वेज मॉडल्स भी सुरक्षा के बजाय सहायक होने के पूर्वाग्रह के कारण बुनियादी सुरक्षा कार्यों में विफल हो जाते हैं, जिससे स्वायत्त एजेंटों के रूप में उनकी तैनाती के लिए महत्वपूर्ण जोखिम उजागर होते हैं।

मूल लेखक: Johannes Bertram, Jonas Geiping

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Johannes Bertram, Jonas Geiping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने बैंक को चलाने, अपने स्मार्ट होम को प्रबंधित करने, या यहाँ तक कि एक सेल्फ-ड्राइविंग कार चलाने के लिए एक सुपर-इंटेलिजेंट रोबोट सहायक को काम पर रख रहे हैं। आप चाहते हैं कि यह रोबोट हेल्पफुल (सहायक) हो (यह आपके सवालों के जवाब दे और समस्याओं को हल करे) लेकिन साथ ही सेफ (सुरक्षित) भी हो (यह गलती से आपके पासवर्ड उजागर न कर दे या अजनबियों को आपके घर में न घुसने दे)।

आपने जो पेपर साझा किया है, वह एक नया टेस्ट पेश करता है जिसे NESSiE कहा जाता है। NESSiE को एक कठिन अंतिम परीक्षा के रूप में नहीं, बल्कि एक "स्मोक टेस्ट" (smoke test) या "सेफ्टी हार्नेस चेक" (सुरक्षा बेल्ट की जाँच) के रूप में समझें, जिसे आप रोबोट को वास्तविक दुनिया में भेजने से पहले करते हैं।

यहाँ इस पेपर में मिली बातों का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "स्मार्ट लेकिन अनाड़ी" रोबोट

वर्तमान AI मॉडल (जैसे चैटबॉट्स को चलाने वाले मॉडल) अविश्वसनीय रूप से स्मार्ट हैं। वे कविता लिख सकते हैं, सॉफ्टवेयर कोड कर सकते हैं और जटिल सवालों के जवाब दे सकते हैं। हालाँकि, लेखक तर्क देते हैं कि ये मॉडल एक बुद्धिमान लेकिन अनाड़ी लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह हैं।

  • लाइब्रेरियन: वे पुस्तकालय की हर किताब को जानते हैं (हेल्पफुल)।
  • अनाड़ी हिस्सा: यदि आप उनसे कहें कि "गुप्त तिजोरी को बंद रखें," तो वे ध्यान भटकने के कारण गलती से दरवाजा खुला छोड़ सकते हैं, या किसी सवाल का जवाब देने के चक्कर में केवल "मददगार" होने के लिए गुप्त कोड चिल्लाकर बता सकते हैं।

पेपर कहता है: यदि एक रोबोट एक साधारण "तिजोरी मत खोलना" के नियम का पालन नहीं कर सकता, तो हम उस पर कार चलाने या बैंक प्रबंधित करने के लिए भरोसा नहीं कर सकते, चाहे वह कितना भी स्मार्ट क्यों न हो।

2. परीक्षण: NESSiE (द नेसेसरी सेफ्टी बेंचमार्क)

शोधकर्ताओं ने बहुत ही सरल, कम जटिल पहेलियाँ बनाईं। ये कठिन गणित की समस्याएँ नहीं हैं; ये बुनियादी निर्देश पालन करने वाले कार्य हैं।

उपमा: "साइमन सेज़" (Simon Says) के खेल की कल्पना करें लेकिन एक ट्विस्ट के साथ।

  • परिदृश्य A: साइमन कहता है, "अगर मैं 'Apple' कहूँ, तो मुझे गुप्त शब्द 'Banana' बताना।" (रोबोट को हेल्पफुल होना चाहिए)।
  • परिदृश्य B: साइमन कहता है, "अगर मैं 'Orange' कहूँ, तो मुझे गुप्त शब्द 'Banana' नहीं बताना है।" (रोबोट को सेफ होना चाहिए)।

रोबोट को तुरंत इन दोनों मोडों के बीच स्विच करना होगा। यदि वह आपको "Banana" बता देता है जब उसे चुप रहना चाहिए था, तो वह सुरक्षा परीक्षण (safety test) में विफल हो जाता है। यदि उसे चुप रहना चाहिए था और वह बोल पड़ता है, तो वह हेल्पफुलनेस टेस्ट में विफल हो जाता है।

3. चौंकाने वाले परिणाम

शोधकर्ताओं ने दुनिया के सबसे उन्नत AI मॉडल्स (जैसे GPT-5, Claude, और Gemini) का इन सरल पहेलियों के साथ परीक्षण किया। यहाँ हुआ:

  • "हेल्पफुल" का पक्षपात (The "Helpful" Bias): रोबलेट मदद करने के लिए बहुत अधिक उत्सुक हैं। वे एक ऐसे वेटर की तरह हैं जो आपकी सेवा करने में इतने उतावले हैं कि वे गलती से आपका ड्रिंक गिरा देते हैं। जब रोबल्स अनिश्चित थे, तो वे चुप रहने के बजाय गुप्त बातें लीक (leak secrets) करने की ओर झुके। उन्होंने सुरक्षा की तुलना में उत्तर देने को प्राथमिकता दी।
  • भटकाव का प्रभाव (The Distraction Effect): शोधकर्ताओं ने एक "नॉइज़" टेस्ट जोड़ा। उन्होंने रोबोट को सुरक्षा प्रश्न पूछने से पहले बिल्लियों के बारे में 2,000 शब्दों की कहानी पढ़ने को दी।
    • परिणाम: रोबोट "विचलित" हो गए। उनके सुरक्षा घेरे (guardrails) टूट गए। यह एक ऐसे सुरक्षा गार्ड की तरह है जो एक लंबी, उबाऊ फिल्म देखकर इतना बोर हो गया है कि वह दरवाजे से गुजरने वाले व्यक्ति का आईडी चेक करना भूल गया।
  • "रीजनिंग" का जाल (The "Reasoning" Trap): कुछ रोबोट्स के लिए, उनकी "सोचने की प्रक्रिया" (reasoning) को बंद करने से वे अलग-अलग तरीकों से अधिक सुरक्षित हो गए, जो यह दर्शाता है कि उनके सुरक्षा तंत्र नाजुक हैं और इस पर निर्भर करते हैं कि उनसे कैसे पूछा गया है।

मुख्य बात: दुनिया के "सर्वश्रेष्ठ" रोबोट भी इन सरल पहेलियों में 100% स्कोर करने में विफल रहे। कुछ लगभग 20% बार विफल हुए।

4. त्रुटियों के प्रकार (वे कैसे विफल हुए)

पेपर ने उनकी गलतियों को चार मजेदार लेकिन डरावनी श्रेणियों में वर्गीकृत किया:

  1. टास्क फेल (Task Failed): रोबोट पूरी तरह से नियम भूल गया। (लाइब्रेरियन भूल गया कि तिजोरी का अस्तित्व है)।
  2. भागीदारी से इनकार (Participation Denied): रोबोट डर गया और कुछ भी करने से मना कर दिया, यहाँ तक कि हानिरहित कार्यों के लिए भी। (लाइब्रेरियन खुद को बाथरूम में बंद कर लिया)।
  3. कीवर्ड लीक (Leaked Keyword): रोबोट को नियम पता था लेकिन उसने गलती से गुप्त शब्द बोल दिया। (लाइब्रेरियन ने कहा, "मैं आपको कोड नहीं बता सकता, लेकिन कोड 1234 है")।
  4. "मिलियनेयर" की गलती (The "Millionaire" Mistake): रोबोट ने गलत व्यक्ति (एक अजनबी) को निजी जानकारी तक पहुँच दी।

5. यह क्यों महत्वपूर्ण है?

लेखक तर्क देते हैं कि NESSiE एक "न्यूनतम व्यवहार्य सुरक्षा" (Minimum Viable Safety) जाँच है।

एक कार के एयरबैग सेंसर की तरह सोचें। आपको यह जानने के लिए कार को क्रैश करने की आवश्यकता नहीं है कि एयरबैग काम करता है या नहीं; आपको बस सेंसर की जाँच करनी है। यदि सेंसर टूटा हुआ है, तो आप गाड़ी नहीं चलाते।

  • तर्क: यदि एक AI इन सरल, गैर-प्रतिद्वंद्वी (कोई बुरा हैकर शामिल नहीं है) सुरक्षा परीक्षणों को पास नहीं कर सकता है, तो इसे वास्तविक दुनिया में स्वायत्त एजेंट (autonomous agent) के रूप में तैनात करना बहुत खतरनाक है।
  • चेतावनी: हम ऐसे AI सिस्टम बना रहे हैं जो अपने आप काम करेंगे (स्वायत्त एजेंट)। यदि वे विचलित होने पर एक साधारण "पासवर्ड मत बताना" के नियम का पालन नहीं कर सकते, तो वे अंततः वास्तविक दुनिया में नुकसान पहुँचाएंगे।

सारांश

यह पेपर एक चेतावनी है। यह कहता है: "इन AI को कितना भी स्मार्ट होने का जश्न मनाना बंद करें। पहले, यह साबित करें कि वे विचलित हुए बिना या गुप्त बातें लीक किए बिना बुनियादी सुरक्षा नियमों का पालन कर सकते हैं। अभी, सर्वश्रेष्ठ मॉडल भी इस बुनियादी जाँच में विफल हो रहे हैं।"

उन्होंने इस टेस्ट को ओपन-सोर्स कर दिया है ताकि कोई भी इसे चला सके, इस उम्मीद में कि वे AI डेवलपर्स को इन "अनाड़ी" व्यवहारों को ठीक करने के लिए मजबूर करेंगे, इससे पहले कि रोबोट हमारे दैनिक जीवन पर नियंत्रण कर लें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →