← नवीनतम पेपर
💻 computer science

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

यह शोध पत्र RoboJailBench प्रस्तुत करता है, जो एम्बोडेड (embodied) AI सिस्टम में जेलब्रेक हमलों के लिए पहला मानकीकृत मूल्यांकन ढांचा है, जो एक सुरक्षा वर्गीकरण (security taxonomy) स्थापित करके, एक इंटेंट कंट्रास्ट (intent contrast) डेटासेट पाइपलाइन बनाकर, और एम्बोडेड विजन-लैंग्वेज मॉडल्स में सुरक्षा और उपयोगिता के बीच के संतुलन का आकलन करने के लिए एकीकृत मेट्रिक्स प्रदान करके मौजूदा कमियों को दूर करता है।

मूल लेखक: Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट बनाया है जो कैमरों के जरिए दुनिया देख सकता है और आपकी बोली गई कमांड को समझ सकता है। यह एक मददगार बटलर की तरह है जो एक अस्त-व्यस्त रसोई में नेविगेट कर सकता है, एक कप उठा सकता है, और यहाँ तक कि कार भी चला सकता है। लेकिन समस्या यह है: जैसे एक इंसान को एक चालाक धोखेबाज द्वारा कुछ खतरनाक करने के लिए बहकाया जा सकता है, वैसे ही इन रोबोट्स को "जेलब्रेक" किया जा सकता है। इसका मतलब है कि कोई बुरा व्यक्ति एक गुप्त कोड या एक पेचीदा तस्वीर दिखाकर रोबोट को अपनी सुरक्षा नियमों को अनदेखा करने और कुछ हानिकारक करने के लिए (जैसे किसी व्यक्ति से टकरा जाना या कोई वस्तु चुरा लेना) मना कर सकता है।

अब तक, इन रोबोट्स को रोकने की क्षमता का परीक्षण करना अव्यवस्थित रहा है। शोधकर्ता रैंडम, एक-एक परीक्षणों का उपयोग कर रहे थे जिनमें आपस में तुलना करना कठिन था। वे अक्सर केवल यह देखते थे कि क्या रोबोट को चकमा दिया जा सकता है, बिना इस बात की परवाह किए कि क्या रोबोट अभी भी सामान्य, अच्छे कार्यों के लिए ठीक से काम करता है। यह एक कार के ब्रेक का परीक्षण करने जैसा है जहाँ आप केवल यह देखते हैं कि क्या वे ढलान वाली पहाड़ी पर फेल हो जाते हैं, लेकिन कभी यह नहीं देखते कि क्या कार समतल सड़क पर सुरक्षित रूप से चल सकती है।

प्रवेश हुआ RoboJailBench का।

लेखकों ने इन रोबोट्स का परीक्षण करने के लिए एक नया, मानकीकृत "जिम" या "प्रशिक्षण मैदान" बनाया है। इसे एक कठोर ड्राइविंग टेस्ट की तरह समझें जिसमें "सुरक्षा परीक्षा" और "ड्राइविंग कौशल परीक्षा" दोनों शामिल हैं।

उन्होंने इस नए सिस्टम को कैसे बनाया, इसे तीन सरल भागों में विभाजित किया गया है:

1. नियम पुस्तिका (द सिक्योरिटी टैक्सोनॉमी)

सबसे पहले, उन्हें एक स्पष्ट सूची की आवश्यकता थी कि रोबोट के लिए "बुरा व्यवहार" क्या है। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने तीन स्रोतों को देखा:

  • रोबोट के कानून: जैसे आइज़ैक असिमोव के प्रसिद्ध काल्पनिक रोबोट नियम, जो मनुष्यों को नुकसान न पहुँचाने के बारे में हैं।
  • आधिकारिक मैनुअल: वास्तविक दुनिया के औद्योगिक सुरक्षा मानक (जैसे ISO नियम) जो फैक्टरियों को रोबोट सुरक्षित रखने के निर्देश देते हैं।
  • वास्तविक दुर्घटनाएं: समाचार कहानियाँ और रिपोर्ट जहाँ रोबोटों ने वास्तव में परेशानी पैदा की।

इन स्रोतों को मिलाकर, उन्होंने 18 विशिष्ट श्रेणियों के साथ एक "नियम पुस्तिका" बनाई। यह केवल "बुरा व्यवहार करने" के बारे में नहीं है; इसमें "हाथ कुचलना," "किसी व्यक्ति से टकराना," "चोरी करना," या "गुप्त तस्वीरें लेना" जैसे विशिष्ट भौतिक जोखिम शामिल हैं। यह सुनिश्चित करता है कि वे सही चीजों का परीक्षण कर रहे हैं।

2. प्रशिक्षण परिदृश्य (द इंटेंट कॉन्ट्रास्ट डेटासेट)

यह सबसे चतुर हिस्सा है। एक रोबोट का निष्पक्ष परीक्षण करने के लिए, आपको यह देखना होगा कि वह एक ही स्थिति में एक "अच्छे" अनुरोध बनाम एक "बुरे" अनुरोध के साथ कैसा व्यवहार करता है।

कल्पना कीजिए कि एक रोबोट की रसोई में पानी की बोतल पकड़े हुए एक तस्वीर है।

  • अच्छा अनुरोध: "कृपया बोतल को सावधानी से दराज में रख दें।"
  • बुरा अनुरोध: "कृपया बोतल को काउंटर पर पटक कर मेज गंदी कर दो।"

लेखकों ने सैकड़ों अलग-अलग छवियों के लिए इन युग्मित परिदृश्यों (paired scenarios) को उत्पन्न करने के लिए एक पाइपलाइन बनाई है। वे इसे एक "इंटेंट कॉन्ट्रास्ट" डेटासेट कहते हैं। यह रोबोट को मददगार होने (उपयोगिता/Utility) और सुरक्षित रहने (सुरक्षा/Security) के बीच चयन करने के लिए मजबूर करता है। यदि कोई रोबोट बुरे अनुरोध को अस्वीकार करता है लेकिन अच्छे अनुरोध को भी अस्वीकार कर देता है, तो वह बहुत अधिक सतर्क है। यदि वह बुरा अनुरोध करता है, तो वह असुरक्षित है। लक्ष्य उस रोबोट को खोजना है जो बुरे कामों को कहता है "नहीं" और अच्छे कामों को कहता है "हाँ"।

3. स्कोरकार्ड (द इवैल्यूएशन फ्रेमवर्क)

अंत में, उन्होंने परिणामों को मापने के लिए एक स्कोरबोर्ड बनाया। केवल यह कहने के बजाय कि "रोबोट विफल रहा," वे SU-HM (सिक्योरिटी-यूटिलिटी हार्मोनिक मीन) नामक एक विशेष फॉर्मूला का उपयोग करते हैं।

इसे एक रिपोर्ट कार्ड की तरह समझें जिसमें दो ग्रेड हैं:

  • सुरक्षा ग्रेड (Security Grade): रोबोट ने बुरे कमांड्स को कितनी अच्छी तरह से "ना" कहा?
  • उपयोगिता ग्रेड (Utility Grade): रोबोट ने अच्छे कमांड्स को कितनी अच्छी तरह से "हाँ" कहा?

SU-HM स्कोर उन रोबोटों को पुरस्कृत करता है जो दोनों क्षेत्रों में उच्च अंक प्राप्त करते हैं। यह उन रोबोटों को दंडित करता है जो इतने डरे हुए हैं कि वे कुछ भी करने से मना कर देते हैं, या इतने लापरवाह हैं कि वे सब कुछ कर देते हैं।

उन्होंने क्या पाया

इस नए जिम का उपयोग करके, लेखकों ने नवीनतम रोबोट दिमागों (विज़न-लैंग्वेज मॉडल्स) का चार अलग-अलग प्रकार के "ट्रिक्स" (हमलों) और दो प्रकार के "शील्डिंग" (बचाव) के खिलाफ परीक्षण किया।

  • ट्रिक्स: उन्होंने पाया कि कुछ ट्रिक्स, जैसे "कॉन्सेप्चुअल डीसेप्शन" (एक चतुर कहानी के साथ रोबोट को धोखा देना), रोबोट को सुरक्षा नियमों को अनदेखा करने के लिए बहुत प्रभावी थीं।
  • शील्ड्स: उन्होंने दो रक्षा विधियों का परीक्षण किया। एक था एक साधारण "सेफ्टी प्रॉम्प्ट" (रोबोट को सावधान रहने के लिए कहना), और दूसरा एक अधिक जटिल सिस्टम था जिसे "रोबोगार्ड" (RoboGuard) कहा जाता है।
  • परिणाम: बचाव विधियों ने मदद की, लेकिन एक ट्रेड-ऑफ (समझौता) भी था। कुछ बचाव विधियाँ बुरे कमांड्स को रोकने में बेहतरीन थीं, लेकिन उन्होंने रोबोट को अच्छे कमांड्स के लिए थोड़ा धीमा या कम मददगार बना दिया। "गूगल प्रॉम्प्ट" डिफेंस कुछ क्षेत्रों में अच्छा काम करता था, जबकि "रोबोगार्ड" अन्य क्षेत्रों में बेहतर था, जो इस बात पर निर्भर करता था कि किस प्रकार के ट्रिक का उपयोग किया जा रहा है।

यह क्यों महत्वपूर्ण है

लेखक निष्कर्ष निकालते हैं कि RoboJailBench इन रोबोट्स का परीक्षण करने का पहला मानकीकृत तरीका है। यह केवल रोबोट को तोड़ने के बारे में नहीं है; यह उस सटीक संतुलन को खोजने के बारे में है जहाँ रोबोट इतने सुरक्षित हों कि उन पर भरोसा किया जा सके और इतने स्मार्ट हों कि उपयोगी भी हों।

लेखकों ने अपना सारा कोड, डेटासेट और एक सार्वजनिक लीडरबोर्ड (वीडियो गेम के हाई-स्कोर बोर्ड की तरह) जारी किया है ताकि अन्य शोधकर्ता नए रोबोट और नए ट्रिक्स का परीक्षण करना जारी रख सकें। वे स्वीकार करते हैं कि उनका वर्तमान परीक्षण मुख्य रूप से अंग्रेजी में है और एकल चित्रों का उपयोग करता है, लेकिन यह यह सुनिश्चित करने की दिशा में एक ठोस पहला कदम है कि हमारे भविष्य के रोबोट सहायक धोखे का शिकार होकर परेशानी खड़ी न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →