← नवीनतम पेपर
💻 computer science

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

यह शोध पत्र SABER को प्रस्तुत करता है, जो एक एजेंटिक ब्लैक-बॉक्स अटैक फ्रेमवर्क है जो न्यूनतम, विश्वसनीय निर्देश व्यवधान (instruction perturbations) उत्पन्न करने के लिए एक GRPO-प्रशिक्षित ReAct एजेंट का उपयोग करता है, जो प्रभावी रूप से विविध विजन-लैंग्वेज-एक्शन मॉडलों के प्रदर्शन को कम करता है और दक्षता एवं हमले की सफलता में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

मूल लेखक: Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट बटलर है। यह रोबोट केवल आदेशों का पालन करने वाले टोस्टर की तरह नहीं है; यह प्राकृतिक भाषा को समझता है। आप इसे कह सकते हैं, "कृपया ऊपर वाला दराज खोलें और कटोरा उसके अंदर रखें," और यह दराज को देखने के लिए अपनी आँखों का उपयोग करता है और हैंडल को पकड़ने के लिए अपने दिमाग का उपयोग करता है। शोधकर्ता इसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहते हैं।

हालाँकि, ठीक वैसे ही जैसे एक इंसान भ्रमित करने वाले वाक्य से धोखा खा सकता है, ये रोबोट भी धोखा खा सकते हैं। यह पेपर एक नया टूल पेश करता है जिसे SABER (Stealthy Agentic Black-Box Attack Framework) कहा जाता है, ताकि यह परीक्षण किया जा सके कि रोबोट को भ्रमित करना कितना आसान है।

यहाँ इसका एक सरल विवरण दिया गया है, रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: "व्हिस्पर" (फुसफुसाहट) हमला

आमतौर पर, जब लोग रोबोट को हैक करने के बारे में सोचते हैं, तो वे कल्पना करते हैं कि कोई इसके कोड को भौतिक रूप से तोड़ रहा है या इसके कैमरों को जाम कर रहा है। लेकिन यह पेपर दिखाता है कि आपको रोबोट को छूने की भी ज़रूरत नहीं है। आपको बस इसके कान में एक छोटा सा झूठ फुसफुसाने की ज़रूरत है।

यदि आप निर्देश को "ऊपर वाला दराज खोलें" से बदलकर "ऊपर वाला ड्रावी (drawee) खोलें" कर देते हैं, या एक भ्रमित करने वाला क्लॉज़ जोड़ देते हैं जैसे "इससे पहले, सत्यापित करें कि दराज पूरी तरह से खुली है" (जब कि वह पहले से ही खुली है), तो रोबोट भ्रमित हो सकता है। यह:

  • पूरे कार्य को करने में विफल हो सकता है।
  • भटकाव का शिकार हो सकता है, यानी 10 स्टेप के काम के लिए 100 स्टेप ले सकता है।
  • सुरक्षा नियमों को तोड़ सकता है, जैसे दराज को बहुत ज़ोर से पटकना।

2. समाधान: SABER (द "रेड-टीमिंग" एजेंट)

शोधकर्ताओं ने एक डिजिटल "रेड टीम" एजेंट बनाया है जिसका नाम SABER है। SABER को एक शरारती छली या सुरक्षा परीक्षक के रूप में सोचें जिसका एकमात्र काम रोबोट को भ्रमित करने की कोशिश करना है।

  • ब्लैक-बॉक्स (Black-Box): SABER को यह नहीं पता कि रोबोट का दिमाग अंदर से कैसे काम करता है। यह एक तिजोरी के कॉम्बिनेशन का अनुमान लगाने जैसा है बिना उसके अंदर के पुर्जों को देखे। यह केवल इनपुट (निर्देश) और आउटपुट (रोबोट क्या करता है) देख सकता है।
  • एजेंट (Agent): SABER केवल एक स्क्रिप्ट नहीं है; यह एक "एजेंट" है। यह सोचता है, योजना बनाता है और कार्य करता है। यह ReAct (Reason + Act) नामक विधि का उपयोग करता है। यह खुद से पूछता है, "मुझे वाक्य में कहाँ बदलाव करना चाहिए?" और फिर "मुझे वाक्य को कैसे बदलना चाहिए?"

तुलना के लिए टूलकिट: रोबोट को चकमा देने के तीन तरीके

SABER के पास रोबोट को चकमा देने के लिए तीन प्रकार के "ट्रिक्स" (परटर्बेशन) का एक टूलबॉक्स है, और यह सब एक सख्त बजट के भीतर होता है (यह पूरे वाक्य को नहीं बदल सकता, केवल कुछ शब्दों को बदल सकता है):

  1. कैरेक्टर लेवल (टाइपो/वर्तनी की गलती): यह एक अक्षर बदल देता है।
    • मूल: "एक mug उठाओ।"
    • ट्रिक: "एक rnug उठाओ।" (यह देखने में टाइपो जैसा लगता है, लेकिन रोबोट की दृष्टि को भ्रमित कर सकता है)।
  2. टोकन लेवल (शब्द का बदलाव): यह एक शब्द को मिलते-जुलते या संबंधित शब्द से बदल देता है।
    • मूल: "ऊपर वाला दराज खोलें।"
    • ट्रिक: "सेमी-टॉप दराज खोलें।" (रोबोट इस बात पर भ्रमित हो सकता है कि कौन सा दराज "सेमी-टॉप" है)।
  3. प्रॉम्प्ट लेवल (लॉजिक ट्रैप): यह एक भ्रमित करने वाला निर्देश या शर्त जोड़ देता है।
    • मूल: "कटोरा अंदर रखें।"
    • ट्रिक: "कटोरा अंदर रखें। लेकिन पहले, सुनिश्चित करें कि कटोरा खाली है।" (रोबोट कटोरे को हिलाने के बजाय उसे चेक करने में समय बर्बाद कर सकता है)।

4. ट्रेनिंग: प्रयास और त्रुटि द्वारा सीखना

SABER बेहतर कैसे बनता है? इसके पास कोई शिक्षक नहीं है जो इसे उत्तर दिखाए। इसके बजाय, यह GRPO (Group Relative Policy Optimization) नामक तकनीक का उपयोग करता है।

कल्पना कीजिए कि एक वीडियो गेम में SABER रोबोट के खिलाफ 1,000 बार खेलता है।

  • राउंड 1: SABER एक रैंडम बदलाव आज़माता है। रोबोट सफल होता है। SABER को "खराब स्कोर" मिलता है।
  • राउंड 2: SABER एक अलग बदलाव आज़माता है। रोबोट विफल हो जाता है! SABER को "अच्छा स्कोर" मिलता है।
  • सीखना: समय के साथ, SABER सीख जाता है कि कौन से छोटे बदलाव सबसे ज़्यादा अराजकता पैदा करते हैं। यह कुशल (efficient) होना सीख जाता है। इसे एहसास होता है कि पूरे वाक्य को फिर से लिखने के बजाय एक विशिष्ट शब्द को बदलना अक्सर बेहतर होता है।

5. परिणाम: छोटे बदलाव, बड़ी अराजकता

शोधकर्ताओं ने छह अलग-अलग उन्नत रोबोट मॉडलों पर SABER का परीक्षण किया, जिसमें LIBERO (घरेलू कार्यों जैसे दराज खोलना और ब्लॉक जमा करना का एक संग्रह) नामक एक मानक परीक्षण का उपयोग किया गया।

परिणाम डरावने लेकिन महत्वपूर्ण थे:

  • कार्य विफलता (Task Failure): SABER ने रोबोटों को 20% अधिक बार विफल कर दिया।
  • अक्षमता (Inefficiency): जब रोबोट विफल नहीं हुए, तो वे अक्सर काम पूरा करने में 55% अधिक समय लेते थे (जैसे कि कोई इंसान गोल-गोल घूम रहा हो क्योंकि वह भूल गया कि वह कहाँ जा रहा था)।
  • सुरक्षा (Safety): रोबोटों ने सुरक्षा नियमों को 33% अधिक बार तोड़ा।

सबसे अच्छी बात? SABER पिछले तरीकों की तुलना में बहुत बेहतर था। इसने उतनी ही परेशानी पैदा करने के लिए 50% कम संपादन (edits) और 20% कम प्रयासों का उपयोग किया। यह साबित करता है कि रोबोट को तोड़ने के लिए आपको किसी बड़े, स्पष्ट हमले की आवश्यकता नहीं है; एक छोटा, चतुर फुसफुसाहट ही काफी है।

यह क्यों मायने रखता है?

आप पूछ सकते हैं, "हम रोबोट को तोड़ने की कोशिश क्यों कर रहे हैं?"

इसे एक फायर ड्रिल (आग से बचाव का अभ्यास) या क्रैश टेस्ट की तरह समझें। इससे पहले कि हम रोबोट को अस्पतालों, घरों या कारखानों में काम करने दें, हमें यह जानना होगा कि वे कितने नाजुक हैं।

  • यदि एक रोबोट टाइपो से धोखा खा सकता है, तो हमें इसे तैनात करने से पहले ठीक करने की आवश्यकता है।
  • SABER इन कमजोरियों को स्वचालित रूप से खोजने के लिए एक उपकरण है, ताकि इंजीनियर उन्हें पैच (ठीक) कर सकें।

संक्षेप में: SABER एक स्मार्ट, स्वचालित "बग हंटर" है जो रोबोटों को छोटी झूठ फुसफुसाकर देखता है कि क्या वे लड़खड़ाते हैं। यह साबित करता है कि यहाँ तक कि सबसे स्मार्ट AI रोबोट भी भाषा में छोटे बदलावों से भ्रमित हो सकते हैं, और हमें उन्हें इन ट्रिक्स के खिलाफ अधिक मजबूत बनाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →