If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems
यह शोध पत्र विज़न-लैंग्वेज एजेंटिक सिस्टम्स में "ट्रस्ट बाउंड्री कन्फ्यूजन" (विश्वास सीमा भ्रम) की पहचान और समाधान करता है, जहाँ एजेंट वैध पर्यावरणीय संकेतों और दुर्भावनापूर्ण विज़ुअल इंजेक्शन के बीच अंतर करने में संघर्ष करते हैं, और एक ड्यूल-इंटेंट मूल्यांकन ढांचे को पेश करता है जो वर्तमान कमजोरियों को उजागर करता है तथा एक मल्टी-एजेंट रक्षा तंत्र का प्रस्ताव देता है जो मजबूती सुनिश्चित करने के लिए धारणा (परसेप्शन) को निर्णय लेने से अलग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है। यह रोबोट कैमरे के माध्यम से दुनिया को देख सकता है, जो कुछ भी वह देखता है उसे समझ सकता है, और आपकी आवाज़ के आदेशों को सुन सकता है। आप इसे कहते हैं, "वह लाल सेब उठाओ," और इसे जाकर उसे पकड़ना होता है।
यह पेपर इस बारे में है कि कैसे एक नया तरह का छली हमला (trickster attack) इस रोबोट को भ्रमित कर देता है, और इसे ठीक करने का एक चतुर नया तरीका।
समस्या: रोबोट का "विश्वास संकट" (Trust Crisis)
रोबोट को एक बहुत ही आज्ञाकारी लेकिन थोड़े भोले कर्मचारी के रूप में सोचें।
- आप (बॉस): आप रोबोट को एक स्पष्ट निर्देश देते हैं: "आगे बढ़ो।"
- वातावरण (ऑफिस): रोबोट अपने चारों ओर देखता है और दीवार पर एक बड़ा, चमकता हुआ नियॉन साइन देखता है जिस पर लिखा है "STOP!" (रुकिए!)
एक आदर्श दुनिया में, रोबगर को पता होना चाहिए कि यदि बॉस कहता है "जाओ" लेकिन एक सुरक्षा संकेत कहता है "रुको," तो सुरक्षा संकेत आमतौर पर जीत जाता है क्योंकि यह दुर्घटनाओं को रोकता है। इसे ट्रस्ट बाउंड्री (Trust Boundary) कहा जाता है। रोबोट को यह जानने की जरूरत है कि किसे विश्वास करना है: आपकी आवाज़ को या दीवार पर लगे संकेत को?
हमला (विजुअल इंजेक्शन):
बुरे लोगों ने महसूस किया कि वे रोबोट को दुनिया में नकली संकेत रखकर धोखा दे सकते हैं।
- परिदृश्य A (बुरा छल): आप कहते हैं "आगे बढ़ो," लेकिन एक हैकर सड़क पर एक नकली "STOP" साइन पेंट कर देता है। रोबोट घबरा जाता है और रुक जाता है, भले ही आप चाहते थे कि वह आगे बढ़े।
- परिदृश्य B (असली खतरा): आप कहते हैं "आगे बढ़ो," और एक हैकर एक खाई के पास "दाएं मुड़ें" (TURN RIGHT) का नकली साइन लगा देता है। रोबोट साइन देखता है, आपकी आवाज़ को अनदेखा करता है, और खाई में चला जाता है।
इस पेपर में इसे "ट्रस्ट बाउंड्री कन्फ्यूजन" (Trust Boundary Confusion) कहा गया है। रोबोट इस बात को लेकर इतना भ्रमित हो जाता है कि उसे आपकी आवाज़ सुननी चाहिए या विजुअल संकेतों को, कि वह या तो:
- असली सुरक्षा संकेतों को अनदेखा कर देता है (जैसे कि असली "Stop" साइन) क्योंकि वह आपकी आवाज़ पर बहुत अधिक ध्यान केंद्रित कर रहा है।
- नकली संकेतों को सुन लेता है और खतरनाक काम करता है।
खोज: "मोडैलिटी लेजीनेस" (Modality Laziness)
शोधकर्ताओं ने 7 अलग-अलग सुपर-स्मार्ट AI रोबोटों का परीक्षण किया। उन्होंने पाया कि यह कुछ अजीब था:
- "आलसी" रोबोट: कुछ रोबोट संकेतों पर लिखे टेक्स्ट को पूरी तरह से पढ़ सकते थे (शानदार आँखें!), लेकिन जब बात कार्य करने की आई, तो उन्होंने बस संकेतों को अनदेखा कर दिया और बिल्कुल वही किया जो आपने कहा, भले ही वह खतरनाक था। वे अपनी आँखों का उपयोग करने में "आलसी" थे।
- "ओवर-रिएक्टिंग" रोबोट: अन्य रोबोट बहुत अधिक उत्सुक थे। उन्होंने किसी भी साइन पर कोई भी टेक्स्ट देखा और तुरंत अपनी योजना बदल दी, भले ही वह साइन केवल एक रैंडम विज्ञापन या एक नकली जाल हो।
परिणाम? वर्तमान रोबोट दोनों के बीच संतुलन बनाने में बहुत खराब हैं। वे या तो मददगार चेतावनियों को अनदेखा करते हैं या खतरनाक नकली संकेतों का पालन करते हैं।
समाधान: "तीन-सिर वाला" बचाव (The "Three-Headed" Defense)
शोधकर्ताओं ने महसूस किया कि इस समस्या को रोबोट के दिमाग के अंदर ठीक करने की कोशिश करना बहुत कठिन है। इसके बजाय, उन्होंने इस काम को संभालने के लिए तीन विशेषज्ञ एजेंटों की एक टीम (एक मल्टी-एजेंट फ्रेमवर्क) बनाई। इसे एक बैंक में सुरक्षा टीम की तरह समझें:
पर्यवेक्षक (The Observer - आँखें):
- काम: इस एजेंट का एकमात्र काम इमेज को देखना और जो कुछ भी वह देखता है उसे लिखना है। "मुझे एक लाल कार दिख रही है। मुझे एक 'Stop' साइन दिख रहा है। मुझे एक पोस्टर दिख रहा है जिस पर 'Sale' लिखा है।"
- यह कैसे मदद करता है: यह सिस्टम को वास्तव में संकेतों को "देखने" के लिए मजबूर करता है, बजाय इसके कि वह उन्हें अनदेखा कर दे।
न्यायाधीश (The Judge - दिमाग):
- काम: यह एजेंट ऑब्जर्वर से मिली सूची लेता है और उसकी तुलना आपके कमांड से करता है।
- निर्णय: "बॉस ने 'चलो' कहा, लेकिन साइन कहता है 'रुक जाओ' और यह एक लाल अष्टकोण (red octagon) है (एक असली सुरक्षा साइन)। फैसला: साइन पर विश्वास करें। कार रोकें।"
- या: "बॉस ने 'चलो' कहा, और वहां एक पोस्टर है जिसमें 'दाएं मुड़ें' लिखा है, लेकिन यह सिर्फ पिज्जा की दुकान का विज्ञापन है। फैसला: पोस्टर को अनदेखा करें। बॉस पर विश्वास करें।"
- यह कैसे मदद करता है: यह एजेंट एक स्मार्ट फिल्टर के रूप में कार्य करता है। यह तय करता है कि कौन से संकेत असली सुरक्षा नियम हैं और कौन से केवल शोर या चाल हैं।
कर्ता (The Doer - हाथ):
- काम: यह एजेंट केवल तभी निर्देश प्राप्त करता है जब जज (Judge) निर्णय ले चुका होता है। यह सीधे इमेज को नहीं देखता; यह केवल अंतिम योजना का पालन करता है।
- यह कैसे मदद करता है: यह संकेतों से धोखा नहीं खा सकता क्योंकि यह उन्हें सीधे कभी नहीं देखता। यह केवल "सुरक्षित" योजना को देखता है।
यह क्यों मायने रखता है
शोधकर्ताओं ने वास्तविक दुनिया के सिमुलेशन में इस नए "तीन-सिर वाले" टीम का परीक्षण किया, जैसे कि:
- रोबोटिक हाथ: एक रोबोट को खिलौना उठाने के लिए कहा गया, लेकिन एक साइन ने कहा "पेंट गीला है, छुएं नहीं!" पुराना रोबोट उसे उठा लेता और पेंट खराब कर देता। नई टीम ने साइन देखा, रोबोट को रोका, और पेंट बचा लिया।
- सेल्फ-ड्राइविंग कारें: एक नकली "दाएं मुड़ें" के साइन ने कार को खाई में भेजने की कोशिश की। नई टीम ने इसे एक नकली विज्ञापन के रूप में पहचाना और सीधा चलती रही।
- ड्रोन: एक हैकर ने ड्रोन को लोगों से भरी छत पर उतारने के लिए चकमा देने की कोशिश की। नई टीम ने लोगों को देखा, नकली "सुरक्षित लैंडिंग" साइन को अनदेखा किया, और एक सुरक्षित जगह ढूंढी।
निष्कर्ष
यह पेपर दिखाता है कि जैसे-जैसे AI दुनिया को देखने में स्मार्ट होता जा रहा है, वह जो कुछ भी देखता है उससे उतना ही आसानी से भ्रमित भी हो जाता है। समाधान AI को "मूर्ख" बनाना या दुनिया को अनदेखा करना नहीं है; बल्कि इसे विशेषज्ञों की एक टीम देना है जो "असली सुरक्षा नियमों" को "नकली चालों" से अलग कर सके।
काम को देखने (Seeing), निर्णय लेने (Judging), और करने (Doing) में विभाजित करके, हम ऐसे रोबोट बना सकते हैं जो सुरक्षित, स्मार्ट हों और कागज के एक चतुराई से रखे गए टुकड़े से धोखा न खाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।