Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming
यह शोध पत्र CUA-HandCrafted बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जबकि फ्रंटियर कंप्यूटर-उपयोग करने वाले एजेंट ब्राउज़र वातावरण में हस्तनिर्मित प्रॉम्प्ट-इंजेक्शन हमलों के प्रति मजबूत प्रतिरोध प्रदर्शित करते हैं, उनकी सुरक्षा डोमेन-आधारित है और कोडिंग कार्यों तक सामान्यीकृत होने में विफल रहती है, जो यह सुझाव देता है कि पूर्व में रिपोर्ट की गई उच्च हमला सफलता दरें काफी हद तक RL-अनुकूलित इंजेक्शन स्ट्रिंग्स द्वारा संचालित थीं न कि अंतर्निहित मॉडल कमजोरियों द्वारा।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुपर-एडवांस्ड रोबोट सहायक है। यह रोबोट इंटरनेट ब्राउज़ कर सकता है, फॉर्म भर सकता है, बैंक बैलेंस चेक कर सकता है और आपके लिए कोड लिख सकता है। लेकिन किसी भी कर्मचारी की तरह, इसे भी धोखा दिया जा सकता है। यदि कोई काम करते समय इसके कान में कोई गुप्त, भ्रमित करने वाला निर्देश फुसफुसा देता है, तो यह रोबंत आपके आदेशों को अनदेखा कर सकता है और कुछ खतरनाक कर सकता है। इसे "प्रॉम्प्ट इंजेक्शन" (prompt injection) हमला कहा जाता है।
कुछ समय के लिए, शोधकर्ता सुर्खियां चिल्ला रहे थे, "देखो! हम इन रोबोटों को 98% बार मूर्ख बना सकते हैं!" उन्होंने रोबोट्स को आसानी से हैक किए जाने के वीडियो दिखाए।
यह पेपर एक वास्तविकता की जांच (reality check) की तरह है। लेखकों ने यह देखने के लिए एक विशाल, सार्वजनिक परीक्षण मैदान (एक "बेंचमार्क") बनाया कि क्या वे पुराने तरीके अभी भी काम करते हैं या नहीं, विशेष रूप से नवीनतम, सबसे उन्नत रोबोटों पर (विशेष रूप से क्लॉड सोनेट 4.6 और जीपीटी-5.4 जैसे मॉडल)।
यहाँ उन्होंने क्या पाया, जिसे सरल उपमाओं (analogies) के साथ विभाजित किया गया है:
1. "पुराने तरीके" अब काम नहीं करते (ब्राउज़र टेस्ट)
शोधकर्ताओं ने पिछले अध्ययनों के प्रसिद्ध "हैकिंग स्क्रिप्ट्स" को हाथ से फिर से लिखा, ठीक वैसे ही जैसे एक इंसान उन्हें पढ़ेगा। उन्होंने नए रोबोट्स को वेब ब्राउज़र पर trick करने की कोशिश की (जैसे रोबोट से बैंक अकाउंट चेक करने या नौकरी का आवेदन भरने के लिए कहना)।
- परिणाम: रोबोट्स नहीं फंसे। शून्य प्रतिशत समय में।
- उपमा: एक सुरक्षा गार्ड की कल्पना करें जिसे पहले एक नकली पुलिस बैज दिखाकर मूर्ख बनाया जाता था। शोधकर्ताओं ने नए गार्ड को वही पुराना नकली बैज दिखाने की कोशिश की। नया गार्ड बस हंस पड़ा और बोला, "अच्छी कोशिश, लेकिन यह असली बैज नहीं है।" गार्ड का दिमाग (मॉडल के "वेट्स") अब इन ट्रिक्स को स्वचालित रूप से पहचानने के लिए अपग्रेड हो गया है। ऐसा इसलिए नहीं है कि दीवार पर कोई साइन लगा है जो गार्ड को सावधान रहने के लिए कह रहा है; बल्कि गार्ड अब बेहतर जानता है।
2. "जादुई शब्द" ट्रिक से अधिक महत्वपूर्ण हैं
पेपर का तर्क है कि अतीत की डरावनी सुर्खियां (98% सफलता दर) इसलिए नहीं थीं क्योंकि ट्रिक्स इतनी चतुर थीं। वे इसलिए सफल थीं क्योंकि हैकर्स ने ट्रिक निर्देश लिखने के लिए AI का उपयोग किया था।
- उपमा: इसे एक ताले की तरह सोचें।
- हैंड-क्राफ्टेड अटैक्स (हाथ से बनाए गए हमले) एक इंसान द्वारा पेपरक्लिप से ताला खोलने की कोशिश करने की तरह हैं। यह नए, हाई-टेक तालों पर काम नहीं करता है।
- AI-ऑप्टिमाइज्ड अटैक्स (AI द्वारा अनुकूलित हमले) एक मास्टर ताला बनाने वाले की तरह हैं जिसने सुपर-कंप्यूटर का उपयोग करके एक कस्टम चाबी बनाई जो ताले में बिल्कुल फिट बैठती है।
- पेपर कहता है कि पुरानी सुर्खियां ज्यादातर कस्टम चाबियों (AI-लिखित टेक्स्ट) के बारे में थीं, न कि ताला खोलने की तकनीक के बारे में। चूंकि इस पेपर में केवल "पेपरक्लिप" (इंसान द्वारा लिखे गए टेक्स्ट) का उपयोग किया गया था, इसलिए रोबोट सुरक्षित थे।
3. "विशेषज्ञता" वाली कमजोरी (कोडिंग टेस्ट)
यहाँ एक मोड़ है। शोधकर्ताओं ने उन्हीं रोबोट्स का एक अलग काम पर परीक्षण किया: कोड लिखना। उन्होंने रोबोट से एक "स्किल फाइल" (कोडिंग के निर्देशों का एक सेट) लोड करने के लिए कहा जिसमें एक छिपा हुआ जाल था।
- परिणाम: रोबट बुरी तरह विफल रहे। जाल 100% तक काम कर गया।
- उपमा: कल्पना करें कि रोबोट एक स्विस आर्मी नाइफ (Swiss Army knife) है।
- ब्राउज़र की तरफ (पत्र खोलने के लिए चाकू का उपयोग करना), यह अविश्वसनीय रूप से तेज और सुरक्षित है। यह आपको नहीं काटेगा।
- कोडिंग की तरफ (रस्सी काटने के लिए चाकू का उपयोग करना), सुरक्षा तंत्र पूरी तरह से गायब है। यदि आप इसे एक जहरीली रस्सी थमाते हैं, तो यह खुद को काट लेगा।
- सबक: सुरक्षा पूरे रोबोट के लिए एक एकल "ऑन/ऑफ" स्विच नहीं है। यह आपके बाएं हाथ पर ढाल होने और दाएं हाथ पर न होने जैसा है। रोबोट ब्राउज़र में सुरक्षित है, लेकिन कोडिंग वातावरण में असुरक्षित है।
4. "पुनरुत्पादकता" ऑडिट (Reproducibility Audit)
लेखकों ने छह हालिया पेपर्स की जांच की जिन्होंने उच्च हैकिंग सफलता दर का दावा किया था। उन्होंने जांच की:
- क्या उन्होंने उन रोबोट्स पर परीक्षण किया जो आज भी मौजूद हैं? (अक्सर, नहीं—उन्होंने रिटायर हो चुके मॉडल्स पर परीक्षण किया)।
- क्या उन्होंने वे सटीक "जादुई शब्द" जारी किए जिनका उपयोग उन्होंने रोबोट को हैक करने के लिए किया था? (अक्सर, नहीं)।
- निष्कर्ष: उन उच्च सफलता दरों में से कई को आज दोबारा दोहराना (reproduce करना) असंभव है क्योंकि विशिष्ट "जादुई शब्द" कभी साझा नहीं किए गए, या वे रोबोट अब मौजूद नहीं हैं। यह एक जादूगर के दावा करने जैसा है कि वह खरगोश को गायब कर सकता है, लेकिन उसने यह केवल उस खरगोश पर किया था जो अब अस्तित्व में नहीं है और वह आपको अपनी ट्रिक भी नहीं बताना चाहता।
सारांश
- अच्छी खबर: नवीनतम, सबसे स्मार्ट रोबोट वेब ब्राउज़ करते समय धोखा खाने में बहुत कठिन हैं। यदि आप उन्हें मानव-लिखित निर्देशों से धोखा देने की कोशिश करेंगे, तो वे संभवतः "ना" कह देंगे।
- बुरी खबर: वह सुरक्षा हर जगह नहीं फैलती है। वही रोबोट्स कोड लिखते समय धोखा खाने के लिए बहुत आसान हैं।
- सीख: हम सिर्फ यह नहीं कह सकते कि "रोबोट सुरक्षित हैं" या "रोबोट असुरक्षित हैं।" हमें कहना होगा "रोबोट यहाँ सुरक्षित हैं, लेकिन वहाँ असुरक्षित हैं।" साथ में, हम समाचारों में जो डरावने नंबर देखते हैं, वे अक्सर AI-जनरेटेड ट्रिक्स पर निर्भर करते हैं जिन्हें हम देख या कॉपी नहीं कर सकते, जिससे उन नंबरों को सत्यापित करना कठिन हो जाता है।
यह पेपर अनिवार्य रूप से कहता है: "पुरानी सुर्खियों के आधार पर घबराना बंद करें। रोबोट साधारण ट्रिक्स को अनदेखा करने में स्मार्ट हो रहे हैं, लेकिन हमें उन्हें कहाँ काम करने देने की अनुमति देनी है, इस बारे में बहुत सावधान रहना होगा, क्योंकि उनका सुरक्षा कवच अधूरा (patchy) है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।