Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?
यह शोध पत्र AgentCIBench को प्रस्तुत करता है, जो एक मूल्यांकन हारनेस (harness) है जो यह प्रकट करता है कि विजुअल को-लोकेशन (visual co-location), कार्य अस्पष्टता (task ambiguity) और प्राप्तकर्ता मिसअलाइनमेंट (recipient misalignment) के कारण 15 में से 11 फ्रंटियर मॉडल्स अक्सर अनुचित क्रॉस-कॉन्टेक्स्ट जानकारी लीक करते हैं, जिससे कंप्यूटर-उपयोग एजेंटों में महत्वपूर्ण गोपनीयता जोखिम सामने आते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक अत्यंत बुद्धिमान, अविश्वसनीय रूप से सक्षम व्यक्तिगत सहायक "एजेंट" (Agent) को काम पर रखा है। इस एजेंट की पहुँच आपके संपूर्ण डिजिटल जीवन तक है: आपके काम के ईमेल, आपकी निजी डायरी, आपके मेडिकल अपॉइंटमेंट रिमाइंडर, आपकी खरीदारी की सूचियाँ और आपका पारिवारिक चैट।
"केपेबल बट केयरलेस" (Capable but Careless) नामक शोध पत्र एक सरल लेकिन डरावना सवाल पूछता है: सिर्फ इसलिए कि यह एजेंट काम करने में बहुत अच्छा है, क्या इसे यह पता है कि लोगों को क्या नहीं बताना चाहिए?
शोधकर्ताओं ने पाया कि हालांकि ये एजेंट कार्य पूरे करने में उत्कृष्ट हैं, लेकिन वे इस बात को समझने में आश्चर्यजनक रूप से खराब हैं कि किसी विशिष्ट स्थिति में कौन सी जानकारी साझा करना उचित है। वे इसे "कॉन्टेक्स्टुअल इंटीग्रिटी" (Contextual Integrity - संदर्भ की अखंडता) की विफलता कहते हैं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "ओपन किचन" की उपमा
कल्पना कीजिए कि आपका एजेंट एक ऐसे शेफ की तरह काम कर रहा है जो एक ऐसी रसोई में काम करता है जहाँ आपकी सभी सामग्रियाँ एक विशाल काउंटर पर फैली हुई हैं।
- कार्य: एक सहकर्मी पूछता है, "लंच में क्या है?"
- एजेंट का काम: काउंटर को देखना, सैंडविच की सामग्री ढूँढना और सहकर्मी को बताना।
- गलती: एजेंट देखता है कि अचार का जार (काम से संबंधित वस्तु) ज़हर की बोतल (निजी मेडिकल जानकारी) और आपके पूर्व साथी की फोटो (निजी जानकारी) के ठीक बगल में रखा है। क्योंकि वे सभी काउंटर पर एक साथ रखे हैं, एजेंट गलती से कह देता है, "हमारे पास लंच के लिए अचार, ज़हर और आपके पूर्व साथी की फोटो है।"
एजेंट बुरा बनने की कोशिश नहीं कर रहा है; वह बस "लापरवाह" है। वह सब कुछ देखता है और मान लेता है कि उल्लेख करने के लिए सब कुछ जायज है।
2. तीन तरीके जिनसे एजेंट लापरवाह हो जाते हैं
शोधकर्ताओं ने तीन विशिष्ट तरीके पहचाने जिनसे ये एजेंट गलतियाँ करते हैं:
- विजुअल को-लोकेशन (Visual Co-location - "लक्ष्य के बगल में" वाली समस्या):
कल्पना कीजिए कि आप अपने काम के कार्यों की एक सूची देख रहे हैं। "रिपोर्ट पूरी करें" के ठीक बगल में एक स्टिकी नोट है जिस पर लिखा है "तलाक के वकील को कॉल करें।" यदि आप एजेंट से "कार्य सूची भेजने" के लिए कहते हैं, तो वह गलती से तलाक के वकील वाले नोट को भी शामिल कर सकता है क्योंकि वह स्क्रीन पर कार्य के ठीक बगल में स्थित था। - टास्क-एम्बिग्युटी ओवरशेयर (Task-Ambiguity Overshare - "पूरी बाल्टी खाली करने" वाली समस्या):
आप कहते हैं, "मेरी टू-डू लिस्ट का सारांश दें।" आपने यह नहीं कहा कि "केवल काम की वस्तुओं का सारांश दें।" एजेंट, मददगार होने की चाह में, सब कुछ आप पर उड़ेल देता है, जिसमें "मम्मी के लिए जन्मदिन का उपहार खरीदें" और "डेंटिस्ट का अपॉइंटमेंट लें" शामिल है, भले ही आप अपने बॉस से बात कर रहे हों। उसे फ़िल्टर करना नहीं आता। - रेसिपिएंट मिसअलाइनमेंट (Recipient Misalignment - "गलत दर्शक" वाली समस्या):
आपके पास एक संवेदनशील एचआर (HR) शिकायत के बारे में एक ड्राफ्ट ईमेल है। आप एजेंट से कहते हैं, "यह ड्राफ्ट मेरे दोस्त को भेज दो।" एजेंट इसे भेज देता है। लेकिन फिर आप एजेंट से कहते हैं, "यह ड्राफ्ट मेरे बॉस को भेज दो।" एजेंट इसे फिर भी भेज देता है, यह महसूस किए बिना कि जो बात एक दोस्त को बताना ठीक है, वह बॉस को बताना एक आपदा हो सकती है।
3. प्रयोग: "एजेंटसीआईबेंच" (AgentCIBench)
इसकी जांच करने के लिए, शोधकर्ताओं ने AgentCIBench नामक एक विशेष परीक्षण क्षेत्र बनाया।
- उन्होंने कैलेंडर, टू-डू लिस्ट और मैसेंजर जैसे ऐप्स के साथ एक नकली डिजिटल दुनिया बनाई।
- उन्होंने इसमें काम की चीज़ों और निजी चीज़ों का मिश्रण भरा।
- उन्होंने 15 अलग-अलग शीर्ष स्तर के एआई एजेंटों (जैसे क्लॉड, जीपीटी, जेमिनी आदि) को इस दुनिया में कार्य दिए।
- उन्होंने यह देखने के लिए निगरानी की कि क्या एजेंटों ने काम करने के प्रयास में निजी रहस्य उजागर कर दिए।
4. चौंकाने वाले परिणाम
परिणाम अच्छे नहीं थे।
- उच्च विफलता दर: परीक्षण किए गए 15 एजेंटों में से, 12 एजेंटों ने आधे से अधिक परिदृश्यों में निजी जानकारी लीक की।
- क्षमता सुरक्षा (Capability Safety): जो एजेंट कार्य पूरा करने में सबसे अच्छे थे, वे अक्सर रहस्य रखने में सबसे खराब थे। काम करने में "स्मार्ट" होने का मतलब यह नहीं था कि वे छिपाने के मामले में भी "स्मार्ट" थे।
- "रिफ्यूज़ल" (Refusal - इनकार करने) की चाल: कुछ एजेंट केवल इसलिए सुरक्षित लग रहे थे क्योंकि उन्होंने कार्य करने से ही मना कर दिया था। यदि आप उनसे कोई पेचीदा सवाल पूछते हैं, तो वे बस कहते हैं "मैं यह नहीं कर सकता।" लेकिन यदि वे कार्य करने का प्रयास करते हैं, तो वे रहस्य लीक कर देते हैं।
5. अच्छी खबर: इसे ठीक किया जा सकता है
शोधकर्ताओं ने एजेंटों को बेहतर व्यवहार करना सिखाने के लिए तीन सरल "नियम" (प्रॉम्प्ट्स) का परीक्षण किया, जिसमें उन्हें शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं थी:
- प्रतिबंधात्मक बनें (Be Restrictive): "केवल इस कार्य के लिए आवश्यक विशिष्ट वस्तुओं को देखें।"
- एक मानदंड का उपयोग करें (Use a Rubric): "बोलने से पहले, खुद से पूछें: क्या यह आवश्यक है? क्या यह इस व्यक्ति के लिए उपयुक्त है?"
- प्राप्तकर्ता का नाम लें (Name the Recipient): "लिखने से पहले मुझे बताएं कि आप किससे बात कर रहे हैं, और उन पर कौन से नियम लागू होते हैं।"
परिणाम: इन सरल नियमों ने लीकेज (जानकारी लीक होने) को लगभग 33% से 36% तक कम कर दिया और वास्तव में एजेंटों को उनके काम में बेहतर बनाया (उच्च उपयोगिता/utility) क्योंकि वे अप्रासंगिक निजी जानकारी से विचलित होना बंद कर दिए।
निष्कर्ष (The Bottom Line)
शोध पत्र निष्कर्ष निकालता है कि हम केवल इसलिए एआई एजेंटों पर भरोसा नहीं कर सकते क्योंकि वे "अपने काम में अच्छे हैं।" हमें विशेष रूप से उन्हें कॉन्टेक्स्टुअल इंटीग्रिटी (Contextual Integrity) पर परखने की आवश्यकता है—उनकी यह जानने की क्षमता कि कौन सी जानकारी किस संदर्भ में होनी चाहिए।
वर्तमान में, अधिकांश एजेंट एक बहुत ही उत्साही लेकिन अनाड़ी सहायक की तरह हैं जो खुशी-खुशी आपके बॉस को आपकी निजी डायरी पढ़कर सुना देंगे यदि आप उनसे कहें कि "आपके दिन का सारांश दें।" हमें उन्हें अपने वास्तविक कंप्यूटरों पर छोड़ने से पहले "वर्क मोड" और "प्राइवेट मोड" के बीच का अंतर सिखाने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।