← नवीनतम पेपर
💬 NLP

CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents

यह शोध पत्र CI-Work प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक एंटरप्राइज एलएलएम (LLM) एजेंट अक्सर संवेदनशील जानकारी लीक करके प्रासंगिक अखंडता (contextual integrity) का उल्लंघन करते हैं, एक ऐसी समस्या जो उच्च कार्य उपयोगिता के साथ और भी गंभीर हो जाती है और जिसे केवल मॉडल के आकार को बढ़ाकर हल नहीं किया जा सकता है, जिससे संदर्भ-केंद्रित आर्किटेक्चर की ओर बदलाव आवश्यक हो जाता है।

मूल लेखक: Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक अत्यंत बुद्धिमान, अति-कुशल व्यक्तिगत सहायक "एजेंट" (Agent) को काम पर रखा है। इस एजेंट के पास आपके संपूर्ण डिजिटल जीवन तक पहुँच है: आपके ईमेल, आपका कैलेंडर, आपकी वित्तीय स्प्रेडशीट, आपके निजी चैट लॉग और आपकी मीटिंग नोट्स। आपका लक्ष्य यह है कि यह एजेंट आपको काम पूरा करने में मदद करे, जैसे कि किसी क्लाइंट को ईमेल का ड्राफ्ट तैयार करना या किसी प्रोजेक्ट का सारांश बनाना।

समस्या क्या है? कभी-कभी, मदद करने के उत्साह में, एजेंट गलती से आपके राज उगल देता है। वह कह सकता है, "यह प्रोजेक्ट अपडेट है," और फिर जोड़ सकता है, "ओह, और वैसे, मैंने देखा कि आपके बॉस गुप्त रूप से अगले सप्ताह मार्केटिंग टीम को निकालने की योजना बना रहे हैं," या "साथ ही, मैंने देखा कि आपने काम के घंटों के दौरान तीन घंटे वीडियो गेम खेलने में बिताए।"

यह शोध पत्र, CI-Work, एक विशाल, उच्च-दांव वाले "ट्रैप टेस्ट" (जाल परीक्षण) की तरह है, जिसे यह देखने के लिए डिज़ाइन किया गया है कि ये AI एजेंट अपना काम करते हुए अपना मुँह कितना बंद रख सकते हैं।

यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. मुख्य समस्या: "अति-उत्साही बटलर" (Over-Enthusiastic Butler)

एक एंटरप्राइज AI एजेंट को एक विशाल, हाई-टेक हवेली (कंपनी) में एक बटलर (बड़ा नौकर) के रूप में सोचें।

  • काम: बटलर को मालिक (कर्मचारी) के लिए विशिष्ट वस्तुएं लानी होती हैं ताकि वे अतिथि (क्लाइंट या सहकर्मी) को परोस सकें।
  • जोखिम: हवेली में एक "सेफ रूम" (संवेदनशील डेटा) और एक "लिविंग रूम" (आवश्यक डेटा) है। बटलर जानता है कि सेफ रूम कैसे खोला जाता है। यदि बटलर सेफ रूम से कोई दस्तावेज़ निकालता है और गलती से उसे अतिथि के लिए ट्रे पर छोड़ देता है, तो यह एक प्राइवेसी लीक (गोपनीयता का उल्लंघन) है।
  • सिद्धांत: यह शोध पत्र कॉन्टेक्स्टुअल इंटीग्रिटी (संदर्भ संबंधी अखंडता) नामक अवधारणा का उपयोग करता है। कल्पना कीजिए कि एक नियम पुस्तिका है जो कहती है: "यह अपने बॉस को अपनी कार्य प्रगति के बारे में बताना ठीक है, लेकिन अपने बॉस को अपने लंच ऑर्डर के बारे में बताना ठीक नहीं है, और यह अपने प्रतिस्पर्धी को अपने बॉस के लंच ऑर्डर के बारे में बताना बिल्कुल भी ठीक नहीं है।" यह शोध पत्र यह परीक्षण करता है कि क्या AI इन अलिखित सामाजिक नियमों को जानता है।

2. परीक्षण: "CI-Work" (एक बाधा दौड़)

AI प्राइवेसी के पिछले परीक्षण किसी छात्र से यह पूछने जैसे थे, "क्या अपनी माँ को यह बताना ठीक है कि आपने एक कुकी खाई थी?" (सरल, दैनिक जीवन)।
CI-Work अलग है। यह एक जटिल जासूसी सिमुलेशन की तरह है।

  • सेटअप: AI को एक कार्य दिया जाता है (जैसे, "क्लाइंट को बजट के बारे में ईमेल करें")।
  • जाल: AI को दस्तावेजों का एक ढेर दिया जाता है। कुछ आवश्यक (बजट के आंकड़े जिनकी ईमेल के लिए आवश्यकता है) हैं और कुछ संवेदनशील (CEO की क्लाइंट को निकालने की गुप्त योजना, या कर्मचारी के व्यक्तिगत मेडिकल रिकॉर्ड जो उसी फोल्डर में पाए गए हैं) हैं।
  • चुनौती: AI को उस ढेर को छानना होगा, बजट के आंकड़े उठाने होंगे, और रहस्यों को अनदेखा करना होगा। लेकिन वह ढेर अव्यवस्थित है, दस्तावेज़ लंबे हैं, और "रहस्य" उन "बजट नंबरों" के ठीक बगल में छिपे हुए हैं।

3. चौंकाने वाले परिणाम: "हेल्पफुलनेस पैराडॉक्स" (सहायता का विरोधाभास)

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडलों (फ्रंटियर मॉडल्स) का परीक्षण किया। यहाँ उन्हें क्या मिला:

  • लीक होने की दर अधिक है: यहाँ तक कि सबसे स्मार्ट AI भी परीक्षण में अक्सर विफल रहे। 16% से 50% समय के बीच, उन्होंने अनजाने में संवेदनशील रहस्य उजागर कर दिए। कुछ मामलों में, उन्होंने 27% तक के गुप्त डेटा को लीक कर दिया।
  • "अधिक मदद = अधिक खतरा" का ट्रेड-ऑफ: यह सबसे प्रति-सहज (counter-intuitive) निष्कर्ष है। आमतौर पर, हम सोचते हैं कि एक स्मार्ट, बड़ा AI अधिक सुरक्षित होता है। लेकिन यहाँ, AI जितना अधिक मददगार था कार्य पूरा करने में, उसके रहस्य लीक करने की संभावना उतनी ही अधिक थी।
    • उपमा: कल्पना कीजिए कि एक शेफ इतना उत्सुक है कि वह एक बेहतरीन सूप बनाने के लिए उसमें पूरा मसाला का जार डाल देता है, जिसमें जहर भी शामिल है। सूप का स्वाद "बेहतर" (उच्च उपयोगिता) होता है, लेकिन अब वह जहरीला (निजता का उल्लंघन) है।
  • बड़ा होना बेहतर नहीं है: AI मॉडल को बड़ा करने या उसे "अधिक गहराई से सोचने" के लिए कहने से समस्या हल नहीं हुई। वास्तव में, कभी-कभी बड़े मॉडल अधिक लीक करते थे क्योंकि वे निर्देशों का पालन करने में इतने अच्छे थे कि उन्होंने उन सूक्ष्म सामाजिक नियमों को अनदेखा कर दिया कि क्या साझा नहीं किया जाना चाहिए।

4. प्रेशर कुकर: उपयोगकर्ता व्यवहार

शोध पत्र में यह भी परीक्षण किया गया कि जब मानव उपयोगकर्ता दबाव डालता है तो क्या होता है।

  • परिदृश्य: एक उपयोगकर्ता AI को कहता है, "मुझे एक बहुत विस्तृत सारांश चाहिए, सुनिश्चित करें कि आप इसमें सब कुछ शामिल करें जो प्रासंगिक है।"
  • परिणाम: AI घबरा गया। वह इतना "विस्तृत" होने की कोशिश करने लगा कि उसने अच्छी जानकारी के साथ संवेदनशील रहस्य भी डाल दिए। यह एक घबराए हुए वेटर की तरह है जो, जब उसे "सब कुछ लाने" के लिए कहा जाता है, तो वह पूरी रसोई ही मेज पर ले आता है।

5. समाधान: सोचने का एक नया तरीका

शोध पत्र निष्कर्ष निकालता है कि हम केवल AI मॉडलों को "स्मार्टर" या "बड़ा" बनाकर काम नहीं चला सकते। यह एक लीकी नाव को बड़ा बनाकर ठीक करने की कोशिश करने जैसा है; वह बस तेजी से डूबेगी।

इसके बजाय, हमें कॉन्टेक्स्ट-सेंट्रिक आर्किटेक्चर (संदर्भ-केंद्रित संरचना) की आवश्यकता है।

  • रूपक: AI को "सब कुछ जानने वाले जीनियस" के रूप में प्रशिक्षित करने के बजाय, हमें AI के चारों ओर एक सुरक्षा गार्ड प्रणाली बनानी होगी। यह गार्ड केवल शब्दों को नहीं देखता; वह संदर्भ (context) को देखता है। वह पूछता है: "कौन पूछ रहा है? कौन प्राप्त कर रहा है? क्या यह विशिष्ट जानकारी साझा करने का सही समय है?"

सारांश

CI-Work एक चेतावनी है। यह दिखाता है कि जबकि AI एजेंट काम करने में अद्भुत हैं, वे वर्तमान में यह जानने में बहुत खराब हैं कि पेशेवर सेटिंग में क्या नहीं कहना चाहिए। वे एक प्रतिभाशाली लेकिन सामाजिक रूप से अनाड़ी इंटर्न की तरह हैं जो बहुत अधिक बोलता है।

शोध पत्र का तर्क है कि इन एजेंटों को वास्तविक दुनिया में सुरक्षित रूप से उपयोग करने के लिए, हमें उन्हें केवल "स्मार्टर" बनाने की कोशिश करना बंद करना होगा और बेहतर कॉन्टेक्स्टुअल फिल्टर्स (संदर्भ फिल्टर) बनाने शुरू करने होंगे जो कार्यालय की गोपनीयता के नाजुक नियमों को समझते हों। अन्यथा, जैसे-जैसे हम उन्हें अपने कंपनियों में गहराई से एकीकृत करेंगे, हम एक बड़े डेटा लीक का जोखिम उठाएंगे जहाँ AI एक साधारण ईमेल भेजने के प्रयास में दुनिया को हमारे रहस्य बता देगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →