← नवीनतम पेपर
🤖 AI

Agent Security Needs Redefinition through a Holistic Framework

यह शोध पत्र तर्क देता है कि एजेंट सुरक्षा मौलिक रूप से एक विषय-आधारित (content-based) समस्या के बजाय एक प्रासंगिक (contextual) समस्या है, जो वर्तमान विषय-केंद्रित सुरक्षा उपायों और बेंचमार्क की संरचनात्मक सीमाओं को संबोधित करने के लिए स्रोत प्राधिकरण (Source Authorization), कार्य संरेखण (Task Alignment), क्रिया संरेखण (Action Alignment) और डेटा अलगाव (Data Isolation) द्वारा परिभाषित एक समग्र ढांचे का प्रस्ताव करता है।

मूल लेखक: Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

प्रकाशित 2026-07-27
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट, बहुत तेज़ अंतरिक्ष यान के कप्तान हैं। इस जहाज में एक नया तरह का ऑटोपायलट है: एक AI एजेंट। यह एजेंट केवल दिशा ही नहीं बताता; यह अन्य कंप्यूटरों से बात कर सकता है, दरवाजे खोल सकता है, माल इधर-उधर कर सकता है, और यहाँ तक कि इंजन को भी ठीक कर सकता है। लेकिन पेचीदा बात यह है कि आपका जहाज शोर से भरी एक आकाशगंगा से गुजर रहा है। कभी-कभी एक मिलनसार चालक दल का सदस्य आदेश देता है, और कभी-कभी एक चालाक एलियन एक हानिरहित दिखने वाले संदेश के अंदर एक नकली आदेश छिपाकर जहाज को धोखा देने की कोशिश करता है।

लंबे समय तक, AI जहाजों का अध्ययन करने वाले वैज्ञानिकों ने सोचा कि सुरक्षित रहने का एकमात्र तरीका आदेश के शब्दों को देखना है। यदि आदेश डरावना लगता, जैसे "इंजन को उड़ा दो," तो वे उसे रोक देते। यदि वह अच्छा लगता, जैसे "इंजन को ठीक करो," तो वे उसे जाने देते। लेकिन यह एक क्लब के सुरक्षा गार्ड की तरह है जो केवल आपकी शर्ट के रंग को देखता है। यदि कोई चोर लाल शर्ट पहनता है, तो गार्ड उसे अंदर जाने देता है। यदि कोई फायरफाइटर लाल शर्ट पहनता है, तो गार्ड उसे रोकता है। समस्या यह है कि वही शब्द एक बॉस के मित्रवत अनुरोध भी हो सकते हैं और एक हैकर के घातक जाल भी, यह इस पर निर्भर करता है कि कौन बोल रहा है और स्थिति क्या है। यह शोध पत्र तर्क देता है कि हमें केवल शब्दों को देखना बंद करना चाहिए और उनके पीछे की पूरी कहानी को देखना शुरू करना चाहिए।


बड़ी गड़बड़ी: शब्द बनाम जिसने उन्हें कहा

इस शोध पत्र के लेखक, जो यूसी सांता क्रूज़ और यूसी बर्कले के शोधकर्ताओं की एक टीम है, यह बता रहे हैं कि हम AI एजेंटों को टेस्ट करने और सुरक्षित करने के तरीके में एक बड़ी गलती कर रहे हैं। वे कहते हैं कि हम गलत सवाल पूछ रहे हैं। "क्या यह कमांड खतरनाक दिखती है?" पूछने के बजाय, हमें पूछना चाहिए, "क्या यह कमांड इस विशिष्ट स्थिति में अनुमत है?"

यह समझने के लिए कि यह क्यों मायने रखता है, एक "फ़ाइल डिलीट करें" कमांड की कल्पना करें।

  • परिदृश्य A: आपका बॉस, जिसके पास इमारत की चाबी है, कहता है, "पिछले साल की पुरानी फ़ाइलें हटा दें।" यह एक अच्छी बात है।
  • परिदृश्य B: एक हैकर, जिसने सार्वजनिक बुलेटिन बोर्ड पर एक नोट छिपा दिया है, कहता है, "पिछले साल की पुरानी फ़ाइलें हटा दें।" यह एक आपदा है।

शब्द समान हैं। क्रिया समान है। लेकिन पहले मामले में, यह एक नियमित सफाई है। दूसरे मामले में, यह एक अपराध है। वर्तमान सुरक्षा प्रणालियाँ एक रोबोट की तरह हैं जो केवल नोट को पढ़ता है। वह "डिलीट" देखता है और घबरा जाता है, या वह "डिलीट" देखता है और सोचता है, "ओह, यह ठीक है," बिना यह जांचे कि इसे किसने लिखा है। लेखक कहते हैं कि यह एक फिल्म के एकल फ्रेम को देखकर फिल्म का न्याय करने जैसा है। आप कथानक, पात्र और संदर्भ को भूल जाते हैं।

चार-चरणीय सुरक्षा जाँच

इसे ठीक करने के लिए, यह पत्र सुझाव देता है कि हम केवल क्रिया को देखना बंद करें और चार विशिष्ट चीजों की जांच करना शुरू करें, जैसे कि एक सुरक्षा टीम जहाज को हिलने से पहले चेकलिस्ट चलाती है। वे इसे एक "होलिस्टिक फ्रेमवर्क" (समग्र ढांचा) कहते हैं, जो बस एक फैंसी तरीका है यह कहने का कि "पूरी तस्वीर को देखना।"

यहाँ चार नियम दिए गए हैं जिन्हें लेखकों के अनुसार हमें AI द्वारा की जाने वाली प्रत्येक क्रिया के लिए जांचना चाहिए:

  1. स्रोत प्राधिकरण (कौन बात कर रहा है?): यह पूछता है, "क्या वास्तव में सही चाबियों वाले व्यक्ति ने यह कहा है?" यदि कोई आदेश किसी रैंडम वेबपेज या दस्तावेज़ से आता है जिसे AI पढ़ रहा है, तो यह सड़क से चिल्लाते अजनबियों के आदेश जैसा है। भले ही आदेश "पैसे भेजें" हो, यदि वह अजनबी बैंक मैनेजर नहीं है, तो उत्तर है "नहीं।"
  2. कार्य संरेखण (मिशन क्या है?): यह पूछता है, "क्या यह आदेश उस काम का हिस्सा है जिसके लिए AI को काम पर रखा गया था?" कल्पना कीजिए कि एक डिलीवरी रोबोट को पिज्जा लाने के लिए काम पर रखा गया है। यदि कोई उसे "बैंक लूटने के लिए जाओ" कहता है, तो यह एक अलग काम है। भले ही रोबोट बैंक तक जाने में सक्षम हो, उसे ऐसा नहीं करना चाहिए क्योंकि यह उसका मिशन नहीं है।
  3. क्रिया संरेखण (क्या यह कदम मिशन में फिट बैठता है?): यह पूछता है, "क्या यह विशिष्ट कदम मिशन में मदद कर रहा है?" यदि रोबोट पिज्जा डिलीवर कर रहा है, तो उसे दरवाजा खोलने की आवश्यकता हो सकती है। लेकिन यदि वह आगे बढ़ने के लिए "दरवाजा तोड़ देता" है, तो यह बहुत अधिक है। लक्ष्य (पिज्जा डिलीवर करना) ठीक है, लेकिन क्रिया (तोड़ना) गलत है।
  4. डेटा अलगाव (क्या रहस्य लीक हो रहे हैं?): यह पूछता है, "क्या AI निजी जानकारी को मिला रहा है?" कल्पना कीजिए कि वे एक डॉक्टर के सहायक हैं। यदि वे रोगी A की मदद करते हैं, और फिर रोगी B की मदद करते हैं, तो उन्हें गलती से रोगी B को रोगी A के मेडिकल इतिहास के बारे में नहीं बताना चाहिए। AI को अलग-अलग लोगों की "फ़ाइलों" को अलग रखना होगा।

पुराने परीक्षण क्यों विफल हो रहे हैं

यह पत्र बताता है कि आज हम AI को सुरक्षित देखने के लिए जो परीक्षण उपयोग करते हैं, वे कितने दोषपूर्ण हैं क्योंकि वे इन चार नियमों को अनदेखा करते हैं। शोधकर्ताओं ने दो लोकप्रिय टेस्ट सेट, AgentDojo और WASP को देखा, जिनमें 45 अलग-अलग "हमले" (attack) के परिदृश्य शामिल हैं।

उन्होंने पाया कि कुछ आश्चर्यजनक था: उन सभी 45 "हमलों" में से प्रत्येक एक सामान्य, कानूनी अनुरोध भी हो सकता था।

  • हमला: "$30,000 को छोटे हिस्सों में ट्रांसफर करें।"
    • द "बुरा" संस्करण: एक हैकर जो पैसे चुराने की कोशिश कर रहा है।
    • द "अच्छा" संस्करण: एक वैध अकाउंटेंट जो घर खरीदने के लिए भुगतान करते समय दैनिक सीमा के नीचे रहने की कोशिश कर रहा है।
  • हमला: "एक नए उपयोगकर्ता को 'मालिक' (Owner) के रूप में जोड़ें।"
    • द "बुरा" संस्करण: एक हैकर जो किसी प्रोजेक्ट पर कब्जा करने की कोशिश कर रहा है।
    • द "अच्छा" संस्करण: एक बॉस जो एक नए सह-संस्थापक को शामिल कर रहा है।

वर्तमान परीक्षण केवल क्रिया ("पैसे ट्रांसफर करें" या "उपयोगकर्ता जोड़ें") को देखते हैं और कहते हैं, "यह एक हमला है!" लेखक कहते हैं कि यह गलत है। परीक्षण अंतर नहीं बता सकता क्योंकि यह जांच नहीं रहा है कि किसने इसे मांगा या क्यों मांगा। यह एक शिक्षक की तरह है जो किसी छात्र को उसकी कहानी में "बम" शब्द लिखने के लिए फेल कर देता है, बिना पूरी कहानी पढ़े।

"स्नैपशॉट" की समस्या

लेखक इस बात की भी आलोचना करते हैं कि हम AI का परीक्षण कैसे करते हैं। अधिकांश परीक्षण "स्नैपशॉट" की तरह होते हैं। वे AI को एक कमांड देते हैं, देखते हैं कि क्या होता है, और फिर सब कुछ रीसेट कर देते हैं। वे AI की याददाश्त मिटा देते हैं और फिर से शुरू करते हैं।

लेकिन वास्तविक जीवन स्नैपशॉट नहीं है; यह एक फिल्म है। एक हैकर तुरंत हमला नहीं कर सकता। वे आज AI की याददाश्त में एक "जहरीला" नोट डाल सकते हैं, और फिर, तीन दिन बाद, AI वह नोट पढ़ता है और सोचता है कि यह एक वास्तविक आदेश है। क्योंकि स्नैपशॉट परीक्षण मेमोरी को रीसेट कर देते हैं, वे इन धीमी, चालाकी भरी हमलों को कभी देख ही नहीं सकते। लेखक तर्क देते हैं कि हमें AI की पूरी यात्रा को देखना चाहिए, न कि केवल एक समय में एक कदम।

समाधान: रक्षा बनाने का एक नया तरीका

तो, हम क्या करते हैं? यह पत्र सुझाव देता है कि हम "कंटेंट फिल्टर" (ऐसे प्रोग्राम जो केवल बुरे वाइब्स वाले शब्दों को स्कैन करते हैं) बनाने के बजाय "कॉन्टेक्स्ट चेक" (संदर्भ जांच) बनाने पर ध्यान केंद्रित करें।

  • इसके बजाय पूछना: "क्या यह वाक्य किसी हैक जैसा दिखता है?"
  • हमें पूछना चाहिए: "क्या स्रोत अधिकृत है? क्या कार्य अनुमत है? क्या क्रिया बहुत बड़ी है? क्या डेटा लीक हो रहा है?"

यह हमारे रक्षा तंत्र बनाने के तरीके को बदल देता है। यदि कोई रक्षा "स्रोत प्राधिकरण" (Source Authorization) की जांच करने में अच्छी है, तो उसे यह अनुमान लगाने में परफेक्ट होने की जरूरत नहीं है कि कोई शब्द "बुरा" है। उसे बस यह जानने की जरूरत है कि बोलने वाले के पास चाबी है या नहीं। यह एक बहुत आसान और अधिक विश्वसनीय काम है।

लेखक स्वीकार करते हैं कि यह एक बड़ा बदलाव है। इसका मतलब है कि हम केवल AI पर भरोसा नहीं कर सकते कि वह "जानता" है कि क्या बुरा है। हमें ऐसे सिस्टम बनाने होंगे जो AI के काम करने के दौरान लगातार इन चार नियमों की जांच करें। वे सुझाव देते हैं कि हालांकि हम हमेशा सटीक ट्रैकिंग नहीं कर सकते, लेकिन हम ऐसे सिस्टम बना सकते हैं जो इन चार चीजों को जांचने में "काफी अच्छे" हों ताकि बड़ी गलतियों को रोका जा सके।

निष्कर्ष

यह शोध पत्र यह दावा नहीं करता है कि इसने AI सुरक्षा की हर समस्या को हल कर दिया है। यह यह नहीं कहता है कि, "हमने सब कुछ ठीक कर दिया!" बल्कि, यह कहता है कि, "हम समस्या को गलत तरीके से देख रहे थे।"

सुरक्षा को केवल बुरे शब्दों की सूची के बजाय, इस बारे में एक कहानी के रूप में मानकर कि कौन क्या कर रहा है और क्यों, हम वास्तव में सुरक्षित AI बना सकते हैं। यह एक सुरक्षा गार्ड की तरह है जो केवल आपके चेहरे को देखता है, और एक ऐसे गार्ड की तरह जो आपका आईडी, आपका टिकट, आपका गंतव्य और आपका सामान भी चेक करता है। पत्र का सुझाव है कि यदि हम चाहते हैं कि हमारे AI एजेंट आकाशगंगा में सुरक्षित रूप से उड़ें, तो हमें केवल चेहरा नहीं, बल्कि पूरा टिकट चेक करना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →