← नवीनतम पेपर
🤖 AI

How Adversarial Environments Mislead Agentic AI?

यह शोध पत्र 'एडवर्सरियल एनवायर्नमेंटल इंजेक्शन' (AEI) को एक खतरे के मॉडल के रूप में औपचारिक रूप देकर टूल-एकीकृत एआई एजेंटों में "ट्रस्ट गैप" (विश्वास अंतराल) को प्रस्तुत करता है जहाँ ज़हरीले टूल आउटपुट एजेंटों को धोखा देते हैं, और POTEMKIN फ्रेमवर्क के माध्यम से यह प्रदर्शित करता है कि वर्तमान एजेंट विस्तार-आधारित एपिस्टेमिक ड्रिफ्ट ("द इल्यूजन") और गहराई-आधारित नेविगेशनल ट्रैप्स ("द मेज़") दोनों के विरुद्ध मजबूती की कमी रखते हैं।

मूल लेखक: Zhonghao Zhan, Huichi Zhou, Zhenhao Li, Peiyuan Jing, Krinos Li, Hamed Haddadi

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhonghao Zhan, Huichi Zhou, Zhenhao Li, Peiyuan Jing, Krinos Li, Hamed Haddadi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बेहद बुद्धिमान शोध सहायक (research assistant) नियुक्त किया है जिसका नाम एजेंट (Agent) है। यह एजेंट अविश्वसनीय रूप से प्रतिभाशाली है—जानकारी खोजने, शोध पत्रों को पढ़ने और रिपोर्ट लिखने में। लेकिन एक शर्त है: एजेंट दुनिया को सीधे तौर पर नहीं जानता। वह केवल उन उपकरणों के माध्यम से दुनिया को जानता है जो आप उसे देते हैं, जैसे कि एक सर्च इंजन या लाइब्रेरी डेटाबेस।

यह पेपर इस बारेक में है कि इस एजेंट को धोखा देने का एक नया तरीका कैसे निकाला जा सकता है। शोधकर्ता इसे "ट्रूमैन शो प्रॉब्लम" (Truman Show Problem) कहते हैं।

ठीक वैसे ही जैसे फिल्म द ट्रूमैन शो के पात्र ट्रूमैन बर्बैंक के साथ हुआ था, जो एक टीवी शो द्वारा निर्मित एक नकली दुनिया में रहा करता था, हमारे एआई एजेंट भी उनके द्वारा दिए गए टूल्स द्वारा बनाई गई दुनिया में रहते हैं। यदि कोई हमलावर उन टूल्स को हैक कर लेता है, तो वे एक ऐसी नकली वास्तविकता बना सकते हैं जिसे एजेंट 100% सच मान ले।

शोधकर्ताओं ने पाया है कि इन एजेंटों को तोड़ने के दो पूरी तरह से अलग तरीके हैं, और एक को रोकने में कुशल होने का मतलब दूसरे को रोकने में सक्षम होना नहीं है। वे इसे "रोबस्टनेस स्किज़म" (Robustness Schism) कहते हैं (एक फैंसी शब्द जिसका अर्थ है कि एजेंटों के विफल होने के तरीकों में एक गहरा विभाजन है)।

यहाँ एजेंटों को बेवकूफ बनाने के दो तरीके दिए गए हैं:

1. भ्रम (The Illusion - "फेक न्यूज" हमला)

रूपक (Metaphor): कल्पना कीजिए कि आप अपने सहायक से पूछ रहे हैं कि क्या कोई विशिष्ट फल जहरीला है। हमलावर फल को नहीं बदलता; इसके बजाय, वह उन लाइब्रेरी की किताबों और इंटरनेट लेखों को हैक कर लेता है जिन्हें सहायक पढ़ रहा है। वे सच्चाई को बदलकर हजारों विश्वसनीय, तटस्थ दिखने वाले लेखों से बदल देते हैं जो कहते हैं, "हाँ, यह फल निश्चित रूप से जहरीला है।"

  • क्या होता है: एजेंट इन सभी "नकली तथ्यों" को पढ़ता है, भ्रमित हो जाता है, और झूठ पर विश्वास करने लगता है। वह अपना विचार बदल देता है (ड्रिफ्ट) और आपको बताता है कि फल जहरीला है।
  • ट्विस्ट: शोधकर्ताओं ने पाया कि एजेंट तटस्थ दिखने वाले तथ्यों पर बहुत अधिक भरोसा करते हैं। यदि कोई लेख एक उबाऊ समाचार रिपोर्ट जैसा लगता है, तो एजेंट उसे मान लेता है। यदि वह किसी अफवाह जैसा लगता है, तो वह संशय में रहता है। लेकिन यदि वह एक शुष्क, पेशेवर रिपोर्ट जैसा लगता है, तो एजेंट उसे बिना सोचे-समझे स्वीकार कर लेता है।
  • "ईमानदारी का दंड" (The Honesty Penalty): इससे भी बुरा यह है कि यदि सच्चाई को सावधानी से कहा जाता है (जैसे, "डेटा सुझाव देता है कि यह सच हो सकता है"), तो एजेंट अक्सर उसे खारिज कर देता है! लेकिन यदि कोई झूठा व्यक्ति आत्मविश्वास के साथ कहता है ("यह सच है!"), तो एजेंट उस पर विश्वास कर लेता है। एजेंट ईमानदारी को दंडित करता है और आत्मविश्वास को पुरस्कृत करता है।

2. भूलभुलैया (The Maze - "अनंत गलियारा" हमला)

रूपक (Metaphor): इस बार, हमलावर तथ्यों के बारे में झूठ नहीं बोलता। इसके बजाय, वे एक संरचनात्मक जाल (structural trap) बनाते हैं। कल्पना कीजिए कि आपका एजेंट एक लाइब्रेरी में एक विशिष्ट कमरे को खोजने की कोशिश कर रहा है। हमलावर एक नकली गलियारा जोड़ देता है जो एक दरवाजे की ओर ले जाता है, जो दूसरे दरवाजे की ओर ले जाता है, जो वापस पहले दरवाजे पर ही ले आता है। यह एक अनंत लूप (infinite loop) है।

  • क्या होता है: एजेंट को फंसने के लिए झूठ पर विश्वास करने की आवश्यकता नहीं है। उसे बस लिंक का पालन करने की आवश्यकता है। वह एक "साइटेशन चक्र" (citation cycle) में फंस जाता है, एक नकली पेपर से दूसरे तक क्लिक करता रहता है, हमेशा के लिए।
  • लागत: एजेंट अपना सारा समय और ऊर्जा (अपना "स्टेप बजट") चक्कर लगाने में बर्बाद कर देता है। वह कार्य पूरा नहीं कर पाता, इसलिए नहीं कि वह मूर्ख है, बल्कि इसलिए क्योंकि उसे जो नक्शा दिया गया है वह टूटा हुआ है।
  • आश्चर्य: ऐसे एजेंट जो फेक न्यूज पहचानने में बहुत अच्छे हैं (The Illusion), वे इन जालों को पहचानने में बहुत खराब होते हैं। वे बता सकते हैं कि एक नकली तथ्य झूठ है, लेकिन वे यह नहीं बता सकते कि जिस गलियारे में वे चल रहे हैं उसका अस्तित्व ही नहीं है।

बड़ी खोज: "रोबस्टनेस स्किज़म" (The Robustness Schism)

सबसे महत्वपूर्ण निष्कर्ष यह है कि ये दोनों कौशल आपस में संबंधित नहीं हैं।

  • एक एजेंट जो फेक न्यूज पकड़ने में जीनियस है (The Illusion), वह नक्शों को समझने में पूरी तरह से अनाड़ी हो सकता है (The Maze)।
  • एक एजेंट जो नेविगेशन में बहुत अच्छा है, वह गलत तथ्यों से आसानी से ठगा जा सकता है।

यह एक ऐसे व्यक्ति की तरह है जो नकली हीरा पहचानने में माहिर है लेकिन पुल गायब होने पर ध्यान न देने के कारण खाई में गिर जाएगा। आप एक समस्या को दूसरी समस्या को ठीक करके हल नहीं कर सकते।

समाधान: पोटेमकिन (POTEMKIN)

शोधकर्ताओं ने POTEMKIN नामक एक टूल बनाया है (इसका नाम "पोटेमकिन विलेजेस" के नाम पर रखा गया है, जो आगंतुकों को प्रभावित करने के लिए बनाए गए नकली गांव थे)।

सोचिए कि POTEMKIN एक AI एजेंट के लिए सुरक्षा परीक्षण जिम (security testing gym) है। इससे पहले कि आप किसी AI एजेंट को वास्तविक दुनिया (जैसे अस्पताल या लॉ फर्म) में काम करने दें, आप उसे POTEMKIN के माध्यम से चला सकते हैं।

  • यह एजेंट को फेक न्यूज खिलाने की कोशिश करता है।
  • यह एजेंट को अनंत लूप में फंसाने की कोशिश करता है।
  • यह आपको बताता है कि एजेंट कहाँ कमजोर है।

आपको इसकी परवाह क्यों करनी चाहिए?

जैसे-जैसे AI एजेंट वास्तविक काम करना शुरू कर रहे हैं—कोड लिखना, मेडिकल रिकॉर्ड की जांच करना, या कानूनी शोध करना—वे बाहरी टूल्स पर बहुत अधिक निर्भर करेंगे। यदि हम उन्हें इन "नकली दुनिया" के हमलों के खिलाफ टेस्ट नहीं करते हैं, तो उन्हें आसानी से हेरफेर किया जा सकता है ताकि वे:

  1. झूठ पर विश्वास करें (आपको गलत चिकित्सा सलाह देना)।
  2. लूप में फंस जाएं (पैसा और समय बर्बाद करना)।

यह पेपर चेतावनी देता है: सिर्फ इसलिए कि एक AI स्मार्ट है, इसका मतलब यह नहीं है कि वह सुरक्षित है। हमें ऐसे एजेंट बनाने की आवश्यकता है जो न केवल जानकार हों, बल्कि संदेहवादी (skeptical) और अपने परिवेश के प्रति जागरूक भी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →