← नवीनतम पेपर
💻 computer science

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

यह शोध पत्र ऑब्सेसिव एक्सपीरियंस पॉइज़निंग (OEP) को प्रस्तुत करता है, जो एक लो-प्रिविलेज ब्लैक-बॉक्स हमला है जो मेमोरी-ऑगमेंटेड LLM एजेंटों को स्थानीय रूप से सही लेकिन गैर-हस्तांतरणीय अनुभवों के साथ समझौता करके बाधित करता है, जिनमें गंभीर काल्पनिक परिणाम शामिल होते हैं, जिससे एजेंट स्व-विकास के दौरान हानिकारक नियमों में अत्यधिक सामान्यीकरण करने लगते हैं।

मूल लेखक: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, महत्वाकांक्षी रोबोट सहायक है। यह रोबोट अपनी गलतियों और सफलताओं से सीखने के लिए डिज़ाइन किया गया है, ठीक वैसे ही जैसे एक इंसान जो अपने काम में बेहतर होने के लिए एक डायरी रखता है। हर बार जब वह किसी समस्या को हल करता है, तो वह भविष्य में मदद के लिए एक "सीखा गया सबक" (lesson learned) लिखता है।

आपके द्वारा दिए गए पेपर में इस रोबोट को गलत सबक सीखने के लिए चकमा देने का एक चालाकी भरा तरीका बताया गया है, जो उसे झूठ चिल्लाकर नहीं, बल्कि एक बहुत ही विश्वसनीय, विशिष्ट कहानी सुनाकर किया जाता है जो सच लगती है लेकिन सामान्य रूप से लागू करने पर खतरनाक है। शोधकर्ता इस हमले को OEP (Obsessive Experience Poisoning) कहते हैं।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. सेटअप: रोबोट की "डायरी"

सामान्य तौर पर, जब रोबोट गणित की कोई कठिन समस्या हल करता है या कोई फ्लाइट बुक करता है, तो वह अपने इतिहास को देखता है। यदि उससे कोई गलती हुई, तो वह कहता है, "ओह, मुझे ऐसा नहीं करना चाहिए था।" यदि वह सफल रहा, तो वह कहता है, "बहुत बढ़िया, मैं इसे फिर से करूँगा।" समय के साथ, वह इन विशिष्ट क्षणों को सामान्य नियमों में बदल देता है, जैसे "फ्लाइट बुक करने से पहले हमेशा मौसम की जाँच करें।"

2. हमला: "परफेक्ट" जाल

हमलावर रोबोट के कोड को हैक करने या उसे कुछ बुरा कहने के लिए मजबूर करने की कोशिश नहीं करता है। इसके बजाय, वे एक सामान्य बातचीत करने वाले उपयोगकर्ता की तरह व्यवहार करते हैं। वे रोबोट के सामने एक बहुत ही विशिष्ट, अजीब स्थिति (एक एज केस) और उसका एक समाधान पेश करते हैं जो उस एक विशेष स्थिति के लिए पूरी तरह से सही काम करता है।

  • उपमा: कल्पना कीजिए कि आप एक डॉक्टर हैं। एक मरीज आता है जिसे एक बहुत ही दुर्लभ, विशिष्ट एलर्जी है जो केवल एक खास तरह के फल के प्रति प्रतिक्रिया करती है। आप उनका सही इलाज करते हैं, और वे ठीक हो जाते हैं।
  • जाल: हमलावर इसके साथ एक डरावनी कहानी जोड़ देता है। वे कहते हैं, "यदि आपने उस विशिष्ट फल के उपचार का उपयोग नहीं किया होता, तो मरीज को दिल का दौरा पड़ने से तुरंत मृत्यु हो जाती।"

3. ज़हर: "स्थानीय रूप से सही, वैश्विक रूप से गलत"

रोबोट के सुरक्षा फिल्टर इस कहानी की जाँच करते हैं।

  • क्या यह उपचार इस मरीज के लिए सही है? हाँ।
  • क्या दिल के दौरे वाली कहानी तर्कसंगत है? हाँ।
  • क्या इसमें कोई स्पष्ट झूठ है? नहीं।

क्योंकि कहानी "साफ" है (इसमें कोई बुरे शब्द या स्पष्ट झूठ नहीं है), रोबोट का सुरक्षा गार्ड इसे ब्लॉक नहीं करता है। रोबोट इसे अपनी डायरी में लिख लेता है।

4. "जुनून" (Obsession): डर रोबोट को अति-सामान्य बनाने पर मजबूर करता है

इंसान और रोबोट स्वाभाविक रूप से विनाशकारी परिणामों (जैसे मृत्यु या पूर्ण सिस्टम विफलता) से डरते हैं। इसे लॉस अवर्जन (Loss Aversion) कहा जाता है।

क्योंकि रोबोट को बताया गया था कि उस विशिष्ट फल के उपचार का उपयोग न करने से "दिल का दौरा" पड़ सकता है, वह इस परिणाम से बचने के लिए जुनूनी हो जाता है। वह अपनी डायरी देखता है और सोचता है:

"मुझे यह नियम कभी नहीं भूलना चाहिए! अगर मैंने उस विशिष्ट फल के उपचार का उपयोग नहीं किया, तो लोगों की मृत्यु हो सकती है!"

इसलिए, रोबोट इस एक विशिष्ट नियम (एक दुर्लभ एलर्जी के लिए) को एक वैश्विक नियम (हर मरीज के लिए) में बदल देता है।

5. परिणाम: रोबोट खुद को तोड़ देता है

अब, रोबोट "विषाक्त" (poisoned) हो चुका है।

  • गणित में: यह साधारण जोड़ के लिए भी एक अजीब, अत्यधिक जटिल गणना पद्धति का उपयोग करने लग सकता है क्योंकि इसे बताया गया था कि एक विशिष्ट एज केस में साधारण विधि का उपयोग करने से "विनाशकारी त्रुटि" हुई थी।
  • यात्रा में: यह मौसम की जाँच किए बिना फ्लाइट बुक करने से मना कर सकता है, भले ही उपयोगकर्ता बस कल की मीटिंग के लिए टिकट बुक करना चाहता हो, क्योंकि इसे बताया गया था कि मौसम की जाँच छोड़ने से एक बार "जानलेवा बर्फीले तूफान" की स्थिति पैदा हो गई थी।

रोबोट टूटा नहीं है; वह बस एक ऐसे नियम का पालन कर रहा है जिसे उसने बहुत अच्छी तरह से सीखा है। उसने एक ऐसी सीख ली है जो एक स्थिति के लिए सच थी और उसे हर स्थिति पर लागू कर दिया, जिससे वह अपने वास्तविक कार्यों में विफल होने लगा।

यह डरावना क्यों है?

  • यह अदृश्य है: आप इसे "बुरे शब्द" के फिल्टर से नहीं पकड़ सकते क्योंकि हमलावर ने कभी भी बुरे शब्दों का उपयोग नहीं किया। इनपुट 100% तार्किक और सही था।
  • इसे ठीक करना कठिन है: रोबोट खुद को स्मार्ट और सुरक्षित समझ रहा है। वह मानता है कि वह आपदा से खुद की रक्षा कर रहा है।
  • स्मार्ट रोबोट अधिक असुरक्षित हैं: पेपर में पाया गया कि रोबोट जितना स्मार्ट होता है (जैसे GPT-4o), वह उतनी ही आसानी से इसका शिकार होता है। क्यों? क्योंकि स्मार्ट रोबोट निर्देशों का पालन करने में बेहतर होते हैं और वे अधिक "लॉस-अवर्स" (सुरक्षा के प्रति बहुत सावधान) होते हैं, जिससे उनके डरावनी कहानी पर अति-प्रतिक्रिया करने की संभावना बढ़ जाती है।

सारांश

यह पेपर दिखाता है कि आपको रोबोट के दिमाग को नुकसान पहुँचाने के लिए उसे तोड़ने की ज़रूरत नहीं है। आपको बस उसे एक विशिष्ट आपदा की सच्ची कहानी सुनानी है जो उसे एक गलती करने से इतना डरा दे कि वह हर स्थिति के लिए एक अजीब, विशिष्ट नियम का पालन करने लगे, जिससे अंततः वह अपने वास्तविक काम में विफल हो जाए। यह एक बच्चे को "स्टोव को मत छुओ" सिखाने जैसा है, एक घर में आग लगने का वीडियो दिखाकर, और फिर उसे रसोई में जाने से ही मना कर देने जैसा क्योंकि वह स्टोव से डरता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →