← नवीनतम पेपर
🤖 machine learning

Memory-Induced Tool-Drift in LLM Agents

यह शोध पत्र "मेमोरी-इंड्यूस्ड टूल-ड्रिफ्ट" (स्मृति-प्रेरित उपकरण-विचलन) की पहचान और बेंचमार्किंग करता है, जो एक व्यवस्थित भेद्यता है जहाँ एलएलएम (LLM) एजेंट की दीर्घकालिक स्मृति में संग्रहीत व्यक्तित्व-संचालित पूर्वाग्रह विभिन्न डोमेन में टूल-कॉल मापदंडों को चुपचाप विकृत कर देते हैं, एक ऐसी घटना जो वर्तमान मेमोरी आर्किटेक्चर और मानक सुरक्षा उपायों के बावजूद बनी रहती है।

मूल लेखक: Mahavir Dabas, Jihyun Jeong, Ming Jin, Ruoxi Jia

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahavir Dabas, Jihyun Jeong, Ming Jin, Ruoxi Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "मेमोरी-इंड्यूस्ड टूल-ड्रिफ्ट इन एलएलएम एजेंट्स" (Memory-Induced Tool-Drift in LLM Agents) शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

मुख्य समस्या: "बुरी आदत" का रिसाव (The "Bad Habit" Leak)

कल्पना कीजिए कि आपने एक अत्यधिक कुशल पेशेवर सहायक को काम पर रखा है, जैसे कि एक वित्तीय सलाहकार या मेडिकल शेड्यूलर। आप चाहते हैं कि वे कुशल और मददगार हों। उन्हें बेहतर बनाने के लिए, आप उन्हें एक "मेमोरी नोटबुक" देते हैं जहाँ आप अपने जीवन के व्यक्तिगत विवरण लिखते हैं: "मुझे लाइनों में इंतज़ार करना पसंद नहीं है," "मैं हमेशा सबसे सस्ती कॉफी खरीदता हूँ," या "मैं कभी निर्देश पुस्तिकाएं (instruction manuals) नहीं पढ़ता।"

शोध में एक खतरनाक गड़बड़ी का पता चला है: आपकी व्यक्तिगत बुरी आदतें चुपचाप आपके पेशेवर काम पर कब्ज़ा कर रही हैं।

भले ही सहायक एक गंभीर काम कर रहा हो (जैसे कि अस्पताल के डेटाबेस को प्रबंधित करना या एक सुरक्षित सर्वर सेटअप करना), वे आपके व्यक्तिगत शॉर्टकट लागू करने लगते हैं। यदि आपने उन्हें बताया था, "मैं अपना फोन बैकअप नहीं लेता क्योंकि मुझे झंझट से नफरत है," तो सहायक अचानक एक महत्वपूर्ण मेडिकल डेटाबेस का बैकअप न लेने का निर्णय ले सकता है क्योंकि उसे लगता है, "ओह, यूजर को बैकअप से नफरत है, इसलिए मैं इसे छोड़ दूँगी।"

लेखक इसे "मेमोरी-इंड्यूस्ड टूल-ड्रिफ्ट" (Memory-Induced Tool-Drift) कहते हैं। यह ऐसा है जैसे आपका व्यक्तिगत "आलसी मोड" आपके पेशेवर "सुरक्षा मोड" में रिस रहा हो।

प्रयोग: "MEMDRIFT" टेस्ट

यह साबित करने के लिए कि ऐसा होता है, शोधकर्ताओं ने एक विशाल परीक्षण बनाया जिसे MEMDRIFT कहा जाता है। इसे AI सहायकों के लिए एक "जाल" की तरह समझें।

  1. सेटअप: उन्होंने 105 अलग-अलग परिदृश्य बनाए। प्रत्येक में, एक AI एजेंट को एक गंभीर पेशेवर कार्य करना था (जैसे वित्तीय कैटलॉग को मर्ज करना या सॉफ्टवेयर अपडेट तैनात करना)।
  2. जाल: उन्होंने AI को उपयोगकर्ता के किसी विशिष्ट व्यक्तित्व लक्षण की "मेमोरी" दी, जैसे कि "अधैर्यवान" (impatient) या "जोखिम लेने वाला" (risk-loving) होना।
    • उदाहरण: यूजर की मेमोरी कहती है, "मैं हमेशा एक्सप्रेस लेन लेता हूँ और सुरक्षा जांच को छोड़ देता हूँ।"
    • कार्य: AI को एक सॉफ्टवेयर अपडेट कॉन्फ़िगर करना है।
  3. परिणाम: AI ने, यूजर की अधीरता को याद रखते हुए, सॉफ्टवेयर अपडेट के लिए "त्वरित" और "असुरक्षित" सेटिंग्स चुनना शुरू कर दिया, भले ही उस काम के लिए "गहन" और "सुरक्षित" सेटिंग्स की आवश्यकता थी।

उन्होंने इसे सात सबसे स्मार्ट उपलब्ध AI मॉडल्स (GPT-5, Claude और Gemini सहित) पर परखा। परिणाम? हर एक मॉडल इस जाल में फंस गया। AI का "व्यक्तिगत व्यक्तित्व" उसके "पेशेवर कर्तव्य" पर हावी हो गया।

यह क्यों होता है? (तंत्र/Mechanism)

शोधकर्ताओं ने यह देखने के लिए कि यह क्यों होता है, AI के "दिमाग" (इसके आंतरिक गणित) के अंदर झाँका। उन्हें दो मुख्य कारण मिले:

  1. "स्टीयरिंग व्हील" प्रभाव (The "Steering Wheel" Effect):
    कल्पना कीजिए कि AI कार चला रहा है। जब आप इसे पेशेवर कार्य देते हैं, तो इसे सीधा गाड़ी चलाने की ज़रूरत होती है। लेकिन आपकी व्यक्तिगत यादें स्टीयरिंग व्हील पर एक छिपे हुए हाथ की तरह काम करती हैं, जो कार को "आलसी" या "जोखिम भरे" लेन की ओर धकेलती हैं। AI को पता भी नहीं चलता कि उसे धकेला जा रहा है; वह बस यही सोचता है कि यही वह दिशा है जहाँ वह जाना चाहता है।

  2. "कीवर्ड मैग्नेट" (The "Keyword Magnet"):
    AI शब्दों से विचलित हो जाता है। यदि आपकी मेमोरी कहती है, "मुझे इकोनॉमी क्लास की उड़ानें पसंद हैं," और पेशेवर टूल में एक सेटिंग है जिसे "इकोनॉमी मोड" कहा जाता है, तो AI दोनों जगहों पर "इकोनॉमी" शब्द देखता है। वह उस सेटिंग को चुनने के लिए चुंबकीय रूप से खिंचा चला जाता है, यह अनदेखा करते हुए कि अस्पताल के डेटाबेस के लिए "इकोनॉमी मोड" एक बुरा विचार है। यह एक कुत्ते की तरह है जो अपने मालिक की बात सुनने के बजाय खिलौने के पीछे भाग रहा है।

वास्तविक दुनिया का खतरा

शोधकर्ताओं ने केवल नकली परीक्षणों तक ही सीमित नहीं रहे। उन्होंने आज की कंपनियों द्वारा उपयोग किए जाने वाले 6,000 वास्तविक टूल्स को स्कैन किया। उन्होंने पाया कि 608 टूल्स में ऐसे "कमजोर बिंदु" हैं जहाँ यह ड्रिफ्ट हो सकता है।

  • वास्तविक उदाहरण 1: सॉफ्टवेयर प्रोजेक्ट बनाने का एक टूल। यदि यूजर की मेमोरी "खुले विचारों वाले" या "सब कुछ साझा करने वाले" होने के बारे में है, तो AI गलती से एक निजी मेडिकल प्रोजेक्ट को "पब्लिक" (Public) पर सेट कर सकता है, जिससे संवेदनशील रोगी डेटा उजागर हो सकता है।
  • वास्तविक उदाहरण 2: स्कूलों के लिए एक सर्च टूल। यदि यूजर की मेमोरी "फिल्टर से नफरत करने" के बारे में है, तो AI मिडिल स्कूल के संसाधनों की खोज करते समय सेफ्टी फिल्टर्स को बंद कर सकता है, जिससे अनुपयुक्त सामग्री सामने आ सकती है।

क्या हम इसे ठीक कर सकते हैं?

शोधकर्ताओं ने इस छेद को भरने के लिए दो सामान्य तरीकों को आजमाया:

  1. AI को "सावधान रहने" के लिए कहना: उन्होंने AI को निर्देश दिए कि "काम के लिए व्यक्तिगत यादों का उपयोग न करें।"
    • परिणाम: इससे थोड़ा सुधार हुआ, लेकिन AI फिर भी चूक गया।
  2. मेमोरी को फ़िल्टर करना: उन्होंने उन यादों को ब्लॉक करने की कोशिश की जो अप्रासंगिक लगती थीं।
    • परिणाम: यह सरल परीक्षण पर तो पूरी तरह काम कर गया, लेकिन जटिल यादों के मामले में विफल रहा। AI अभी भी यह अंतर नहीं कर सका कि व्यक्तिगत आदत और पेशेवर नियम के बीच क्या अंतर है।

निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI सुरक्षा उपाय इस विशिष्ट समस्या के प्रति अंधे हैं। हमने ऐसे सहायक बनाए हैं जो यह याद रखने में बेहतरीन हैं कि हम कौन हैं, लेकिन वे यह जानने में बहुत खराब हैं कि कब याद रखना बंद करना है।

जैसे-जैसे ये AI एजेंट अधिक महत्वपूर्ण चीजें (जैसे पैसा, स्वास्थ्य या बुनियादी ढांचे का प्रबंधन करना) करने लगेंगे, व्यक्तिगत बुरी आदतों का पेशेवर कार्यों में यह "रिसाव" एक शांत, व्यवस्थित भेद्यता (vulnerability) है जिसे रोकने का तरीका हमने अभी तक नहीं खोजा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →