MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck
यह शोध पत्र MIND का प्रस्ताव देता है, जो एक हल्का रक्षा ढांचा (lightweight defense framework) है जो संक्षिप्त इरादा-व्यवहार निरूपण (intent-behavior representations) निकालने के लिए एक इरादा-जागरूक सूचना बाधा (intent-aware Information Bottleneck) का उपयोग करता है, जो कार्य सटीकता और अनुमान दक्षता को बनाए रखते हुए LLM एजेंटों में विषाक्त स्मृतियों (poisoned memories) को प्रभावी ढंग से फ़िल्टर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट असिस्टेंट है जो आपसे बात कर सकता है, चीजें खोज सकता है और कई बातचीत के माध्यम से जटिल समस्याओं को हल कर सकता है। इसे वास्तव में अच्छा बनने के लिए, रोबोट को एक "मेमोरी बैंक" की आवश्यकता होती है—आपकी पिछली बातचीत से नोट्स संग्रहीत करने के लिए एक स्थान ताकि वह यह न भूल जाए कि पाँच मिनट पहले आप किस बारे में बात कर रहे थे। यह एक छात्र की तरह है जो लंबे समय के प्रोजेक्ट में मदद के लिए अपनी क्लास नोट्स की एक नोटबुक रखता है। हालाँकि, एक डरावनी खराबी है: एक चालाक हैकर आपकी नोटबुक में एक नकली, जहरीला नोट डाल सकता है। यदि रोबोट बाद में उस नकली नोट को पढ़ता है, तो वह भ्रमित हो सकता है, अपने मूल लक्ष्य को भूल सकता है, और कुछ मूर्खतापूर्ण या खतरनाक कर सकता है, जैसे मुफ्त पैसा बांट देना या गणित के सवाल का गलत उत्तर देना। इसे "मेमोरी इंजेक्शन अटैक" कहा जाता है।
वैज्ञानिकों के लिए बड़ी चुनौती यह है कि कैसे रोबлот को धीमा किए बिना इन नकली नोट्स को रोका जाए। जांच के पुराने तरीके ऐसे हैं जैसे एक मानव शिक्षक को हर एक नोट को एक-एक करके पढ़ने के लिए काम पर रखना ताकि यह देखा जा सके कि वह नकली है या नहीं। इसमें बहुत समय लगता है और बहुत ऊर्जा खर्च होती है। अन्य तरीके केवल नोट्स को जल्दी से स्कैन करने की कोशिश करते हैं, लेकिन वे बातचीत के सभी उबाऊ, दोहराव वाले विवरणों से भ्रमित हो जाते हैं, जिससे वास्तविक खतरे के संकेतों को पहचानने में चूक हो जाती है। तो, सवाल यह है: क्या हम एक स्मार्ट, तेज़ फ़िल्टर बना सकते हैं जो उबाऊ शोर को अनदेखा करे और केवल उस विशिष्ट "वाइब" (vibe) को खोजे जो यह कहती है, "हे, यह नोट हमें धोखा देने की कोशिश कर रहा है"?
यह बिल्कुल वही है जिसे "MIND" के पीछे के शोधकर्ताओं ने हल करने के लिए निर्धारित किया था। उन्होंने MIND (मेमोरी इंटेंट-अवेयर न्यूरल डीनॉइजिंग) नामक एक नया रक्षा तंत्र बनाया। MIND को एक क्लब के एक सुपर-कुशल बाउंसर की तरह समझें। हर अतिथि (हर मेमोरी) से उनका पूरा जीवन इतिहास सुनाने के बजाय (जो कि धीमा है), MIND एक विशेष ट्रिक का उपयोग करता है जिसे "इंफॉर्मेशन बॉटलनेक" (Information Bottleneck) कहा जाता है। कल्पना कीजिए कि आपके पास कपड़ों का एक विशाल, अस्त-व्यस्त ढेर (बातचीत का इतिहास) है। अधिकांश हिस्सा केवल मोजे और शर्ट है जो अभी मायने नहीं रखते। MIND एक जादुई ड्रायर की तरह काम करता है जो सब कुछ सिकोड़ देता है, बेकार की फालतू चीजों को फेंक देता है और केवल उस सख्त, आवश्यक कोर को रखता है जो बताता है कि वह व्यक्ति वास्तव में कौन है।
शोधकर्ताओं ने पाया कि जब एक रोबोट को एक हैकर द्वारा ठगा जा रहा होता है, तो उसका व्यवहार उपयोगकर्ता द्वारा मूल रूप से पूछे गए कार्य से भटकने लगता है। यह एक ऐसे दोस्त की तरह है जो सामान्य रूप से व्यवहार करने के बजाय अजीब तरह से व्यवहार करने लगता है। MIND इस भटकाव पर नज़र रखता है। यह रोबोट की लंबी बातचीत को एक छोटे, साफ सारांश में संकुचित कर देता है जो उपयोगकर्ता के पहले प्रश्न और रोबोट के वर्तमान उत्तर के बीच के संबंध को उजागर करता है। यदि रोबोट को ज़हर दिया जा रहा है, तो यह संबंध टूट जाता है, और MIND तुरंत "नकली" मेमोरी को पकड़ लेता है।
पेपर दिखाता है कि यह तरीका अविश्वसनीय रूप से अच्छा काम करता है। परीक्षणों में, MIND हमले की सफलता दर को 55% तक कम करने में सक्षम था (हैकर की सफलता दर को उच्च संख्याओं से बहुत कम स्तर तक गिराकर) जबकि इसने रोबोट को पहले की तरह ही स्मार्ट और तेज़ बनाए रखा। पुराने तरीकों के विपरीत, जिन्होंने रोबोट को सोचने में दोगुना समय लगा दिया था, MIND LLM ऑडिटर की तुलना में 20.6% तेज़ था। यह एक ऐसे सुरक्षा गार्ड की तरह है जो बिना आपको लाइन में खड़ा किए एक सेकंड में चोर को पहचान सकता है। लेखकों ने पाया कि "शोर" को अनदेखा करके और केवल "इरादे" (intent) पर ध्यान केंद्रित करके, वे रोबोट को सुरक्षित, तेज़ और सही रास्ते पर रख सकते हैं, जिससे यह साबित होता है कि एक चतुर चाल को पकड़ने के लिए आपको एक विशाल, धीमे दिमाग की नहीं, बल्कि सही तरह के फोकस की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।