Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection
यह शोध पत्र SAVOR को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो विविध प्रक्षेप पथों (trajectories) पर ऑफलाइन प्रतिबिंब (reflection) से पुन: प्रयोज्य हमले की रणनीतियों को आसवन (distill) करके, LLM एजेंटों के विरुद्ध मेटाकॉग्निटिव वन-शॉट इनडायरेक्ट प्रॉम्प्ट इंजेक्शन को सक्षम बनाता है, जिससे लक्ष्य फीडबैक की आवश्यकता के बिना एकल-क्वेरी परिदृश्यों में बेहतर सफलता दर प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट बटलर को खाना बनाना सिखा रहे हैं। आप उसे एक रेसिपी देते हैं, लेकिन रोबोट को काम करते समय समाचार भी पढ़ना है, मौसम की जाँच करनी है और रेडियो रिपोर्ट भी सुननी है। आधुनिक AI एजेंट इसी तरह काम करते हैं: वे वास्तविक दुनिया के साथ बातचीत करने के लिए "टूल्स" (औजारों) का उपयोग करते हैं, जैसे वेब ब्राउज़ करना या डेटाबेस की जाँच करना। लेकिन यहाँ एक पेंच है: यदि कोई चालाक हैकर उन समाचार लेखों या रेडियो रिपोर्टों में से किसी एक के भीतर एक गुप्त नोट छिपा देता है, तो रोबट भ्रमित हो सकता है। रेसिपी पूरी करने के बजाय, वह अचानक आपकी फाइलें डिलीट करने या किसी अजनबी को पैसे भेजने का निर्णय ले सकता है। इस चाल को "इनडायरेक्ट प्रॉम्प्ट इंजेक्शन" (Indirect Prompt Injection) कहा जाता है। यह एक जादूगर की तरह है जो दर्शक की जेब में एक नकली निर्देश डाल देता है; रोबोट इसे पढ़ता है, इसे शो का हिस्सा समझ लेता है, और गलत आदेशों का पालन करने लगता है।
लंबे समय तक, इन रोबोटों को धोखा देने की कोशिश करने वाले हैकर्स को "अनुमान लगाने और जाँच करने" का खेल खेलना पड़ता था। वे एक चाल चलते थे, देखते थे कि क्या रोबोट उनके झांसे में आया, और फिर रोबोट की प्रतिक्रिया के आधार पर अपनी चाल में बदलाव करते थे। लेकिन वास्तविक दुनिया में, एक हैकर के पास अक्सर उस नोट को रोबोट के रास्ते में डालने का केवल एक ही मौका होता है। वे यह देखने के लिए इंतज़ार नहीं कर सकते कि रोबोट ने क्या प्रतिक्रिया दी; उन्हें पहली बार में ही सही होना होगा। बड़ा सवाल जो शोधकर्ताओं ने पूछा था वह यह था: क्या एक हैकर पिछले विफलताओं और सफलताओं से सीखकर एक "मास्टर ट्रिक" बना सकता है जो एक बिल्कुल नए रोबोट पर काम करे जिससे वह कभी मिला भी न हो, और वह भी केवल एक ही प्रयास में?
यहाँ आता है SAVOR, एक नया तरीका जो खाना बनाने की आपदाओं और सफलताओं के पुस्तकालय से सीखने वाले एक मास्टर शेफ की तरह काम करता है। किसी विशिष्ट रोबोट को वास्तविक समय में धोखा देने के बजाय, SAVOR ऑफलाइन समय बिताता है, हजारों पिछले प्रयासों का अध्ययन करता है जहाँ हैकर्स ने विभिन्न रोबोटों को हाईजैक करने की कोशिश की थी। यह देखता है कि क्या काम किया और, और भी महत्वपूर्ण रूप से, क्या काम नहीं किया। यह खुद से पूछता है, "वह चाल क्यों विफल हुई?" और "यह वाली क्यों सफल हुई?" इन परिणामों पर विचार करके, SAVOR विशिष्ट चालों के उलझे हुए विवरणों को कुछ स्वर्णिम नियमों, या "रणनीतियों" में निचोड़ देता है। यह उस छात्र की तरह है जो विशिष्ट गणित के सवालों को रटने के बजाय बीजगणित (algebra) के अंतर्निlying तर्क को सीख लेता है।
एक बार जब SAVOR इस "रणनीति पुस्तकालय" (strategy library) का निर्माण कर लेता है, तो यह इसे फ्रीज कर देता है। जब इसका सामना एक बिल्कुल नए, अनदेखे रोबोट से होता है, तो इसे मदद मांगने या दोबारा प्रयास करने की आवश्यकता नहीं होती। यह बस अपने फ्रीज किए गए पुस्तकालय से सबसे अच्छी रणनीति निकालता है, एक एकल, सटीक दुर्भावनापूर्ण नोट तैयार करता है, और उसे चुपके से डाल देता है। शोध पत्र दिखाता है कि यह दृष्टिकोण अविश्वसनीय रूप से प्रभावी है। परीक्षणों में, SAVOR ने पिछले तरीकों की तुलना में रोबोटों को धोखा देने में बहुत अधिक बार सफलता प्राप्त की, भले ही उन रोबोटों के पास मजबूत सुरक्षा व्यवस्था हो या वे उन रोबोटों से पूरी तरह से अलग हों जिन पर SAVOR ने प्रशिक्षण लिया था। यह केवल सिम्युलेटेड टेस्ट पर ही नहीं काम किया; यह एक अधिक यथार्थवादी वातावरण में भी काम कर गया जहाँ रोबोट को वास्तव में कार्य करने थे, जिससे यह साबित हुआ कि ये "वन-शॉट" (एक बार में होने वाली) चालें वास्तव में एक रोबोट के व्यवहार को बदल सकती हैं। शोधकर्ताओं ने पाया कि SAVOR टूल के एक सेट से सीख सकता था और सफलतापूर्वक टूल के बिल्कुल अलग सेट पर हमला कर सकता था, जिससे बिना दूसरे मौके की आवश्यकता के नई स्थितियों में अपनी "हैकर अंतर्दृष्टि" (hacker intuition) को स्थानांतरित करना संभव हो गया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।