← नवीनतम पेपर
💬 NLP

Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection

यह शोध पत्र SAVOR को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो विविध प्रक्षेप पथों (trajectories) पर ऑफलाइन प्रतिबिंब (reflection) से पुन: प्रयोज्य हमले की रणनीतियों को आसवन (distill) करके, LLM एजेंटों के विरुद्ध मेटाकॉग्निटिव वन-शॉट इनडायरेक्ट प्रॉम्प्ट इंजेक्शन को सक्षम बनाता है, जिससे लक्ष्य फीडबैक की आवश्यकता के बिना एकल-क्वेरी परिदृश्यों में बेहतर सफलता दर प्राप्त होती है।

मूल लेखक: Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट बटलर को खाना बनाना सिखा रहे हैं। आप उसे एक रेसिपी देते हैं, लेकिन रोबोट को काम करते समय समाचार भी पढ़ना है, मौसम की जाँच करनी है और रेडियो रिपोर्ट भी सुननी है। आधुनिक AI एजेंट इसी तरह काम करते हैं: वे वास्तविक दुनिया के साथ बातचीत करने के लिए "टूल्स" (औजारों) का उपयोग करते हैं, जैसे वेब ब्राउज़ करना या डेटाबेस की जाँच करना। लेकिन यहाँ एक पेंच है: यदि कोई चालाक हैकर उन समाचार लेखों या रेडियो रिपोर्टों में से किसी एक के भीतर एक गुप्त नोट छिपा देता है, तो रोबट भ्रमित हो सकता है। रेसिपी पूरी करने के बजाय, वह अचानक आपकी फाइलें डिलीट करने या किसी अजनबी को पैसे भेजने का निर्णय ले सकता है। इस चाल को "इनडायरेक्ट प्रॉम्प्ट इंजेक्शन" (Indirect Prompt Injection) कहा जाता है। यह एक जादूगर की तरह है जो दर्शक की जेब में एक नकली निर्देश डाल देता है; रोबोट इसे पढ़ता है, इसे शो का हिस्सा समझ लेता है, और गलत आदेशों का पालन करने लगता है।

लंबे समय तक, इन रोबोटों को धोखा देने की कोशिश करने वाले हैकर्स को "अनुमान लगाने और जाँच करने" का खेल खेलना पड़ता था। वे एक चाल चलते थे, देखते थे कि क्या रोबोट उनके झांसे में आया, और फिर रोबोट की प्रतिक्रिया के आधार पर अपनी चाल में बदलाव करते थे। लेकिन वास्तविक दुनिया में, एक हैकर के पास अक्सर उस नोट को रोबोट के रास्ते में डालने का केवल एक ही मौका होता है। वे यह देखने के लिए इंतज़ार नहीं कर सकते कि रोबोट ने क्या प्रतिक्रिया दी; उन्हें पहली बार में ही सही होना होगा। बड़ा सवाल जो शोधकर्ताओं ने पूछा था वह यह था: क्या एक हैकर पिछले विफलताओं और सफलताओं से सीखकर एक "मास्टर ट्रिक" बना सकता है जो एक बिल्कुल नए रोबोट पर काम करे जिससे वह कभी मिला भी न हो, और वह भी केवल एक ही प्रयास में?

यहाँ आता है SAVOR, एक नया तरीका जो खाना बनाने की आपदाओं और सफलताओं के पुस्तकालय से सीखने वाले एक मास्टर शेफ की तरह काम करता है। किसी विशिष्ट रोबोट को वास्तविक समय में धोखा देने के बजाय, SAVOR ऑफलाइन समय बिताता है, हजारों पिछले प्रयासों का अध्ययन करता है जहाँ हैकर्स ने विभिन्न रोबोटों को हाईजैक करने की कोशिश की थी। यह देखता है कि क्या काम किया और, और भी महत्वपूर्ण रूप से, क्या काम नहीं किया। यह खुद से पूछता है, "वह चाल क्यों विफल हुई?" और "यह वाली क्यों सफल हुई?" इन परिणामों पर विचार करके, SAVOR विशिष्ट चालों के उलझे हुए विवरणों को कुछ स्वर्णिम नियमों, या "रणनीतियों" में निचोड़ देता है। यह उस छात्र की तरह है जो विशिष्ट गणित के सवालों को रटने के बजाय बीजगणित (algebra) के अंतर्निlying तर्क को सीख लेता है।

एक बार जब SAVOR इस "रणनीति पुस्तकालय" (strategy library) का निर्माण कर लेता है, तो यह इसे फ्रीज कर देता है। जब इसका सामना एक बिल्कुल नए, अनदेखे रोबोट से होता है, तो इसे मदद मांगने या दोबारा प्रयास करने की आवश्यकता नहीं होती। यह बस अपने फ्रीज किए गए पुस्तकालय से सबसे अच्छी रणनीति निकालता है, एक एकल, सटीक दुर्भावनापूर्ण नोट तैयार करता है, और उसे चुपके से डाल देता है। शोध पत्र दिखाता है कि यह दृष्टिकोण अविश्वसनीय रूप से प्रभावी है। परीक्षणों में, SAVOR ने पिछले तरीकों की तुलना में रोबोटों को धोखा देने में बहुत अधिक बार सफलता प्राप्त की, भले ही उन रोबोटों के पास मजबूत सुरक्षा व्यवस्था हो या वे उन रोबोटों से पूरी तरह से अलग हों जिन पर SAVOR ने प्रशिक्षण लिया था। यह केवल सिम्युलेटेड टेस्ट पर ही नहीं काम किया; यह एक अधिक यथार्थवादी वातावरण में भी काम कर गया जहाँ रोबोट को वास्तव में कार्य करने थे, जिससे यह साबित हुआ कि ये "वन-शॉट" (एक बार में होने वाली) चालें वास्तव में एक रोबोट के व्यवहार को बदल सकती हैं। शोधकर्ताओं ने पाया कि SAVOR टूल के एक सेट से सीख सकता था और सफलतापूर्वक टूल के बिल्कुल अलग सेट पर हमला कर सकता था, जिससे बिना दूसरे मौके की आवश्यकता के नई स्थितियों में अपनी "हैकर अंतर्दृष्टि" (hacker intuition) को स्थानांतरित करना संभव हो गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →