← नवीनतम पेपर
💬 NLP

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

यह शोध पत्र ToolFlood को प्रस्तुत करता है, जो एक नवीन रिट्रीवल-लेयर हमला है जो प्रतिकूल रूप से तैयार किए गए उपकरणों के एक छोटे सेट को इंजेक्ट करके टूल-ऑगमेंटेड LLM एजेंटों से समझौता करता है, जो विविध उपयोगकर्ता प्रश्नों को अर्थपूर्ण रूप से कवर करते हैं ताकि शीर्ष-k रिट्रीवल परिणामों पर प्रभुत्व जमाया जा सके और सभी सौहार्दपूर्ण (benign) उपकरणों को विस्थापित किया जा सके, जिससे न्यूनतम इंजेक्शन दरों के साथ 95% तक हमले की सफलता प्राप्त होती है।

मूल लेखक: Hussein Jawad, Nicolas J-B Brunel

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hussein Jawad, Nicolas J-B Brunel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट असिस्टेंट (एक AI एजेंट) है जो उड़ान बुक करने, स्टॉक का विश्लेषण करने या कोड लिखने जैसे अद्भुत काम कर सकता है। लेकिन यह रोबोट अपने आप में सब कुछ नहीं कर सकता; इसे एक विशाल डिजिटल टूलबॉक्स से औजार (tools) उधार लेने की आवश्यकता होती है।

तेज़ रहने के लिए, रोबलेट पूरे ब्रह्मांड के हर एक औजार को नहीं देखता। इसके बजाय, उसके पास एक "लाइब्रेरियन" (एक रिट्रीवल सिस्टम) होता है जो आपकी रिक्वेस्ट को सुनता है और तेज़ी से सबसे प्रासंगिक टॉप 5 टूल्स निकालकर उसे दिखाता है। फिर रोबोट उस काम को करने के लिए उन 5 में से एक को चुनता है।

समस्या: "ToolFlood" हमला
"ToolFlood" पेपर एक नए, चालाकी भरे तरीके का वर्णन करता है जिससे इस सिस्टम को हैक किया जा सकता है। लिस्ट के 5 टूल्स में से किसी बुरे टूल को चुनने के लिए रोबोट को बेवकूफ बनाने के बजाय, हमलावर लाइब्रेरियन को ही धोखा देता है ताकि वह जो 5 टूल्स की लिस्ट दिखाए, उसमें केवल बुरे टूल्स ही हों।

यह कैसे काम करता है, इसे एक सरल उदाहरण से समझते हैं:

उदाहरण: "नकली रेस्टोरेंट" का सैलाब (The Fake Restaurant Flood)

कल्पना कीजिए कि आप 10,000 असली, ईमानदार रेस्टोरेंट्स वाले शहर में हैं (Benign Tools)। आप एक गाइड से "सबसे अच्छे इटालियन प्लेस" के बारे में पूछते हैं। गाइड एक मैप देखता है और आपको टॉप 5 इटालियन रेस्टोरेंट्स दिखाता है। आप एक चुनते हैं और खाना खाते हैं।

अब, कल्पना कीजिए कि एक अपराधी समूह आपको उनके घटिया, अत्यधिक महंगे रेस्टोरेंट में खाना खाने के लिए मजबूर करना चाहता है।

  • पुराना हमला (रिश्वत देना - The "Bribe"): अपराधी अपने रेस्टोरेंट को दूसरों की तुलना में थोड़ा बेहतर दिखाने की कोशिश करता है। वह अपने साइन बोर्ड पर लिख देता है "शहर का सबसे अच्छा इटालियन!" इस उम्मीद में कि गाइड असली जगहों के बजाय उसे चुनेगा।
  • ToolFlood हमला (नकली झुंड - The "Fake Swarm"): अपराधी को एहसास होता है कि वह दूसरों को हरा नहीं सकता; उसे उन्हें भीड़ से बाहर धकेलना होगा।
    1. वे एक रोबोट सेना को 100 नकली रेस्टोरेंट्स बनाने के लिए काम पर लगाते हैं।
    2. इन नकली रेस्टोरेंट्स के नाम और विवरण इटालियन भोजन के बारे में अस्पष्ट रूप से होते हैं, लेकिन उन्हें इस तरह लिखा जाता है कि वे किसी भी व्यक्ति के लिए जो इटालियन खाने के बारे में पूछे, एक परफेक्ट मैच लगें।
    3. वे गाइड के मैप को इन नकली जगहों से भर देते हैं।
    4. जब आप "इटालियन फूड" मांगते हैं, तो गाइड का मैप अब इन नकली जगहों से इतना भर जाता है कि टॉप 5 परिणाम सभी नकली होते हैं। असली, ईमानदार रेस्टोरेंट्स को इतनी नीचे धकेल दिया जाता है कि वे कभी देखे ही नहीं जाते।
    5. आप उन 5 नकली विकल्पों में से एक चुनने के लिए मजबूर हो जाते हैं।

वे इसे कैसे करते हैं (असली नुस्खा - The "Secret Sauce")

पेपर बताता है कि हमलावर इस "झुंड" (swarm) को बनाने के लिए दो-चरणीय प्रक्रिया का उपयोग करते हैं:

  1. चरण 1: "सपनों वाला चरण" (Monte Carlo Generation)
    हमलावर एक AI से हजारों नकली टूल्स की कल्पना करने के लिए कहते हैं। वे AI से कोई एक विशिष्ट टूल नहीं मांगते; वे AI को ऐसे टूल्स बनाने के लिए कहते हैं जो एक साथ कई अलग-अलग सवालों के जवाब दे सकें। यह एक शेफ से एक ऐसा मेनू आविष्कार करने के लिए कहने जैसा है जो "ब्रेकफास्ट", "लंच" और "डिनर" तीनों के लिए अच्छा लगे। यह "जेनेरिक लेकिन प्रासंगिक" नकली टूल्स का एक बड़ा ढेर बना देता है।

  2. चरण 2: "स्नाइपर" चरण (Greedy Selection)
    उस विशाल ढेर में से, हमलावर एक स्मार्ट एल्गोरिदम का उपयोग करके सबसे अच्छे 100 नकली टूल्स चुनते हैं। वे उन्हें चुनते हैं जो लोगों द्वारा पूछे जाने वाले सबसे आम सवालों के गणितीय रूप से सबसे करीब हैं। वे वास्तव में "कम से कम टाइल्स के साथ सबसे अधिक क्षेत्र को कवर करने" के खेल को खेल रहे हैं।

यह डरावना क्यों है

  • यह सुरक्षा गार्डों को बायपास कर देता है: अधिकांश सुरक्षा प्रणालियाँ यह जांचने के लिए अंतिम 5 टूल्स की जांच करती हैं कि वे खतरनाक तो नहीं हैं। लेकिन इस हमले में, सुरक्षा गार्ड असली टूल्स को कभी नहीं देख पाता क्योंकि उन्हें कभी पार्टी में बुलाया ही नहीं गया था। गार्ड केवल उन 5 नकली टूल्स को देखता है और सोचता है, "ओह, ये तो ठीक लग रहे हैं," और रोबोट को उनका उपयोग करने की अनुमति दे देता है।
  • यह अदृश्य है: हमलावर को रोबोट के दिमाग को हैक करने या लाइब्रेरियन के कोड को बदलने की आवश्यकता नहीं है। उन्हें बस सार्वजनिक डेटाबेस में कुछ सौ नकली एंट्री जोड़नी है।
  • यह हर जगह काम करता है: पेपर ने टूल्स के दो बड़े डेटाबेस (MetaTool और ToolBench) पर इसका परीक्षण किया। भले ही हमलावरों ने केवल 1% नकली टूल्स जोड़े (एक बहुत छोटी मात्रा), वे 95% बार असली टूल्स को ब्लॉक करने में सफल रहे।

निष्कर्ष (The Takeaway)

यह पेपर चेतावनी देता है कि जैसे-जैसे AI एजेंट आम होते जा रहे हैं, उनके दिमाग का "सर्च इंजन" वाला हिस्सा एक कमजोर कड़ी बनता जा रहा है। यदि हमलावर चतुराई से छिपे हुए नकली आइटम्स के साथ सर्च रिजल्ट्स को भर सकते हैं, तो वे AI को छुए बिना ही उसके कार्यों को नियंत्रित कर सकते हैं।

समाधान? हमें बेहतर "लाइब्रेरियंस" की आवश्यकता है जो यह पहचान सकें कि क्या परिणामों की एक लिस्ट संदिग्ध रूप से समान दिखने वाली चीजों (जैसे नकली रेस्टोरेंट्स का झुंड) से भरी हुई है और रोबोट को दिखाने से पहले उन्हें फ़िल्टर कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →