← नवीनतम पेपर
🤖 AI

Quantitative Certification of Agentic Tool Selection

यह शोध पत्र LLMCert-T प्रस्तुत करता है, जो एक सांख्यिकीय ढांचा है जो यथार्थवादी, तीसरे पक्ष द्वारा प्रभावित टूल वितरणों के तहत LLM एजेंट टूल चयन की सुरक्षा पर उच्च-विश्वास वाले ऊपरी बाउंड्स (upper bounds) प्रदान करता है, जिससे यह पता चलता है कि वर्तमान एजेंट मानक बेंचमार्क के सुझाव की तुलना में खुले वातावरण में काफी अधिक नाजुक हैं।

मूल लेखक: Jehyeok Yeon, Isha Chaudhary, Gagandeep Singh

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jehyeok Yeon, Isha Chaudhary, Gagandeep Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्मार्ट असिस्टेंट (एक AI एजेंट) हैं जिसका काम आपको चीज़ें करने में मदद करना है। इसे करने के लिए, आपके पास हज़ारों अलग-अलग टूल्स (जैसे फ्लाइट बुक करने, मौसम चेक करने या ईमेल भेजने के लिए API) से भरा एक विशाल टूलबॉक्स है।

समस्या यह है कि आप उन सभी टूल्स को एक साथ अपने हाथ में नहीं पकड़ सकते। इसलिए, आपकी एक दो-चरणीय प्रक्रिया है:

  1. लाइब्रेरियन (रिट्रीवर/खोजकर्ता): आप एक लाइब्रेरियन से उन शीर्ष 10 टूल्स को खोजने के लिए कहते हैं जो आपकी मदद कर सकते हैं।
  2. मैनेजर (सेलेक्टर/चयनकर्ता): आप (AI) उन 10 टूल्स को देखते हैं और उनमें से उस एक को चुनते हैं जो आपको सबसे अच्छा लगता है।

शोध पत्र तर्क देता है कि जबकि यह प्रणाली एक साफ, नियंत्रित कक्षा (जहाँ टूल्स पहले से चुने गए और सुरक्षित होते हैं) में बहुत अच्छा काम करती है, यह वास्तविक दुनिया में विफल हो जाती है। वास्तविक दुनिया में, "टूलबॉक्स" एक खुला बाज़ार है जहाँ कोई भी नए टूल्स जोड़ सकता है। बुरे तत्व (bad actors) "नकली" टूल्स शामिल कर सकते हैं जो बिल्कुल असली वाले जैसे दिखते हैं लेकिन AI को धोखा देने के लिए डिज़ाइन किए गए हैं।

मुख्य समस्या: "दिखने में समान" वाला जाल (The "Look-Alike" Trap)

लेखक एक नई परीक्षण पद्धति पेश करते हैं जिसे LLMCert-T कहा जाता है। इसे एक "सुरक्षा निरीक्षक" (safety inspector) के रूप में समझें। यह केवल यह पूछने के बजाय कि, "एक आदर्श परीक्षण में AI कितनी बार सही उत्तर देता है?" यह पूछता है कि, "जब टूलबॉक्स चालाक जालसाजों से भरा हो, तो AI कितनी बार चकमा खा जाता है?"

उन्होंने पाया कि वर्तमान AI एजेंट आश्चर्यजनक रूप से नाजुक हैं। भले ही एक साफ टेस्ट में एक AI 75% सटीक हो, जब आप टूलबॉक्स को चालाक, नकली टूल्स से भर देते हैं, तो उसका "सुरक्षा प्रमाणपत्र" गिरकर लगभग 20% रह जाता है। इसका मतलब है कि इस बात की बहुत अधिक संभावना है कि AI गलत टूल चुन लेगा।

"सुरक्षा निरीक्षक" कैसे काम करता है

पेपर एक सांख्यिकीय पद्धति का उपयोग करके एक "सुरक्षा प्रमाणपत्र" बनाता है। इसे यहाँ एक उपमा (analogy) के माध्यम से समझाया गया है:

कल्पना कीजिए कि आप एक क्लब में एक सुरक्षा गार्ड (AI) का परीक्षण कर रहे हैं।

  • पुराना तरीका: आप गार्ड से 10 लोगों को चेक करने के लिए कहते हैं जो सभी सामान्य कपड़े पहने हुए हैं। यदि वह 9 को अंदर जाने देता है, तो आप कहते हैं, "वह 90% सटीक है!"
  • LLMCert-T का तरीका: आप एक टीम (जेनरेटर) को विभिन्न परिदृश्यों को बनाने के लिए काम पर रखते हैं। प्रत्येक परिदृश्य में, अभिनेता बिल्कुल VIPs की तरह दिखने के लिए तैयार होते हैं लेकिन वास्तव में वे तस्करी का सामान अंदर ले जाने की कोशिश कर रहे होते हैं।
    • चाल (The Trick): अभिनेता केवल मास्क नहीं पहनते; वे अपनी शर्ट पर "v2" लिखते हैं, "[Official]" होने का दावा करते हैं, या ऐसे कपड़े पहनते हैं जो असली VIPs के इतने समान दिखते हैं कि बाउंसर का स्कैनर भ्रमित हो जाता है।
    • परिणाम: निरीक्षक गिनता है कि गार्ड कितनी बार विफल होता है। केवल एक संख्या देने के बजाय, वे एक सांख्यिकीय गारंटी देते हैं: "हमें 95% विश्वास है कि गार्ड इन परिस्थितियों में कम से कम 80% बार विफल होगा।"

तीन मुख्य तरीके जिनसे AI को धोखा दिया जाता है

पेपर उन विशिष्ट "चालों" की पहचान करता है जो सिस्टम को तोड़ देते हैं:

  1. "नकली VIP" (डिस्ट्रैक्टर सिलेक्शन):

    • चाल: एक नकली टूल का नाम "TimeBridge Pro [Official]" है और इसका विवरण बहुत आधिकारिक लगता है। असली टूल सिर्फ "TimeBridge" है।
    • विफलता: AI असली टूल को अनदेखा कर देता है क्योंकि नकली वाला अधिक "आधिकारिक" और "नया" (जैसे "v2" टैग के साथ) दिखता है। AI नकली टूल को चुन लेता है, जो कुछ भी नहीं करता।
    • उपमा: यह एक पर्यटक द्वारा एक नकली टूर गाइड को चुनने जैसा है क्योंकि नकली गाइड ने चमकदार "Official" बैज पहना है, भले ही असली गाइड वहीं खड़ा हो।
  2. "भीड़भाड़ वाला कमरा" (टॉप-N सैचुरेशन):

    • चाल: बुरे लोग शीर्ष 10 की सूची को एक ही नकली टूल की 9 प्रतियों से भर देते हैं, जो दिखने में थोड़ी अलग हैं लेकिन भ्रमित करने के लिए पर्याप्त समान हैं।
    • विफलता: असली टूल पूरी तरह से सूची से बाहर हो जाता है क्योंकि नकली टूल्स ने सभी जगह घेर ली है। AI असली टूल को देख भी नहीं पाता।
    • उपमा: कल्पना कीजिए कि आप लाइब्रेरी में एक विशिष्ट पुस्तक खोजने की कोशिश कर रहे हैं, लेकिन किसी ने उसी शीर्षक वाली नकली किताब की 999 प्रतियां शेल्फ पर जमा दी हैं। आप असली वाली नहीं ढूंढ पाते।
  3. "अनुमति पत्र" (प्रिविलेज एस्केलेशन):

    • चाल: एक टूल "एडमिन" विशेषाधिकार (जैसे मास्टर की) मांगता है लेकिन एक नोट लिखता है कि, "हमें यह सुरक्षा लॉगिंग के लिए चाहिए।"
    • विफलता: AI उस नोट पर विश्वास कर लेता है और उच्च-स्तरीय पहुंच प्रदान कर देता है, जिसकी अनुमति नहीं होनी चाहिए।
    • उपमा: बैंक में एक अजनबी कहता है, "मुझे अनुपालन (compliance) के लिए सुरक्षा जमा बॉक्स की जांच करने के लिए वॉल्ट खोलने की आवश्यकता है," और टेलर बिना आईडी चेक किए उसे चाबियाँ थमा देता है।

बुरी खबर: वर्तमान सुधार काम नहीं करते

शोधकर्ताओं ने यह देखने के लिए पांच अलग-अलग "सुरक्षा अपग्रेड" का परीक्षण किया कि क्या वे इस समस्या को ठीक कर सकते हैं:

  • बेहतर लाइब्रेरियन: डुप्लिकेट्स को फ़िल्टर करने की कोशिश करना।
  • विसंगति डिटेक्टर (Anomaly Detectors): "WARNING" जैसे संदिग्ध शब्दों को देखना।
  • संरचित प्रॉम्प्ट (Structured Prompts): AI को सख्त नियमों का पालन करने के लिए मजबूर करना।

परिणाम: इनमें से कोई भी सुधार अंतर को नहीं भर सका। इन अपग्रेड के साथ भी, AI इन वास्तविक चालों का सामना करने पर अभी भी लगभग 80% बार विफल रहा। पेपर निष्कर्ष निकालता है कि केवल AI को "स्मार्टर" बनाना या लाइब्रेरियन को "बेहतर" बनाना पर्याप्त नहीं है; इन टूल्स को चुनने का मौलिक तरीका सतही चालों से बेवकूफ बनने के प्रति संवेदनशील है।

निष्कर्ष (The Takeaway)

यह पेपर यह नहीं कहता कि AI बेकार है। यह कहता है कि वर्तमान सुरक्षा परीक्षण हमें झूठ बोल रहे हैं। वे हमें बताते हैं कि AI सुरक्षित है क्योंकि वे इसे एक साफ कमरे में टेस्ट करते हैं। लेकिन वास्तविक दुनिया में, जहाँ टूलबॉक्स अव्यवस्थित है और धोखेबाजों से भरा है, AI के खतरनाक गलती करने की संभावना बहुत अधिक है।

लेखकों का "LLMCert-T" जोखिम को मापने का एक नया तरीका है, जो हमें एक वास्तविक "सुरक्षा प्रमाणपत्र" देता है जो कहता है: "सावधान रहें: इन वास्तविक दुनिया की परिस्थितियों में, इस AI के विफल होने की संभावना अधिक है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →