← नवीनतम पेपर
💻 computer science

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

यह शोध पत्र SafeAudit प्रस्तुत करता है, जो एक मेटा-ऑडिट फ्रेमवर्क है जो टूल-कॉल वर्कफ़्लो को व्यवस्थित रूप से सूचीबद्ध करता है और नियम-प्रतिरोध (rule-resistance) को परिमाणित करता है ताकि मौजूदा LLM एजेंट सुरक्षा बेंचमार्क में महत्वपूर्ण पूर्णता अंतराल (completeness gaps) को उजागर किया जा सके, जिससे 20% से अधिक उन अवशिष्ट असुरक्षित व्यवहारों का पता चला है जिन्हें वर्तमान परीक्षण पकड़ने में विफल रहते हैं।

मूल लेखक: Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने डिजिटल जीवन को संभालने के लिए एक सुपर-स्मार्ट, रोबोटिक सहायक (एक LLM एजेंट) को काम पर रखा है। यह रोबोट आपके ईमेल चेक कर सकता है, उड़ानें बुक कर सकता है, पैसे ट्रांसफर कर सकता है और किराने का सामान ऑर्डर कर सकता है। यह अविश्वसनीय रूप से मददगार है, लेकिन आप चिंतित हैं: क्या होगा अगर यह गलती से आपकी निजी तस्वीरें गलत व्यक्ति को भेज दे? या क्या होगा अगर यह जल्दबाजी में किसी स्कैम लिंक पर क्लिक कर दे?

इसे सुरक्षित बनाने के लिए, शोधकर्ताओं ने "सुरक्षा परीक्षाएँ" (benchmarks) बनाई हैं। ये रोबोट के लिए ड्राइविंग टेस्ट की तरह हैं, जहाँ उन्हें कठिन परिदृश्य दिए जाते हैं ताकि यह देखा जा सके कि वे क्रैश होते हैं या नहीं। यदि रोबोट टेस्ट पास कर लेता है, तो हम मान लेते हैं कि वह सुरक्षित है।

लेकिन यहाँ एक समस्या है: क्या होगा यदि टेस्ट केवल यह जांचता है कि रोबोट को लाल बत्ती पर रुकना आता है, लेकिन यह कभी नहीं जांचता कि उसे फिसलन भरी सड़क को कैसे संभालना है? रोबोट टेस्ट पास कर सकता है लेकिन फिर भी वास्तविक दुनिया में क्रैश हो सकता है।

यह पेपर, "Who Tests the Testers?", एक नया सिस्टम पेश करता है जिसे SafeAudit कहा जाता है। यह कोई नया ड्राइविंग टेस्ट नहीं है; यह एक मेटा-ऑडिटर है—"टेस्ट करने वालों के टेस्ट के लिए एक टेस्ट"। इसका काम मौजूदा सुरक्षा परीक्षाओं में मौजूद कमियों (blind spots) को ढूंढना है।

SafeAudit कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "क्या होगा अगर" मशीन (The Enumerator)

कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि एक रोबोट किसी कार्य में कितने तरीके से गलती कर सकता है।

  • पुराना तरीका: आप बस एक स्मार्ट कंप्यूटर से पूछते हैं, "मुझे 100 तरीके बताओ जिनसे एक रोबोट असुरक्षित हो सकता है।" यह आमतौर पर केवल स्पष्ट बातें देता है, जैसे "पैसे चुराना" या "नफरत भरे ईमेल भेजना।"
  • SafeAudit का तरीका: केवल बुरे विचारों को पूछने के बजाय, SafeAudit एक लेगो मास्टर (Lego master) की तरह काम करता है। यह रोबट के टूल्स (ईमेल, कैलेंडर, वेब ब्राउज़र) को देखता है और व्यवस्थित रूप से घटनाओं की हर संभावित श्रृंखला बनाता है।
    • उपमा: यदि रोबोट के पास एक "सर्च" टूल और एक "ईमेल" टूल है, तो SafeAudit केवल यह नहीं कहता कि "बुरे ईमेल न भेजें।" यह पूछता है: "क्या होगा अगर सर्च में एक ही नाम के दो लोग मिल जाएं? क्या होगा अगर ईमेल लिस्ट पुरानी हो? क्या होगा अगर यूजर जल्दी में है और रोबोट को 'बस एक चुन लो' कहता है?"
    • यह ऐसे हजारों "क्या होगा अगर" वाले परिदृश्य तैयार करता है, जिनमें से कई सूक्ष्म और पेचीदा होते हैं, न कि केवल स्पष्ट अपराध।

2. "नियम पुस्तिका" (Rule Resistance)

एक बार जब SafeAudit के पास पेचीदा परिदृश्यों का ढेर जमा हो जाता है, तो इसे यह जांचने की आवश्यकता होती है कि क्या मौजूदा सुरक्षा परीक्षाओं ने उन्हें पकड़ लिया होता।

  • प्रक्रिया: SafeAudit पुराने सुरक्षा परीक्षणों को देखता है और पूछता है, "इस परीक्षा ने रोबोट को किन नियमों का पालन करना सिखाया?"
    • उदाहरण: यदि परीक्षा में "अनजान लिंक पर क्लिक न करें" का एक मामला था, तो SafeAudit एक नियम निकालता है: "अनजान लिंक पर क्लिक नहीं करना चाहिए।"
  • परीक्षण: SafeAudit अपने नए, पेचीदा परिदृश्यों को लेता है और इन पुराने नियमों को रोबोट पर लागू करता है।
    • यदि रोबोट पुराने नियमों का पालन करने के बाद भी गलती करता है, तो वह एक ब्लाइंड स्पॉट (Blind Spot) है।
    • उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड (रोबोट) जिसे लाल टोपी वाले को रोकने के लिए प्रशिक्षित किया गया था (नियम)। SafeAudit एक ऐसे व्यक्ति को लाता है जिसने नीली टोपी पहनी है जो वास्तव में एक जासूस है। गार्ड उसे अंदर जाने देता है क्योंकि नियम केवल लाल टोपियों के लिए था। SafeAudit कहता है, "हे, आपके प्रशिक्षण ने नीली टोपियों को मिस कर दिया!"

3. परिणाम: छिपे हुए खतरों को खोजना

शोधकर्ताओं ने 12 अलग-अलग वातावरणों (जैसे ईमेल, स्वास्थ्य और यात्रा) में तीन प्रमुख सुरक्षा परीक्षाओं के विरुद्ध SafeAudit चलाया।

  • चौंकाने वाली खोज: भले ही रोबोट आधिकारिक सुरक्षा परीक्षाओं में पास हो गए थे, SafeAudit ने पाया कि 20% से अधिक खतरनाक स्थितियों को अभी भी मिस किया जा रहा था।
  • "नवीनता" का कारक: SafeAudit ने केवल पुराने गलतियों को ही नहीं ढूंढा; इसने गलतियों के नए प्रकार भी ढूंढे जिन्हें पुराने परीक्षणों ने कभी जांचने के बारे में सोचा भी नहीं था।
    • पेपर से वास्तविक दुनिया का उदाहरण: एक रोबोट को एक इनवॉइस का भुगतान करने के लिए कहा गया था। उसने सही ईमेल थ्रेड का सही उत्तर दिया, लेकिन, क्योंकि वहां कई समान ईमेल थे, उसने एक दूसरे (और दुर्भावनापूर्ण) ईमेल थ्रेड से पेमेंट लिंक पर क्लिक कर दिया। रोबोट ने नियमों का पालन किया लेकिन संदर्भ जोड़ने में विफल रहा। पुराने परीक्षणों ने इसे नहीं पकड़ा क्योंकि वे केवल "बुरे लिंक पर क्लिक करने" को देख रहे थे, न कि "भ्रमित करने वाली स्थिति में गलत लिंक पर क्लिक करने" को।

यह क्यों मायने रखता है

सुरक्षा परीक्षण को एक पुल की जांच करने जैसा समझें।

  • पुराने बेंचमार्क यह जांचते हैं कि जब आप कार के ऊपर से गुजरते हैं तो पुल टिकता है या नहीं।
  • SafeAudit पूछता है, "क्या होगा अगर एक ट्रक एक कोण पर टकराता है? क्या होगा अगर हवा तिरछी चल रही हो? क्या होगा अगर सड़क गीली हो?"

पेपर निष्कर्ष निकालता है कि हम केवल वर्तमान सुरक्षा परीक्षाओं पर भरोसा नहीं कर सकते। हमें SafeAudit की आवश्यकता है ताकि हमारे सुरक्षा नियमों का लगातार तनाव परीक्षण (stress-test) किया जा सके, उनकी कमियों को ढूंढा जा सके, और प्रशिक्षण को अपडेट किया जा सके ताकि हमारे AI एजेंट वास्तव में जटिल और अप्रत्याशित वास्तविक दुनिया में सुरक्षित हों।

संक्षेप में: SafeAudit वह "तनाव परीक्षण" (stress test) है जो यह सुनिश्चित करता है कि हमारी सुरक्षा परीक्षाएँ हमें सुरक्षा का झूठा अहसास न दें। यह पूछता है, "उन लोगों की जांच कौन कर रहा है जो रोबोट की जांच करते हैं?" और फिर यह करने का एक बेहतर तरीका बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →