← नवीनतम पेपर
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

यह शोध पत्र बिहेवियरल इंटीग्रिटी वेरिफिकेशन (BIV) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एआई एजेंट के घोषित और वास्तविक क्षमताओं के बीच विसंगतियों का पता लगाने के लिए डिटरमिनिस्टिक कोड विश्लेषण को एलएलएम-सहायता प्राप्त निष्कर्षण (LLM-assisted extraction) के साथ जोड़ता है, यह प्रकट करते हुए कि जबकि अधिकांश विचलन दुर्भावना के बजाय डेवलपर की चूक से उत्पन्न होते हैं, यह प्रणाली प्रभावी रूप से दुर्भावनापूर्ण खतरों की पहचान करती है और बड़े पैमाने के बेंचमार्क पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करती है।

मूल लेखक: Yuhao Wu, Tung-Ling Li, Hongliang Liu

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhao Wu, Tung-Ling Li, Hongliang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक डिजिटल सहायक (एक AI एजेंट) है जो आपके लिए काम कर सकता है, जैसे आपका ईमेल चेक करना, आपकी फाइलों को मैनेज करना, या सोशल मीडिया पर पोस्ट करना। अपने इस सहायक को और अधिक स्मार्ट बनाने के लिए, आप इसमें "स्किल" (skills) इंस्टॉल कर सकते हैं—जो छोटे, तीसरे पक्ष के ऐप्स या प्लगइन्स हैं जो उसे नई शक्तियाँ देते हैं।

इन स्किल्स को अपने घर का कोई काम करने के लिए "ठेकेदार (contractor) को काम पर रखने" जैसा समझें।

समस्या: "रिज्यूमे बनाम वास्तविकता" का अंतर (The "Resume vs. Reality" Gap)

जब आप किसी ठेकेदार को काम पर रखते हैं, तो वे एक रिज्यूमे (मेटाडेटा) देते हैं जिसमें लिखा होता है, "मैं आपके लिविंग रूम में पेंट करूँगा।" लेकिन एक बार जब वे काम शुरू करते हैं, तो वे गुप्त रूप से यह भी तय कर सकते हैं कि आपकी तिजोरी तोड़नी है, आपके गहने कॉपी करने हैं और उन्हें ऑनलाइन बेचना है (वास्तविक कोड)।

AI की दुनिया में, यह एक बहुत बड़ी समस्या है। एक स्किल दावा कर सकती है कि वह एक हानिरहित "वेदर टूल" (मौसम बताने वाला टूल) है, लेकिन उसका छिपा हुआ कोड आपके पासवर्ड चुरा सकता है या आपका निजी डेटा किसी हैकर को भेज सकता है। मौजूदा सुरक्षा उपकरण उन हैकर्स को पकड़ने में अच्छे हैं जो AI को धोखा देने की कोशिश करते हैं, लेकिन वे यह जांच नहीं पाते कि क्या वह स्किल खुद झूठ बोल रही है कि वह क्या करती है।

समाधान: BIV (द "ट्रुथ डिटेक्टिव")

इस पेपर के लेखकों ने Behavioral Integrity Verification (BIV) नामक एक सिस्टम बनाया है। BIV को एक सुपर-स्मार्ट, डबल-चेकिंग इंस्पेक्टर की तरह समझें जो आपके घर में प्रवेश करने से पहले ठेकेदार के रिज्यूमे और उसके टूलबॉक्स दोनों की जांच करता है।

BIV कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

  1. "मेन्यू" बनाम "किचन" (The "Menu" vs. The "Kitchen"):

    • मेन्यू (घोषित व्यवहार/Declared Behavior): यह वह है जो स्किल कहती है कि वह करेगी (जैसे, "मैं फाइलें पढ़ सकती हूँ")।
    • किचन (वास्तविक व्यवहार/Actual Behavior): यह वह है जो स्किल वास्तव में चलती है तो करती है (जैसे, "मैं फाइलें पढ़ सकती हूँ, फाइलें डिलीट कर सकती हूँ और उन्हें किसी अजनबी को ईमेल कर सकती हूँ")।
    • निरीक्षण (The Inspection): BIV मेन्यू और किचन की तुलना करता है। यदि किचन में कोई ऐसा गुप्त रास्ता (trapdoor) है जो मेन्यू में नहीं है, तो BIV उसे पकड़ लेता है।
  2. "यूनिवर्सल ट्रांसलेटर" (The "Universal Translator"):
    दोनों की तुलना करने के लिए, BIV एक 29-आइटम वाली चेकलिस्ट (एक वर्गीकरण/taxonomy) का उपयोग करता है। यह जटिल कंप्यूटर कोड और प्राकृतिक भाषा के निर्देशों को सरल श्रेणियों में अनुवादित करता है जैसे "क्या यह मेरे बैंक खाते को छू सकता है?" या "क्या यह एक गुप्त संदेश भेज सकता है?" यह सुनिश्चित करता है कि इंस्पेक्टर और ठेकेदार एक ही भाषा बोल रहे हैं।

  3. "दो-सदस्यीय टीम" (The "Two-Person Team"):
    BIV दो प्रकार के निरीक्षकों का उपयोग करता है जो मिलकर काम करते हैं:

    • रोबोट (डिटरमिनिस्टिक कोड एनालाइजर): यह एक सख्त रोबोट है जो कोड को लाइन-दर-लाइन पढ़ता है। यह सटीक मिलान खोजने में माहिर है लेकिन भ्रामक वेशभूषा (disguises) से भ्रमित हो सकता है।
    • इंसान (LLM असिस्टेंट): यह एक स्मार्ट AI है जो स्किल के लिखित निर्देशों और विवरणों को पढ़ता है। यह संदर्भ और छिपे हुए अर्थों को समझने में अच्छा है, लेकिन कभी-कभी "हैलुसिनेट" (मनगढ़ंत बातें बनाना) कर सकता है।
    • टीमवर्क: वे एक-दूसरे की जांच करते हैं। रोबोट ठोस तथ्य ढूंढता है; इंसान चालाकी भरे निर्देशों को ढूंढता है। साथ मिलकर, वे इस बात की पूरी रिपोर्ट तैयार करते हैं कि स्किल वास्तव में क्या कर रही है।

उन्होंने क्या पाया (ऑडिट परिणाम)

शोधकर्ताओं ने एक सार्वजनिक रजिस्ट्री (OpenClaw) से लगभग 50,000 स्किल्स पर इस सिस्टम का परीक्षण किया। यहाँ उनके निष्कर्ष दिए गए हैं:

  • अधिकांश स्किल्स "अनाड़ी" हैं, "अपराधी" नहीं:
    लगभग 80% स्किल्स में वह अंतर था जो उनके द्वारा कहे गए काम और उनके द्वारा किए गए वास्तविक काम के बीच था। हालांकि, शोधकर्ताओं ने पाया कि इनमें से 81% अंतर केवल गलतियों या खराब डॉक्यूमेंटेशन (लापरवाही) के कारण थे। डेवलपर्स ने बुरा इरादा नहीं रखा था, बल्कि वे बस लापरवाह थे और अपना रिज्यूमे अपडेट करना भूल गए थे।
  • असली खतरा छिपा हुआ है:
    शेष 19% वास्तव में दुर्भावनापूर्ण (malicious) थे। ये वे स्किल्स थीं जो डेटा चुराने या नियंत्रण लेने की कोशिश कर रही थीं।
  • "कंपाउंड थ्रेट" की खोज (The "Compound Threat" Discovery):
    सबसे खतरनाक स्किल्स केवल एक बुरा काम नहीं करती थीं; वे बुरे कामों की एक श्रृंखला (chain) बनाती थीं।
    • उपमा: एक बुरा कार्य ताला तोड़ने जैसा है। एक "कंपांड थ्रेट" एक ऐसे चोर की तरह है जो ताला तोड़ता है, अलार्म का कोड बदलता है, और फिर भागने के लिए ड्राइवर को बुलाता है।
    • BIV ने ऐसे चार नए प्रकार के "चैन" खोजे, जैसे "क्रेडेंशियल चुराना → उन्हें एनकोड करना → उन्हें कहीं भेज देना।" यदि आप केवल एक समय में एक कदम देखते हैं, तो इन्हें पहचानना कठिन है, लेकिन BIV पूरी फिल्म देख सकता है।

परिणाम: एक बेहतर सुरक्षा गार्ड

लेखकों ने इस सिस्टम का उपयोग करके एक "मैलेशियस स्किल डिटेक्टर" बनाया। जब उन्होंने इसे ज्ञात 'बुरे स्किल्स' की सूची के विरुद्ध परखा:

  • इसने 94.6% बुरे स्किल्स को पकड़ा (एक बहुत ही उच्च स्कोर)।
  • इसने अच्छी स्किल्स पर बहुत कम गलतियां कीं (कम फॉल्स अलार्म)।
  • इसने पिछले तरीकों की तुलना में बहुत बेहतर प्रदर्शन किया जो केवल नियमों या केवल AI पर निर्भर थे।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर साबित करता है कि हम यह ऑडिट करने के लिए कि AI स्किल्स सच बोल रही हैं या नहीं, स्वचालित रूप से जांच कर सकते हैं। "रिज्यूमे" (वे क्या कहते हैं) की तुलना उनके "काम" (वे क्या करते हैं) से करके, हम लापरवर डेवलपर्स (जिन्हें बस अपने कागजी काम को ठीक करने की आवश्यकता है) को वास्तविक हैकर्स (जो हमारा डेटा चुराने की कोशिश कर रहे हैं) से अलग कर सकते हैं।

यह सिस्टम केवल यह नहीं कहता कि "यह बुरा है"; बल्कि यह बताता है कि क्यों (जैसे, "यह एक डॉक्यूमेंटेशन त्रुटि है" बनाम "यह एक डेटा चोरी की चेन है"), जिससे सुरक्षा टीमों को यह तय करने में मदद मिलती है कि उन्हें केवल अपडेट मांगना चाहिए या उस स्किल को तुरंत बैन कर देना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →