← नवीनतम पेपर
🤖 AI

Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach

यह शोध पत्र प्रोग्रेसिव लोडिंग-अवेयर हिरार्किकल कॉन्ट्रास्टिव लर्निंग (PL-HCL) को प्रस्तुत करता है, जो एक LLM-आधारित फ्रेमवर्क है जो एजेंट स्किल्स के विवरणों और वास्तविक व्यवहारों के बीच क्रॉस-लेयर मिसअलाइनमेंट का प्रभावी ढंग से पता लगाता है, जिससे ओपन-सोर्स स्किल्स के एक बड़े पैमाने के डेटासेट पर मैक्रो-F1 स्कोर में 0.45 से 0.87–0.89 तक की महत्वपूर्ण वृद्धि प्राप्त होती है।

मूल लेखक: Chengjun Zhang, Yang Gao, Jianna Hur, Jingjing Zhang, Sagar Samtani

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chengjun Zhang, Yang Gao, Jianna Hur, Jingjing Zhang, Sagar Samtani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "एजेंट स्किल्स" (Agent Skills) के लिए एक डिजिटल मार्केटप्लेस ब्राउज़ कर रहे हैं। ये छोटे, पुन: प्रयोज्य (reusable) रोबोट सहायक की तरह हैं जिन्हें आप अपने AI को स्मार्ट बनाने के लिए डाउनलोड कर सकते हैं। आप "सुपर सेफ प्रोडक्टिविटी असिस्टेंट" (Super Safe Productivity Assistant) नाम का एक स्किल देखते हैं। इसका विवरण एकदम सटीक लग रहा है, है ना? लेकिन क्या होगा अगर, कोड की गहराई में छिपा हुआ, वही स्किल वास्तव में आपके पासवर्ड चुराने की कोशिश करने वाला एक चालाक जासूस या आपके सभी नियमों को अनदेखा करने वाला एक अराजक रोबोट हो?

यह क्रॉस-लेयर मिसअलाइनमेंट (Cross-Layer Misalignment) की समस्या है। यह एक ऐसे खिलौने को खरीदने जैसा है जिसके डिब्बे पर लिखा है "महल बनाएगा", लेकिन जब आप उसे खोलते हैं, तो निर्देश कहते हैं "घर को ध्वस्त करो", और उसकी ईंटें वास्तव में लावा से बनी हैं।

जासूस की नई सुपरपावर

इंडियाना यूनिवर्सिटी ब्लूमिंगटन के शोधकर्ताओं ने महसूस किया कि वर्तमान AI मॉडल यह पहचानने में बहुत खराब हैं कि स्किल को वास्तव में चलाने से पहले "डिब्बे बनाम सामग्री" (box vs. contents) के बीच क्या अंतर है। उन्होंने यह देखने की कोशिश की कि क्या मानक AI मॉडल (यानी "बेस" मॉडल) केवल विवरण को पढ़कर यह अनुमान लगा सकते हैं कि वह झूठ बोल रहा है या नहीं। परिणाम? बिल्कुल भी नहीं। यहाँ तक कि सबसे स्मार्ट साइबर सुरक्षा-प्रशिक्षित मॉडल भी ज्यादातर "यह सुरक्षित है" ही बताते थे क्योंकि अधिकांश स्किल्स सुरक्षित होते हैं, जिससे वे झूठ बोलने वालों को पकड़ने में विफल रहे। वे कठिन मामलों में लगभग 45% सटीकता प्राप्त कर सके, जो मूल रूप से एक सिक्के के उछाल (coin flip) जैसा ही था।

इसलिए, टीम ने PL-HCL (प्रोग्रेसिव लोडिंग-अवेयर हिरार्किकल कॉन्ट्रास्टिव लर्निंग) नामक एक नया प्रशिक्षण तरीका बनाया। इसे AI के लिए एक "सत्य-प्रशिक्षण शिविर" (Truth-Training Camp) समझें।

यह प्रशिक्षण शिविर कैसे काम करता है

पूरे पैकेज को एक बार में पढ़ने के बजाय, AI दो चरणों में सीखता है, जो ठीक वैसे ही है जैसे एक इंसान किसी स्किल का निरीक्षण करता है:

  1. चरण 1: "टीज़र" दृश्य (The "Teaser" View)। AI पहले "डिब्बे" (मेटाडेटा और विवरण) और "निर्देश पुस्तिका" (प्रक्रियात्मक चरणों) को देखता है। यह इन स्किल्स की भाषा और प्रारूप को सीखता है।
  2. चरण 2: "पूर्ण प्रकटीकरण" दृश्य (The "Full Reveal" View)। फिर, AI को "वास्तविक ईंटें" (कोड, स्क्रिप्ट और संसाधन) देखने को मिलती हैं।

जादू प्रशिक्षण के दौरान होता है। शोधकर्ताओं ने केवल AI को वास्तविक स्किल्स ही नहीं दिखाए। उन्होंने "नकली पहचानो" (Spot the Fake) का एक खेल बनाया।

  • असली चीज़ (The Real Deal): उन्होंने AI को एक ऐसा स्किल दिखाया जहाँ विवरण कोड से मेल खाता था।
  • बदलाव (The Swap): उन्होंने एक "सेफ असिस्टेंट" के विवरण को लिया और उसे एक "वायरस" के कोड पर चिपका दिया।
  • झूठ (The Lie): उन्होंने एक "सेफ असिस्टेंट" का विवरण लिया और उसे थोड़ा बढ़ा-चढ़ाकर या गलत तरीके से पेश किया, जबकि कोड को वैसा ही रखा।

AI को यह सीखना था कि "असली चीज़" एक मिलान है, लेकिन "बदलाव" और "झूठ" मिसअलाइनमेंट (mismatch) हैं। इसने सतह पर मौजूद "दावे" की गहराई में मौजूद "साक्ष्य" के साथ तुलना करना सीखा।

परिणाम: सिक्के के उछाल से जासूस तक

जब उन्होंने इस नए तरीके का परीक्षण 1,400 से अधिक वास्तविक दुनिया के स्किल्स (जिनमें 294 वास्तव में मिसअलाइन्ड थे) के "चैलेंज सेट" पर किया, तो परिणाम एक बड़ी छलांग थे।

  • प्रशिक्षण से पहले: सबसे अच्छे बेस मॉडल केवल लगभग 14% मिसअलाइन्ड स्किल्स को सही ढंग से पहचान सके (एक मीट्रिक जिसे F1 कहा जाता है। वे ज्यादातर झूठ बोलने वालों को अनदेखा कर रहे थे।
  • PL-HCL प्रशिक्षण के बाद: झूठ पकड़ने की AI की क्षमता आसमान छूकर 78% से 81% (उपयोग किए गए विशिष्ट AI मॉडल के आधार पर) तक पहुँच गई। सुरक्षा और सटीकता के बीच संतुलन का समग्र "स्कोर" लगभग 0.52 से बढ़कर 0.87–0.89 हो गया।

पेपर दिखाता है कि केवल AI को इन स्किल्स के फॉर्मेट को समझने के लिए सिखाना (चरण 1) पर्याप्त नहीं था; वह अभी भी झूठ नहीं पकड़ सकता था। उसे वास्तव में मिसअलाइनमेंट को समझने के लिए विशेष "नकली पहचानो" प्रशिक्षण (चरण 2) की आवश्यकता थी।

इसका क्या अर्थ है (और क्या नहीं है)

लेखक सुझाव देते हैं कि यह प्री-एग्जीक्यूशन स्क्रीनिंग (pre-execution screening) के लिए एक शक्तिशाली नया उपकरण है। एक प्लगइन की कल्पना करें जो आपके कंप्यूटर को स्कैन करता है और एक स्किल को डाउनलोड करने से पहले चेक करता है कि क्या "डिब्बा" उसके "सामग्री" से मेल खाता है। यदि वे मेल नहीं खाते हैं, तो यह चेतावनी देता है: "हे, यह विवरण 'टाइपस्क्रिप्ट हेल्पर' कहता है, लेकिन कोड वास्तव में किसी रैंडम वेबसाइट से रेसिपी डाउनलोड करने की कोशिश कर रहा है!"

हालाँकि, पेपर इस बारे में बहुत स्पष्ट है कि यह क्या नहीं करता है:

  • यह कोड को रन (run) नहीं करता है। यह यह नहीं देख सकता कि स्किल चलते समय आपके कंप्यूटर को नुकसान पहुँचा रहा है या नहीं। यह केवल उपलब्ध फाइलों और टेक्स्ट को देखता है जो "एग्जीक्यूट" बटन दबाने से पहले मौजूद हैं।
  • यह हर सुरक्षा समस्या को हल नहीं करता है। यह विशेष रूप से उस मिसअलाइनमेंट को लक्षित करता है जो जो वादा किया गया है और जो दिया गया है, उसके बीच होता है।
  • परिणाम SkillsMP और GitHub नामक प्लेटफॉर्म के ओपन-सोर्स स्किल्स के एक विशिष्ट डेटासेट पर आधारित हैं। लेखक नोट करते हैं कि हमें अभी तक यह नहीं पता कि क्या यह क्लोज्ड, प्राइवेट या एंटरप्राइज स्किल्स के लिए भी इसी तरह काम करता है।

संक्षेप में, पेपर सुझाव देता है कि AI को "दावों को साक्ष्य के साथ मिलाने" के कठोर खेल को सिखाकर, हम भविष्य के डिजिटल टूल्स के लिए एक बहुत बेहतर फ़िल्टर बना सकते हैं, जो झूठ बोलने वालों को उनके चलने से पहले ही पकड़ ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →