Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems
यह शोध पत्र SkillVetBench प्रस्तुत करता है, जो ओपन एजेंटिक स्किल इकोसिस्टम्स के लिए एक दो-चरणीय सुरक्षा बेंचमार्क है, जो उन दुर्भावनापूर्ण व्यवहारों का प्रभावी ढंग से पता लगाने और सत्यापन करने के लिए स्किल स्पेसिफिकेशन के सिमेंटिक विश्लेषण को एक इंस्ट्रुमेंटेड सैंडबॉक्स में रनटाइम निष्पादन के साथ जोड़ता है जिन्हें स्टैटिक विधियाँ मिस कर देती हैं।