🤖 machine learning

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

यह शोध पत्र पर्सोना-कंडीशन्ड एडवरसैरियल प्रॉम्प्टिंग (PCAP) को प्रस्तुत करता है, जो एक रेड-टीमिंग फ्रेमवर्क है जो ट्रांसफर करने योग्य जेलब्रेक्स खोजने और समृद्ध, मेटाडेटा-युक्त डेटासेट उत्पन्न करने के लिए विविध हमलावर पर्सोना का लाभ उठाता है, जिससे प्रभावी स्वचालित संरेखण सक्षम होता है और लक्षित फाइन-ट्यूनिंग के माध्यम से मॉडल की मजबूती में महत्वपूर्ण सुधार होता है।

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith2026-05-13
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

यह शोध पत्र बिहेवियरल इंटीग्रिटी वेरिफिकेशन (BIV) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एआई एजेंट के घोषित और वास्तविक क्षमताओं के बीच विसंगतियों का पता लगाने के लिए डिटरमिनिस्टिक कोड विश्लेषण को एलएलएम-सहायता प्राप्त निष्कर्षण (LLM-assisted extraction) के साथ जोड़ता है, यह प्रकट करते हुए कि जबकि अधिकांश विचलन दुर्भावना के बजाय डेवलपर की चूक से उत्पन्न होते हैं, यह प्रणाली प्रभावी रूप से दुर्भावनापूर्ण खतरों की पहचान करती है और बड़े पैमाने के बेंचमार्क पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करती है।

Yuhao Wu, Tung-Ling Li, Hongliang Liu2026-05-13
🤖 AI

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

यह शोध पत्र IPI-proxy को पेश करता है, जो एक इंटरसेप्टिंग प्रॉक्सी का उपयोग करने वाला एक ओपन-सोर्स टूलकिट है जो व्हाइटलिस्टेड डोमेन से HTTP रिस्पॉन्स को इंडायरेक्ट प्रॉम्प्ट इंजेक्शन पेलोड्स की एक विविध लाइब्रेरी के साथ गतिशील रूप से पुनर्गठित (rewrite) करता है, जिससे मॉक पेजों पर निर्भर रहे बिना उत्पादन-समान वातावरण में वेब-ब्राउज़िंग AI एजेंटों की यथार्थवादी और पुनरुत्पादक रेड-टीमिंग सक्षम होती है।

Chia-Pei (Janet), Chen, Kentaroh Toyoda, Anita Lai, Alex Leung2026-05-13
🤖 AI

Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems

यह शोध पत्र प्रोटियस (Proteus) को प्रस्तुत करता है, जो एक स्व-विकसित रेड-टीम फ्रेमवर्क है जो यह प्रदर्शित करता है कि वर्तमान कौशल जांच प्रणालीएं सुरक्षा जोखिमों का काफी कम आकलन करती हैं, यह प्रकट करते हुए कि कैसे अनुकूलनशील, फीडबैक-संचालित हमलावर घातक एजेंट कौशल वेरिएंट बनाने के लिए ऑडिट को बार-बार बायपास कर सकते हैं।

Zhaojiacheng Zhou2026-05-13
💻 computer science

A microservices-based endpoint monitoring platform with predictive NLP models for real-time security and hate-speech risk alerting

यह शोध पत्र एक स्केलेबल, माइक्रोसर्विसेज-आधारित प्लेटफॉर्म का प्रस्ताव करता है जो डेटा लीकेज, संदिग्ध व्यवहार और घृणास्पद भाषण (हेट स्पीच) के लिए रीयल-टाइम, एकीकृत अलर्टिंग प्रदान करने हेतु एंडपॉइंट टेलीमेट्री को प्रेडिक्टिव एनएलपी (NLP) मॉडल्स के साथ एकीकृत करता है।

Darlan Noetzold, Anubis Graciela De Moraes Rossetto, Juan Francisco De Paz Santana, Valderi Reis Quietinho Leithard2026-05-13
💬 NLP

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

यह शोध पत्र SkillSafetyBench प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रदर्शित करता है कि पुन: प्रयोज्य कौशल (reusable skills) और स्थानीय आर्टिफैक्ट्स (local artifacts) सौहार्दपूर्ण उपयोगकर्ता अनुरोधों से भी असुरक्षित एजेंट व्यवहार उत्पन्न कर सकते हैं, जिससे यह स्पष्ट होता है कि एजेंट की सुरक्षा केवल मॉडल-स्तरीय संरेखण (model-level alignment) पर ही नहीं, बल्कि इस बात पर भी महत्वपूर्ण रूप से निर्भर करती है कि मॉडल कौशलों की व्याख्या कैसे करते हैं और वर्कफ़्लो संदर्भों पर कितना भरोसा करते हैं।

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu2026-05-13
🤖 AI

The Deepfakes We Missed: We Built Detectors for a Threat That Didn't Arrive

यह स्थिति पत्र (position paper) तर्क देता है कि मशीन लर्निंग समुदाय का सार्वजनिक हस्तियों के डीपफेक का पता लगाने पर एक दशक लंबा ध्यान वास्तविकता से विचलित हो गया है, क्योंकि वास्तविक प्रमुख खतरे गैर-सहमति वाली अंतरंग छवियों, वॉयस-क्लोन घोटालों और भावनात्मक धोखाधड़ी में बदल गए हैं, जो एक महत्वपूर्ण बाधा उत्पन्न कर रहे हैं जिसके लिए अनुसंधान एजेंडों के तत्काल पुनर्संतुलन की आवश्यकता है।

Shaina Raza2026-05-13
🤖 machine learning

PrivacySIM: Evaluating LLM Simulation of User Privacy Behavior

यह शोध पत्र PrivacySIM को प्रस्तुत करता है, जो एक मूल्यांकन सुइट है जो 1,000 वास्तविक उपयोगकर्ता प्रतिक्रियाओं के विरुद्ध नौ फ्रंटियर LLMs का बेंचमार्क करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि पर्सोना कंडीशनिंग सिमुलेशन सटीकता में सुधार करती है, फिर भी वर्तमान मॉडल व्यक्तिगत गोपनीयता निर्णयों को निष्ठापूर्वक दोहराने में संघर्ष करते हैं, विशेष रूप से उन उपयोगकर्ताओं के लिए जिनका AI अनुभव उच्च है लेकिन घोषित गोपनीयता चिंताएं कम हैं।

James Flemings, Murali Annavaram2026-05-13
💻 computer science

ACTING: A Platform for Cyber Ranges Federation

यह शोध पत्र ACTING प्लेटफॉर्म को प्रस्तुत करता है, जो मानकीकृत परिदृश्य विवरण के लिए EDL-FG भाषा को प्रस्तुत करके, स्वचालित प्रदर्शन मूल्यांकन और स्कोरिंग तंत्र को लागू करके, और फेडरेटेड साइबर रेंज के माध्यम से मल्टी-डोमेन अभ्यासों को सक्षम करके इंटरऑपरेबल साइबर रक्षा प्रशिक्षण की आवश्यकता को संबोधित करता है।

Kyriakos Christou, Maria Michalopoulou, Stefano Taggi, Matteo Merialdo, Nikolai Stoianov, Vasilis Ieropoulos, Theofanis (…)2026-05-13
💻 computer science

ORCHID: Orchestrated Reduction Consensus for Hash-based Integrity in Distributed Ledgers

यह शोध पत्र ORCHID को प्रस्तुत करता है, जो एक नवीन जैव-प्रेरित (bio-inspired) सर्वसम्मति प्रोटोकॉल है जो वितरित लेजर्स में स्केलेबल, क्वांटम-संवर्धित बायज़ेंटाइन फॉल्ट टॉलरेंस प्राप्त करने के लिए न्यूरोसाइंटिफिक बाइंडिंग समस्या और कुरामोतो सिंक्रोनाइज़ेशन मॉडल को अनुकूलित करता है, जो PBFT जैसे पारंपरिक तंत्रों की तुलना में बेहतर अभिसरण गति (convergence speed) और संदेश जटिलता प्रदर्शित करता है।

Abraham Itzhak Weinberg2026-05-13