🤖 AI

Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs

यह शोधपत्र एक कमिट-ओपन प्रोटोकॉल प्रस्तावित करता है जो होस्टेड एलएलएम (LLM) में साइलेंट मॉडल प्रतिस्थापन (silent model substitution) का प्रभावी ढंग से पता लगाने के लिए स्पार्स ऑटोएनकोडर (SAE) फीचर ट्रेसेस के मर्कल-ट्री कमिटमेंट्स का उपयोग करता है, जो विविध एडेप्टिव हमलों को खारिज करते हुए न्यूनतम कम्प्यूटेशनल ओवरहेड बनाए रखते हुए मौजूदा प्रोब-आफ्टर-रिटर्न योजनाओं से बेहतर प्रदर्शन करता है।

Ziyang Liu2026-05-26
🤖 AI

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

यह सर्वेक्षण एजेंट वर्कफ़्लो के माध्यम से सुरक्षा, मजबूती, गोपनीयता और सुरक्षा जोखिमों का परीक्षण करके, मूल्यांकन मेट्रिक्स और बेंचमार्क को समेकित करके, और उच्च-जोखिम वाले परिनियोजन के लिए व्यावहारिक शमन रणनीतियों के साथ खुले चुनौतियों की रूपरेखा तैयार करके, भरोसेमंद एजेंटिक एआई सिस्टम बनाने के लिए एक व्यापक ढांचा प्रदान करता है।

Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, Dianzhi Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yiyi Chen, Ruoxi Jiang, I (…)2026-05-26
💻 computer science

Microbenchmarking Cloud Cryptographic Workloads for Privacy-Preserving Healthcare IoT

यह शोध पत्र AWS और Azure FaaS प्लेटफॉर्म पर मुख्य क्रिप्टोग्राफिक वर्कलोड के प्रदर्शन का मूल्यांकन करने वाला एक व्यापक माइक्रोबेंचमार्क अध्ययन प्रस्तुत करता है, जो स्वास्थ्य सेवा IoT डेटा को सुरक्षित करने के लिए इष्टतम, लागत प्रभावी सेटअप की पहचान करने हेतु CPU आर्किटेक्चर, प्रोग्रामिंग भाषाओं और इंस्टेंस कॉन्फ़िगरेशन के प्रभाव का विश्लेषण करता है।

Jeremiah L. Webb, Laxima Niure Kandel, Deepti Gupta, Lavanya Elluri2026-05-26
⚛️ quantum physics

Optimal Quantum Differential Privacy via Fisher Information Spectral Analysis

यह शोध पत्र क्वांटम डिफरेंशियल प्राइवेसी के लिए एक ज्यामिति-जागरूक (geometry-aware) ढांचे को स्थापित करता है जो आइसोट्रोपिक शोर (isotropic noise) को QFI आइजनस्ट्रक्चर (eigenstructure) के अनुरूप दिशा-निर्भर शोर से बदलने के लिए क्वांटम फिशर इंफॉर्मेशन की द्वैतता का लाभ उठाता है, जिससे मिनिमैक्स-इष्टतम गोपनीयता-उपयोगिता ट्रेड-ऑफ प्राप्त होता है और क्वांटम हार्डवेयर पर क्लासिकल बेसलाइन की तुलना में आदेशों-के-परिमाण (orders-of-magnitude) का सुधार प्रदर्शित होता है।

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye2026-05-26
💬 NLP

Extracting Training Data from Diffusion Language Models via Infilling

यह शोध पत्र "इनफिलिंग एक्सट्रैक्शन" (infilling extraction) को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि डिफ्यूजन लैंग्वेज मॉडल, ऑटोरिग्रेसिव मॉडलों की तुलना में प्रशिक्षण डेटा मेमोराइजेशन (memorization) के प्रति काफी अधिक संवेदनशील हैं, क्योंकि उनकी द्विदिश डिनोइजिंग (bidirectional denoising) क्षमताएं हमलावरों को एज-कंडीशन्ड मास्क (edge-conditioned masks) का उपयोग करके, रेडैक्टेड व्यक्तिगत पहचान योग्य जानकारी सहित, तीन गुना अधिक वर्बेटिम (verbatim) अनुक्रमों को निकालने की अनुमति देती हैं।

Yihan Wang, N. Asokan2026-05-26
🤖 machine learning

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

यह शोध पत्र Agent-ToM को प्रस्तुत करता है, जो एक लर्निंग-टू-मॉनिटर फ्रेमवर्क है जो छिपे हुए विश्वासों और इरादों का अनुमान लगाकर स्वायत्त (autonomous) LLM एजेंटों में गुप्त दुर्भावनापूर्ण व्यवहारों का पता लगाने के लिए थ्योरी-ऑफ-माइंड रीजनिंग और एक रीज़न-वेरिफाई-रिफाइन पाइपलाइन का लाभ उठाता है, जिससे यह मौजूदा अत्याधुनिक मॉनिटरिंग बेसलाइनों से बेहतर प्रदर्शन करता है।

Nesreen K. Ahmed, Nima Nafisi2026-05-26
💻 computer science

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

यह शोध पत्र सौहार्दपूर्ण (benign) और हानिकारक प्रॉम्प्ट्स के तहत Mixtral 8x7B-Instruct मॉडल के रूटिंग व्यवहार का विश्लेषण करता है, जो यह प्रकट करता है कि सुरक्षा-संबंधित विशेषज्ञ सक्रियण (expert activation) सूक्ष्म, गहराई-निर्भर और वितरित है न कि विशेषज्ञों के एक निश्चित समूह द्वारा नियंत्रित, जिसमें ग्रेडिएंट-आधारित हस्तक्षेप, सक्रियण-आधारित हस्तक्षेपों की तुलना में हानिकारक प्रतिक्रियाओं को कम करने में अधिक प्रभावी सिद्ध होते हैं।

Md Nurul Absar Siddiky2026-05-26
💻 computer science

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

यह शोधपत्र MEntA को प्रस्तुत करता है, जो एक क्वेरी-कुशल और सरोगेट-मुक्त मेंबरशिप इन्फरेंस अटैक है, जो केवल पाँच क्वेरी का उपयोग करके रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में संवेदनशील दस्तावेज़ों की उपस्थिति का पता लगाने के लिए प्राकृतिक भाषा एंटेलमेंट (natural-language entailment) का लाभ उठाता है और उच्च सटीकता के साथ मौजूदा तरीकों से काफी बेहतर प्रदर्शन करते हुए वर्तमान सुरक्षा प्रणालियों से बच निकलता है।

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang2026-05-26
💻 computer science

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

यह शोध पत्र "लॉग-सबस्ट्रेट प्रॉम्प्ट इंजेक्शन" (log-substrate prompt injection) हमलों की पहचान और मूल्यांकन करता है, जहाँ हमलावर एलएलएम-आधारित सुरक्षा कार्यों से समझौता करने के लिए हमलावर-नियंत्रित लॉग फ़ील्ड के भीतर दुर्भावनापूर्ण निर्देशों को समाहित करते हैं, यह प्रकट करते हुए कि जबकि बचाव जोखिम को कम करते हैं, वे खतरे को समाप्त करने में विफल रहते हैं, विशेष रूप से पर्सोना हाइजैकिंग और सारांशीकरण कार्यों के लिए।

Rohan Pandey, Archit Bhujang2026-05-26
💻 computer science

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

यह शोधपत्र एक ज़ीरो-शॉट जेलब्रेक डिफेंस फ्रेमवर्क प्रस्तावित करता है जो विविध प्रतिकूल सक्रियणों (adversarial activations) को सिम्युलेट करने के लिए अनसुपरवाइज्ड लेटेंट डायरेक्शन डिस्कवरी का उपयोग करता है और अनदेखे जेलब्रेक्स को इनकार (refusal) की ओर प्रभावी ढंग से मोड़ने के लिए एक पोटेंशियल-इंड्यूस्ड स्टीयरिंग फील्ड को प्रशिक्षित करता है, जबकि सौहार्दपूर्ण उपयोगिता (benign utility) को सुरक्षित रखता है।

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu2026-05-26