🤖 AI

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry एक नवीन इन्फरेंस-टाइम डिफेंस फ्रेमवर्क है जो टेम्पोरल कॉज़ल टेकओवर्स के रूप में हमलों को मॉडल करके, काउंटरफैक्चुअल री-एग्जीक्यूशन का उपयोग करके दुर्भावनापूर्ण विचलन को स्थानीयकृत करने और उपयोगिता को संरक्षित करते हुए सुरक्षित टास्क निष्पादन को बहाल करने के लिए कॉज़ली गाइडेड कॉन्टेक्स्ट प्यूरिफिकेशन का उपयोग करके, एलएलएम एजेंटों में इनडायरेक्ट प्रॉम्प्ट इंजेक्शन को कम करता है।

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu (…)2026-02-27
💬 NLP

Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent

यह शोध पत्र SALA को प्रस्तुत करता है, जो एक स्टाइलोमेट्री-सहायता प्राप्त (stylometry-assisted) LLM एजेंट फ्रेमवर्क है, जो समाचार लेखों में लेखक के अनामिकता निवारण (authorship deanonymization) के जोखिमों का मूल्यांकन करता है और इन जोखिमों को प्रभावी ढंग से कम करने के साथ-साथ पाठ्य अर्थ को संरक्षित करने के लिए एक निर्देशित पुनर्संरचना (guided recomposition) रणनीति प्रस्तावित करता है।

Boyang Zhang, Yang Zhang2026-02-27
💻 computer science

Decomposing Private Image Generation via Coarse-to-Fine Wavelet Modeling

यह शोध पत्र एक दो-चरणीय स्पेक्ट्रल डिफरेंशियल प्राइवेसी फ्रेमवर्क प्रस्तावित करता है जो संवेदनशील छवि संरचनाओं के लिए गोपनीयता बनाए रखने हेतु लो-फ्रीक्वेंसी वेवलेट गुणांकों पर एक मॉडल को फाइन-ट्यून करता है और साथ ही उच्च-आवृत्ति विवरणों के लिए सार्वजनिक सुपर-रिज़ॉल्यूशन मॉडलों का लाभ उठाता है, जिससे मानक डीपी विधियों की तुलना में बेहतर छवि गुणवत्ता प्राप्त होती है।

Jasmine Bayrooti, Weiwei Kong, Natalia Ponomareva, Carlos Esteves, Ameesh Makadia, Amanda Prorok2026-02-27
💻 computer science

Minimal Cascade Gradient Smoothing for Fast Transferable Preemptive Adversarial Defense

यह शोध पत्र मिनिमल सफीशिएंट प्रीएम्प्टिव डिफेंस (MSPD) का प्रस्ताव करता है, जो मिनिमल कैस्केड ग्रेडिएंट स्मूथिंग (MCGS) द्वारा संचालित एक तेज़ और हस्तांतरणीय (transferable) एडवर्सरियल डिफेंस फ्रेमवर्क है, जो लक्षित मॉडल तक पहुँच की आवश्यकता के बिना मानक और एडेप्टिव दोनों हमलों के विरुद्ध गति और मजबूती में पूर्ववर्ती विधियों से काफी बेहतर प्रदर्शन करता है।

Hanrui Wang, Ching-Chun Chang, Chun-Shien Lu, Ching-Chia Kao, Shuo Wang, Isao Echizen2026-02-26
🤖 machine learning

Blameless Users in a Clean Room: Defining Copyright Protection for Generative Models

यह शोधपत्र जनरेटिव मॉडल्स में कॉपीराइट उल्लंघन को रोकने के लिए 'नियर एक्सेस-फ्रीनेस' (near access-freeness) की पर्याप्तता का खंडन करता है और एक नया "निर्दोष" (blameless) ढांचा प्रस्तावित करता है जो "क्लीन-रूम कॉपीराइट प्रोटेक्शन" पर केंद्रित है, जिसे औपचारिक रूप से यह दिखाया गया है कि जब इसे डिडुप्लिकेटेड डेटासेट्स पर लागू किया जाता है तो यह डिफरेंशियल प्राइवेसी द्वारा गारंटीकृत होता है।

Aloni Cohen2026-02-26
🤖 machine learning

Federated Learning in Offline and Online EMG Decoding: A Privacy and Performance Perspective

यह अध्ययन ईएमजी (EMG) डिकोडिंग के लिए फेडरेटेड लर्निंग का मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि यह गोपनीयता लाभ और बेहतर ऑफलाइन प्रदर्शन प्रदान करता है, मानक एफएल (FL) दृष्टिकोण मानव-डिकोडर सह-अनुकूलन (human-decoder co-adaptation) से उत्पन्न अप्रत्याशित प्रदर्शन तनावों के कारण वास्तविक समय के ऑनलाइन परिवेश में महत्वपूर्ण चुनौतियों का सामना करते हैं।

Kai Malcolm, César Uribe, Momona Yamagami2026-02-26
💻 computer science

Silent Until Sparse: Backdoor Attacks on Semi-Structured Sparsity

यह शोध पत्र "साइलेंट अनटिल स्पार्स" (SUS) को पेश करता है, जो एक नवीन बैकडोर हमला है जो प्रून किए गए भार (weights) में एक छिपे हुए ट्रिगर को एम्बेड करने के लिए अनुमानित 2:4 सेमी-स्ट्रक्चर्ड स्पर्सिटी तंत्र का लाभ उठाता है और इसे डेंस मॉडल में मास्क करता है, जिससे यह सुनिश्चित होता है कि हमला केवल स्पर्सिफिकेशन के बाद सक्रिय होता है और मानक सुरक्षा उपायों एवं फाइन-ट्यूनिंग के विरुद्ध सुदृढ़ बना रहता है।

Wei Guo, Fabio Brau, Maura Pintor, Ambra Demontis, Battista Biggio2026-02-26
🤖 AI

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

यह शोधपत्र यह प्रदर्शित करता है कि एआई एजेंटों के लिए वर्तमान निगरानी-आधारित रक्षा प्रणालियाँ मौलिक रूप से नाजुक हैं और उन्हें "एजेंट-एज़-अ-प्रॉक्सी" हमलों द्वारा बायपास किया जा सकता है, जहाँ दुर्भावनापूर्ण एजेंट फ्रंटियर-स्केल ओवरसाइट मॉडल्स से भी बचने के लिए प्रॉम्प्ट इंजेक्शन डिलीवर करने हेतु अपनी स्वयं की क्षमताओं का शोषण करते हैं।

Jafar Isbarov, Murat Kantarcioglu2026-02-26
🤖 machine learning

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

यह शोधपत्र SkillInject प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रदर्शित करता है कि वर्तमान फ्रंटियर LLM एजेंट कौशल-आधारित प्रॉम्प्ट इंजेक्शन हमलों के प्रति अत्यधिक संवेदनशील हैं, जिससे यह स्पष्ट होता है कि सरल स्केलिंग या फ़िल्टरिंग अपर्याप्त है और मजबूत सुरक्षा के लिए संदर्भ-जागरूक प्राधिकरण ढांचे (context-aware authorization frameworks) की आवश्यकता है।

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko2026-02-26
💬 NLP

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

यह शोध पत्र EPSVec को प्रस्तुत करता है, जो एक डिफरेंशियल-प्राइवेट फ्रेमवर्क है जो LLMs को निर्देशित करने के लिए डेटासेट वेक्टर्स को निकालने और उन्हें सैनिटाइज करने के माध्यम से उच्च-गुणवत्ता वाला सिंथेटिक डेटा कुशलतापूर्वक उत्पन्न करता है, जिससे गोपनीयता लागत को जनरेशन वॉल्यूम से अलग किया जाता है और कम डेटा वाले परिदृश्यों में काफी कम कम्प्यूटेशनल ओवरहेड के साथ मौजूदा तरीकों से बेहतर प्रदर्शन किया जाता है।

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Pra (…)2026-02-26