🤖 machine learning

Exponential-Family Membership Inference: From LiRA and RMIA to BaVarIA

यह शोध पत्र प्रमुख मेंबरशिप इन्फरेंस हमलों (LiRA, RMIA, और BASE) को एक एकल एक्सपोनेंशियल-फैमिली लॉग-लाइक्लीहुड रेशियो फ्रेमवर्क के तहत एकीकृत करता है और BaVarIA पेश करता है, जो एक बायेसियन वेरिएंस इन्फरेंस विधि है जो मौजूदा दृष्टिकोणों की तुलना में, विशेष रूप से कम-संसाधन और ऑफलाइन सेटिंग्स में, स्थिर और बेहतर प्रदर्शन प्राप्त करती है।

Rickard Brännvall2026-03-13
🤖 AI

The Mirror Design Pattern: Strict Data Geometry over Model Scale for Prompt Injection Detection

यह शोध पत्र "मिरर" (Mirror) का परिचय देता है, जो एक डेटा-क्यूरेशन डिज़ाइन पैटर्न है जो बड़े न्यूरल मॉडलों की तुलना में प्रॉम्प्ट इंजेक्शन स्क्रीनिंग के लिए बेहतर गति, नियतता (determinism) और पहचान सटीकता प्राप्त करने के लिए एक कड़ाई से क्यूरेट की गई 32-सेल टोपोलॉजी और एक हल्के रैखिक SVM का उपयोग करता है, जो यह प्रदर्शित करता है कि प्रारंभिक रक्षा परतों के लिए सख्त डेटा ज्यामिति मॉडल के पैमाने की तुलना में अधिक महत्वपूर्ण है।

J Alex Corll2026-03-13
🤖 AI

Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks

यह शोध पत्र व्यवस्थित रूप से इस बात का मूल्यांकन करता है कि कैसे नवीनतम संस्करणों सहित नौ लार्ज लैंग्वेज मॉडल्स, अक्सर सौम्य कार्यों को करते समय भी उपयोगकर्ता द्वारा दिए गए हानिकारक कंटेंट को संसाधित करने से इनकार करने में विफल रहते हैं, जो एक महत्वपूर्ण कंटेंट-स्तरीय नैतिक भेद्यता को प्रकट करता है जिसे वर्तमान सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) अनदेखा कर देता है।

Junjie Chu, Yiting Qu, Ye Leng, Michael Backes, Yun Shen, Savvas Zannettou, Yang Zhang2026-03-13
🤖 AI

Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models

यह शोध पत्र डिलेड बैकडोर अटैक्स (DBA) को प्रस्तुत करता है, जो एक नवीन खतरा प्रतिमान (threat paradigm) है जो ट्रिगर एक्सपोज़र को एक अस्थायी आयाम के माध्यम से दुर्भावनापूर्ण सक्रियण से अलग करता है, जिससे सामान्य शब्दों को ट्रिगर्स के रूप में उपयोग करना सक्षम होता है और DND प्रोटोटाइप की व्यवहार्यता को प्रदर्शित करता है जो वर्तमान सुरक्षा प्रणालियों से बचते हुए, सक्रिय होने से पहले सुप्त रहता है और लगभग पूर्ण हमले की सफलता दर प्राप्त करता है।

Zikang Ding, Haomiao Yang, Meng Hao, Wenbo Jiang, Kunlan Xiang, Runmeng Du, Yijing Liu, Ruichen Zhang, Dusit Niyato2026-03-13
💻 computer science

Credibility Matters: Motivations, Characteristics, and Influence Mechanisms of Crypto Key Opinion Leaders

13 क्रिप्टो की ओपिनियन लीडर्स (Key Opinion Leaders) के साक्षात्कारों और आत्म-निर्धारण सिद्धांत (self-determination theory) पर आधारित, यह अध्ययन विश्वसनीयता को एक स्थिर प्रमाणपत्र के रूप में नहीं, बल्कि एक गतिशील, नैतिक रूप से क्रियान्वित अभ्यास के रूप में पुनर्व्याख्या करता है जो आत्म-नियमन, सीमित सक्षमता, जवाबदेही और प्रतिवर्ती सुधार द्वारा अभिलक्षित है, जो उच्च-जोखिम वाले वेब3 (Web3) पारिस्थितिक तंत्रों में नेविगेट करने के लिए अत्यंत महत्वपूर्ण है।

Alexander Kropiunig, Svetlana Kremer, Bernhard Haslhofer2026-03-13
🤖 AI

Cascade: Composing Software-Hardware Attack Gadgets for Adversarial Threat Amplification in Compound AI Systems

यह शोध पत्र "कैस्केड" (Cascade) का परिचय देता है, जो एक ऐसा ढांचा है जो यह प्रदर्शित करता है कि कैसे पारंपरिक सॉफ्टवेयर और हार्डवेयर कमजोरियों को LLM-विशिष्ट एल्गोरिद्मिक खामियों के साथ संयोजित करके प्रतिकूल खतरों को बढ़ाया जा सकता है और कंपाउंड AI सिस्टम की अखंडता और गोपनीयता से समझौता किया जा सकता है।

Sarbartha Banerjee, Prateek Sahu, Anjo Vahldiek-Oberwagner, Jose Sanchez Vicarte, Mohit Tiwari2026-03-13
💻 computer science

Cluster-Aware Attacks on Graph Watermarks

यह शोध पत्र ग्राफ वॉटरमार्किंग पर क्लस्टर-अवेयर हमलों का पहला व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि समुदायों की संरचना का लाभ उठाकर रणनीतिक रूप से किनारों (edges) को संशोधित करने वाले हमलावर, समान संरचनात्मक विरूपण के साथ एट्रिब्यूशन सटीकता को काफी कम कर सकते हैं, जिससे उन वर्तमान योजनाओं की भेद्यता उजागर होती है जो केवल रैंडम परटर्बेशन रक्षाओं पर निर्भर करती हैं।

Alexander Nemecek, Emre Yilmaz, Erman Ayday2026-03-12
🤖 AI

Differential Privacy in Machine Learning: A Survey from Symbolic AI to LLMs

यह सर्वेक्षण मशीन लर्निंग में डिफरेंशियल प्राइवेसी का एक व्यापक अवलोकन प्रदान करता है, जो प्रतीकात्मक एआई (सिंबोलिक एआई) से लेकर लार्ज लैंग्वेज मॉडल्स तक इसके सैद्धांतिक विकास का पता लगाता है, गोपनीयता-संरक्षण प्रशिक्षण के लिए एकीकरण विधियों का परीक्षण करता है, और व्यावहारिक मूल्यांकन तकनीकों को रेखांकित करता है।

Francisco Aguilera-Martínez, Fernando Berzal2026-03-12
🤖 AI

Adversarial Hubness Detector: Detecting Hubness Poisoning in Retrieval-Augmented Generation Systems

यह शोध पत्र हबस्कैन (Hubscan) का परिचय देता है, जो एक ओपन-सोर्स सुरक्षा स्कैनर है जो रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में हबनेस पॉइजनिंग हमलों की पहचान करने और उन्हें कम करने के लिए मल्टी-डिटेक्टर आर्किटेक्चर का उपयोग करता है, और विभिन्न वेक्टर डेटाबेस एवं वास्तविक दुनिया के बेंचमार्क में प्रतिकूल हब्स (adversarial hubs) का पता लगाने में उच्च रिकॉल दर प्राप्त करता है।

Idan Habler, Vineeth Sai Narajala, Stav Koren, Amy Chang, Tiffany Saade2026-03-12
💻 computer science

Kraken: Higher-order EM Side-Channel Attacks on DNNs in Near and Far Field

यह शोध पत्र "Kraken" को प्रस्तुत करता है, जो एक नवीन उच्च-क्रम (higher-order) इलेक्ट्रोमैग्नेटिक साइड-चैनल हमला है जो निकट क्षेत्र (near field) में विशेष GPU टेंसर कोर से DNN मापदंडों को सफलतापूर्वक निकाल लेता है और 100 सेमी की दूरी से लार्ज लैंग्वेज मॉडल्स (LLMs) से महत्वपूर्ण वेट लीकेज (weight leakage) प्रदर्शित करता है, जो इस बात का पहला प्रमाण है कि ऐसे विशेष हार्डवेयर को भौतिक साइड-चैनल के माध्यम से समझौता किया गया है।

Peter Horvath, Ilia Shumailov, Lukasz Chmielewski, Lejla Batina, Yuval Yarom2026-03-12